Перейти к содержимому
-
  • Facebook
  • X
  • Telegram
  • Instagram
  • YouTube
AI Feed AI Feed AI Feed

Новости ИИ, нейросетей, ChatGPT и AI-технологий

Подписаться
AI Feed AI Feed AI Feed

Новости ИИ, нейросетей, ChatGPT и AI-технологий

  • Новости ИИ
  • Промты
  • Блог
  • Радар
  • API-цены
  • Локальный AI
  • Профессии

Рубрики

  • Anthropic и Claude
  • Google AI, Gemini и DeepMind
  • NVIDIA и искусственный интеллект
  • OpenAI и ChatGPT
  • Блог
  • Главные
  • Новости ИИ
  • Промты
  • Профессии
  • Сравнения нейросетей

Последние новости

  • Google показала применение Gemini в кейтеринге Edy’s Grocer
  • VK внедрила канареечную доставку снапшотов для подбора рекламы
  • Google показала четыре проекта разработчиков на Gemini 3.8 Flash
  • Google объединила закупку вертикального видео в Display & Video 360
  • Сколько стоит AI API в 2026 году: расчёт для чата, RAG и агентов
  • Новости ИИ
  • Промты
  • Блог
  • Радар
  • API-цены
  • Локальный AI
  • Профессии
Подписаться
Закрыть

Поиск

Главная/Новости ИИ/VK сообщила о FastWave для повышения дискретизации аудио до 48 кГц
Иллюстрация к новости: VK сообщила о FastWave для повышения дискретизации аудио до 48 кГц
Новости ИИ

VK сообщила о FastWave для повышения дискретизации аудио до 48 кГц

Kat
От Kat
20.09.2026 2 Минут чтения
◉3уникальных читателей

VK 16 сентября сообщила о FastWave — компактной диффузионной модели, которая расширяет полосу аудиосигнала с повышением частоты дискретизации до 48 кГц. Проект появился в совместной мастерской НИУ ВШЭ и VK, посвящённой сервисам и платформам ИИ. По данным разработчиков, модель может принимать аудио с разной исходной частотой дискретизации и оценивать недостающие высокочастотные компоненты.

FastWave насчитывает 1,3 млн параметров и требует 12,9 GFLOPs на один вызов. Основной режим использует четыре последовательных вызова, поэтому заявленная вычислительная сложность составляет около 50 GFLOPs. Взятая за основу NU-Wave 2 содержит 1,8 млн параметров, требует 19 GFLOPs на вызов и обычно выполняет восемь шагов генерации.

Для сокращения модели команда адаптировала к аудио методологию EDM: предсказание чистого сигнала вместо шума, зависимое от уровня шума масштабирование входов и выходов, логнормальное распределение уровней шума, взвешенную L2-функцию потерь и непрерывное расписание генерации. Обычные свёртки в архитектуре заменили разделяемыми и добавили Global Response Normalization для взаимодействия каналов. По оценке разработчиков, это уменьшило число параметров относительно NU-Wave 2 на 30% при сохранении качества реконструкции в проведённых ими экспериментах.

Модель обучали на речевом наборе VCTK, включающем 110 дикторов и около 44 часов записей с частотой дискретизации 48 кГц. Сто дикторов вошли в обучающую выборку, восемь — в тестовую. Команда проверяла повышение частоты дискретизации с 8, 12, 16 и 24 кГц до 48 кГц; обучение на одной NVIDIA V100 занимало до 30 часов.

В сравнении для преобразования 24→48 кГц FastWave с четырьмя шагами показала SNR 27,09 и LSD 0,93. У NU-Wave 2 с восемью шагами значения составили 27,68 и 0,78, а у FlowHigh с одним шагом — 27,80 и 0,74. Таким образом, FastWave не лидировала по этим метрикам, но была компактнее: 1,3 млн параметров против 49,4 млн у FlowHigh.

Практический контекст: Практически FastWave предлагает компромисс между компактностью, числом последовательных вычислений и измеренным качеством. Результаты указывают на потенциал для потоковой обработки речи на устройствах с GPU, однако источник не приводит испытаний на CPU, мобильных ускорителях, музыке или других типах аудио вне речевого набора VCTK. Все показатели опубликованы самой командой; независимое воспроизведение в материале не описано.

Разработчики опубликовали код и предварительно обученную контрольную точку на GitHub по ссылкам со страницы проекта. Они также сообщили, что научная статья с результатами FastWave принята на конференцию Interspeech 2026.

Качество повышения частоты дискретизации с 24 до 48 кГц по данным разработчиков
Модель NFE SNR ↑ LSD ↓
AudioSR 1 23,03 1,27
FlowHigh 1 27,80 0,74
NU-Wave 2 8 27,68 0,78
FastWave 4 27,09 0,93
FastWave 8 27,22 0,83
Ограниченный эксперимент при повышении частоты дискретизации с 8 до 48 кГц
Модель NFE SNR ↑ LSD ↓
NU-Wave 2, базовая 8 17,47 1,31
NU-Wave 2 + EDM 4 16,72 1,25
NU-Wave 2 + EDM 8 16,02 1,21
FastWave 4 18,49 1,22
FastWave 8 18,10 1,26
Как читать показатели сравнения

SNR обозначает отношение сигнала к шуму: большее значение считается лучшим. LSD измеряет расстояние между спектрами: меньшее значение считается лучшим. NFE показывает число последовательных вызовов модели при генерации.

Источники

  1. VK Tech

Дата события: 2026-09-16. Дата первоисточника: 2026-09-16.

Подписывайтесь на AI Feed в Telegram

Новые материалы об ИИ, практические разборы и сравнения инструментов — в одной удобной ленте.

Перейти в Telegram→

По теме

Продолжить чтение

Материалы по теме и практические инструменты AI Feed.
  1. 16.09.2026VK сообщила о модели SESAME для нейросетевого шумоподавления↗
  2. 29.09.2026Google показала четыре проекта разработчиков на Gemini 3.8 Flash↗
  3. 29.09.2026Google объединила закупку вертикального видео в Display & Video 360↗
  4. 24.09.2026Google добавила Live Avatar в Gemini 3.8 Live для предприятий↗
Как ИИ меняет IT-профессии→Радар AI-моделей→
Kat
Автор

Kat

Редактор AI Feed. Готовит новости на основе первичных источников и отвечает за ясное объяснение важных обновлений.

Подпишись на меня
Другие статьи
Иллюстрация к новости: xAI добавила межсессионную память в Grok Build
Назад

xAI добавила межсессионную память в Grok Build

Иллюстрация к новости: Anthropic открыла LSVP-доступ к Mythos 5.1, Opus 5 и Sonnet 5
Далее

Anthropic открыла LSVP-доступ к Mythos 5.1, Opus 5 и Sonnet 5

Свежие записи

  • Google показала применение Gemini в кейтеринге Edy’s Grocer
  • VK внедрила канареечную доставку снапшотов для подбора рекламы
  • Google показала четыре проекта разработчиков на Gemini 3.8 Flash
  • Google объединила закупку вертикального видео в Display & Video 360
  • Сколько стоит AI API в 2026 году: расчёт для чата, RAG и агентов

Свежие комментарии

Нет комментариев для просмотра.

Архивы

  • Сентябрь 2026
  • Май 2026

Рубрики

  • Anthropic и Claude
  • Google AI, Gemini и DeepMind
  • NVIDIA и искусственный интеллект
  • OpenAI и ChatGPT
  • Блог
  • Главные
  • Новости ИИ
  • Промты
  • Профессии
  • Сравнения нейросетей

    © 2026 AI Feed. Все права защищены.
    RUEN
    О проектеРедакционная политикаИсточники и методологияИсправленияКонтактыКонфиденциальностьНастройки аналитики
    Аналитика AI Feed

    Помогает понять, какие материалы полезны. Рекламное отслеживание отключено.