Перейти к содержимому
-
  • https://www.facebook.com/
  • https://twitter.com/
  • https://t.me/
  • https://www.instagram.com/
  • https://youtube.com/
AI Feed AI Feed AI Feed

Новости ИИ, нейросетей, ChatGPT и AI-технологий

Подписаться
AI Feed AI Feed AI Feed

Новости ИИ, нейросетей, ChatGPT и AI-технологий

  • Новости ИИ
  • Промты
  • Блог
  • Радар нейросетей
  • Цены AI API
  • Локальные AI
  • AI и профессии

Рубрики

  • Anthropic и Claude
  • Google AI, Gemini и DeepMind
  • NVIDIA и искусственный интеллект
  • OpenAI и ChatGPT
  • Блог
  • Главные
  • Новости ИИ
  • Промты
  • Сравнения нейросетей

Последние новости

  • VK сообщила о модели SESAME для нейросетевого шумоподавления
  • Google добавляет в Gemini Notebook голосовой диалог и учебные обзоры
  • Google выпустила Gemini 3.8 Live для голосовых ИИ-приложений
  • СберТех описал MCP Gateway для корпоративных ИИ-агентов
  • Т-Банк выпустил руководство по четырём типам задач в Perseus
  • Новости ИИ
  • Промты
  • Блог
  • Радар нейросетей
  • Цены AI API
  • Локальные AI
  • AI и профессии
Подписаться
Закрыть

Поиск

Главная/Новости ИИ/VK сообщила о модели SESAME для нейросетевого шумоподавления
Иллюстрация к новости: VK сообщила о модели SESAME для нейросетевого шумоподавления
Новости ИИ

VK сообщила о модели SESAME для нейросетевого шумоподавления

Alex
От Alex
16.09.2026 2 Минут чтения
◉1уникальных читателей

VK 2 сентября сообщила о результатах SESAME — экспериментальной модели улучшения качества речи, созданной студентами совместной мастерской НИУ ВШЭ и VK. Система построена на базе MP-SENet и использует разреженную смесь экспертов для обработки разных акустических режимов. Авторы также опубликовали код проекта на GitHub.

В SESAME сохранены энкодер, декодеры и конвейер спектрального преобразования MP-SENet, а часть стандартных полносвязных блоков трансформера заменена модулями MoE. Общая двунаправленная GRU формирует временной контекст, после чего четыре облегчённых эксперта обрабатывают признаки через отдельные двухслойные MLP. Для каждого частотно-временного токена активируются два эксперта.

Маршрутизатор получает не только локальные признаки, но и 64-мерный глобальный профиль записи, вычисленный из усреднённой по времени амплитудной спектрограммы. По объяснению авторов, это помогает учитывать общий характер зашумлённого сигнала. Профиль используется только при выборе экспертов и не передаётся в основной поток обработки.

Команда отказалась от стратегии Expert Choice, допускающей сброс части токенов при ограниченной ёмкости экспертов. В проведённых абляциях такая схема снизила PESQ с 3,52 до 3,38. В итоговой версии применяется Token Choice: каждый токен направляется ровно к двум экспертам, поэтому участки спектрограммы не остаются необработанными. MoE-модули размещены только в первых двух из четырёх TS-блоков — их установка во всех блоках также ухудшила результат.

Модель обучали на VoiceBank+DEMAND — корпусе из 11 572 обучающих и 824 тестовых пар, приведённых к частоте 16 кГц. После 400 эпох SESAME получила PESQ 3,64, CSIG 4,84, CBAK 4,04, COVL 4,37 и SSNR 10,93. По представленным авторами данным, это выше результатов PrimeK-Net, базовой MP-SENet и MP-SENet large в том же сравнении.

SESAME содержит 3,53 млн параметров, но при обработке одного токена активны 2,87 млн. Для MP-SENet large авторы приводят 3,59 млн общих и активных параметров. Заявление о почти 20-процентном сокращении относится именно к числу активных параметров относительно плотной модели сопоставимого размера, а не к непосредственно измеренной задержке, энергопотреблению или стоимости выполнения.

Практический контекст: Практически результаты показывают, что для аудиомоделей недостаточно напрямую перенести маршрутизацию, разработанную для языковых трансформеров: непрерывность частотно-временного представления требует гарантированной обработки каждого токена. При этом выводы пока ограничены одним корпусом и экспериментами самих разработчиков; независимое воспроизведение, тестирование на реальных устройствах и показатели скорости в публикации не приведены.

Итоговая конфигурация SESAME
Параметр Значение
Базовая архитектура MP-SENet
Эксперты 4
Активные эксперты на токен 2 (Token Choice)
MoE-FFN 4, в TSB₀ и TSB₁
Профиль записи 64-мерный, только для маршрутизатора
Всего параметров 3,53 млн
Активные параметры 2,87 млн
Анализ вариантов маршрутизации после 100 эпох
Конфигурация PESQ Изменение
SESAME: E=4, k=2, TSB₀–₁, Token Choice 3,52 —
Expert Choice 3,38 −0,14
MoE во всех четырёх TS-блоках 3,44 −0,08
E=8, k=2, TSB₀–₁ 3,47 −0,05
E=16, k=4, TSB₀–₁ 3,42 −0,10
Ограничения представленных результатов

Все показатели сообщены авторами проекта по тестовому набору VoiceBank+DEMAND. Публикация не содержит независимого воспроизведения, измерений задержки, энергопотребления или испытаний в производственной среде.

Источники

  1. VK Tech

Дата события: 2026-09-02. Дата первоисточника: 2026-09-02.

Подписывайтесь на AI Feed в Telegram

Новые материалы об ИИ, практические разборы и сравнения инструментов — в одной удобной ленте.

Перейти в Telegram→
Alex
Автор

Alex

Редактор AI Feed. Специализируется на практическом контексте технологических новостей, продуктов и инструментов.

Подпишись на меня
Другие статьи
Иллюстрация к новости: Google добавляет в Gemini Notebook голосовой диалог и учебные обзоры
Назад

Google добавляет в Gemini Notebook голосовой диалог и учебные обзоры

Свежие записи

  • VK сообщила о модели SESAME для нейросетевого шумоподавления
  • Google добавляет в Gemini Notebook голосовой диалог и учебные обзоры
  • Google выпустила Gemini 3.8 Live для голосовых ИИ-приложений
  • СберТех описал MCP Gateway для корпоративных ИИ-агентов
  • Т-Банк выпустил руководство по четырём типам задач в Perseus

Свежие комментарии

Нет комментариев для просмотра.

Архивы

  • Сентябрь 2026
  • Май 2026

Рубрики

  • Anthropic и Claude
  • Google AI, Gemini и DeepMind
  • NVIDIA и искусственный интеллект
  • OpenAI и ChatGPT
  • Блог
  • Главные
  • Новости ИИ
  • Промты
  • Сравнения нейросетей

    © 2026 AI Feed. Все права защищены.
    RUEN
    О проектеРедакционная политикаИсточники и методологияИсправленияКонтактыКонфиденциальностьНастройки аналитики
    Аналитика AI Feed

    Помогает понять, какие материалы полезны. Рекламное отслеживание отключено.