VK сообщила о модели SESAME для нейросетевого шумоподавления
VK 2 сентября сообщила о результатах SESAME — экспериментальной модели улучшения качества речи, созданной студентами совместной мастерской НИУ ВШЭ и VK. Система построена на базе MP-SENet и использует разреженную смесь экспертов для обработки разных акустических режимов. Авторы также опубликовали код проекта на GitHub.
В SESAME сохранены энкодер, декодеры и конвейер спектрального преобразования MP-SENet, а часть стандартных полносвязных блоков трансформера заменена модулями MoE. Общая двунаправленная GRU формирует временной контекст, после чего четыре облегчённых эксперта обрабатывают признаки через отдельные двухслойные MLP. Для каждого частотно-временного токена активируются два эксперта.
Маршрутизатор получает не только локальные признаки, но и 64-мерный глобальный профиль записи, вычисленный из усреднённой по времени амплитудной спектрограммы. По объяснению авторов, это помогает учитывать общий характер зашумлённого сигнала. Профиль используется только при выборе экспертов и не передаётся в основной поток обработки.
Команда отказалась от стратегии Expert Choice, допускающей сброс части токенов при ограниченной ёмкости экспертов. В проведённых абляциях такая схема снизила PESQ с 3,52 до 3,38. В итоговой версии применяется Token Choice: каждый токен направляется ровно к двум экспертам, поэтому участки спектрограммы не остаются необработанными. MoE-модули размещены только в первых двух из четырёх TS-блоков — их установка во всех блоках также ухудшила результат.
Модель обучали на VoiceBank+DEMAND — корпусе из 11 572 обучающих и 824 тестовых пар, приведённых к частоте 16 кГц. После 400 эпох SESAME получила PESQ 3,64, CSIG 4,84, CBAK 4,04, COVL 4,37 и SSNR 10,93. По представленным авторами данным, это выше результатов PrimeK-Net, базовой MP-SENet и MP-SENet large в том же сравнении.
SESAME содержит 3,53 млн параметров, но при обработке одного токена активны 2,87 млн. Для MP-SENet large авторы приводят 3,59 млн общих и активных параметров. Заявление о почти 20-процентном сокращении относится именно к числу активных параметров относительно плотной модели сопоставимого размера, а не к непосредственно измеренной задержке, энергопотреблению или стоимости выполнения.
Практический контекст: Практически результаты показывают, что для аудиомоделей недостаточно напрямую перенести маршрутизацию, разработанную для языковых трансформеров: непрерывность частотно-временного представления требует гарантированной обработки каждого токена. При этом выводы пока ограничены одним корпусом и экспериментами самих разработчиков; независимое воспроизведение, тестирование на реальных устройствах и показатели скорости в публикации не приведены.
| Параметр | Значение |
|---|---|
| Базовая архитектура | MP-SENet |
| Эксперты | 4 |
| Активные эксперты на токен | 2 (Token Choice) |
| MoE-FFN | 4, в TSB₀ и TSB₁ |
| Профиль записи | 64-мерный, только для маршрутизатора |
| Всего параметров | 3,53 млн |
| Активные параметры | 2,87 млн |
| Конфигурация | PESQ | Изменение |
|---|---|---|
| SESAME: E=4, k=2, TSB₀–₁, Token Choice | 3,52 | — |
| Expert Choice | 3,38 | −0,14 |
| MoE во всех четырёх TS-блоках | 3,44 | −0,08 |
| E=8, k=2, TSB₀–₁ | 3,47 | −0,05 |
| E=16, k=4, TSB₀–₁ | 3,42 | −0,10 |
Ограничения представленных результатов
Все показатели сообщены авторами проекта по тестовому набору VoiceBank+DEMAND. Публикация не содержит независимого воспроизведения, измерений задержки, энергопотребления или испытаний в производственной среде.
Источники
Дата события: 2026-09-02. Дата первоисточника: 2026-09-02.