Яндекс открыл модель Alice AI‑T5‑35B‑A0.6B для быстрых ответов
11 сентября Яндекс сообщил об открытии базовой модели Alice AI‑T5‑35B‑A0.6B, обученной с нуля для генеративных ответов Алисы в Поиске. Внешние разработчики могут запускать её через Hugging Face Transformers. Оптимизированная система инференса, которую компания применяет в рабочей инфраструктуре, пока остаётся внутренней.
Модель сочетает архитектуру Encoder‑Decoder с разреженными слоями смеси экспертов. По данным Яндекса, претрейн проводился на 15 трлн токенов собственного корпуса с задачей UL2-денойзинга. Ближе к завершению обучения контекст расширили с 8K до 128K при помощи YaRN.
Компания объясняет выбор архитектуры требованиями поискового сценария: модели нужно быстро анализировать найденные документы. Первоначальная балансировка экспертов оказалась нестабильной — маршрутизация в энкодере разрушалась. После перехода на метод без вспомогательной функции потерь из DeepSeek‑V3, как утверждает Яндекс, проблемы со стабильностью исчезли.
Ещё одним элементом ускорения стал экстрактор информационных контекстов — BERT-подобная модель на 80 млн параметров, предварительно обученная на 4 трлн токенов. Она отбирает в найденных документах компактные фрагменты, полезные генератору ответа. По оценке Яндекса, сокращение числа входных токенов повысило пропускную способность примерно на 40% без потери качества.
Для настройки ответов команда использовала реальные поисковые запросы, отбор нескольких сгенерированных вариантов, исправление ответов по критике модели-судьи и RLHF. В обучение также включили агрегированные поведенческие сигналы, включая чтение ответа и продолжение поиска. Для снижения шума данные фильтровали, объединяли по повторным показам одинаковых запросов и разделяли с учётом типа устройства.
После одинаковой процедуры настройки Alice AI‑T5‑35B‑A0.6B, согласно опубликованному Яндексом сравнению, получила 77% побед против Qwen 3.5–2B, 54% против Qwen 3.5–4B и 69% против T5 Gemma 2.4B‑4B. В сравнении с Qwen 3.5–35B‑A3B показатель составил 44%. Это результаты слепой попарной разметки компании; независимое воспроизведение не приводится, а публичные тесты рассчитывались во внутренней инфраструктуре Яндекса.
Практический контекст: Публикация базовой модели даёт разработчикам возможность изучать сочетание Encoder‑Decoder и разреженной смеси экспертов, а также экспериментировать с длинным контекстом. Практически открытый вариант не воспроизводит весь поисковый продукт: быстрый ответ зависит также от поиска, отбора релевантных фрагментов, последующей настройки и внутреннего оптимизированного инференса.
Источники
Дата события: 2026-09-11. Дата первоисточника: 2026-09-11.