Сбер открыл веса и код GigaChat 3.5 Reasoning
Сбер 10 сентября выпустил GigaChat 3.5 Reasoning — первую модель семейства GigaChat с полноценным рассуждением. Компания опубликовала веса и код запуска на Hugging Face, а также открыла доступ к модели на сайте giga.chat. Разработчикам предложены отдельные репозитории: версия FP8 предназначена для инференса, а BF16 — для дообучения или собственной квантизации.
Обучение строилось в несколько этапов. Сначала из контрольной точки после обучения с учителем создали шесть отдельных моделей по разным направлениям. Затем каждого эксперта независимо обучали с помощью online RL и собственной системы наград. На заключительном этапе шесть моделей объединили в одну методом дистилляции на данных действующей политики.
Эксперты специализировались на математике и естественных науках, обычных задачах программирования, работе с репозиториями, агентных сценариях, диалогах и следовании инструкциям. Способы проверки различались: математические ответы сравнивали с эталоном, код запускали, патчи тестировали, а в агентных задачах оценивали конечное состояние среды. По объяснению Сбера, разделение помогло избежать конкуренции доменов за одни веса и точнее настроить награду.
Для обучения применялся алгоритм CISPO, близкий к GRPO. В описании разработчиков CISPO не исключает токены, вероятность которых слишком сильно изменилась, а ограничивает их вклад. Это сохраняет обучающий сигнал для редких развилок рассуждения, когда модель замечает ошибку или возвращается к предыдущему шагу. Сбер сообщает, что на его экспертах CISPO сходился быстрее GRPO.
Компания также использовала динамический отбор сложности. Перед очередной стадией текущую версию прогоняли по всему пулу, после чего исключали задачи с долей успешных решений выше 75%. По оценке Сбера, отказ от генерации ответов для уже освоенных примеров сократил вычисления на этапе инференса во время обучения на 50%. Адаптивный штраф за длину при этом сильнее ограничивал избыточные рассуждения на простых задачах и слабее — на сложных.
В сравнении с GigaChat 3.5 Instant компания указывает рост результата GPQA-Diamond с 61,11 до 82,32, AIME-2026 mean@32 — с 67 до 92, а IFBench Loose Prompt — с 43,66 до 77,00. Это собственные результаты разработчика на выбранных им конфигурациях оценки; независимое воспроизведение в источнике не представлено.
Практический контекст: Разделение репозиториев позволяет выбрать между готовым инференсом и дальнейшей адаптацией модели. Однако переносимость результатов следует проверять на собственных сценариях: в этом выпуске эксперт для работы с реальными репозиториями обучался только через mini-SWE-agent, а большинство обычных задач по программированию были написаны на Python. Поэтому качество с другими агентными обвязками и языками из приведённых результатов не следует считать установленным.
| Эксперт | Основные задачи | Проверка результата |
|---|---|---|
| STEM | Математика, олимпиады, естественные науки | Сравнение финального ответа с эталоном |
| Code | Алгоритмы, правки кода, генерация тестов | Запуск кода |
| Code Agent | Задачи с реальным репозиторием | Тесты после применения патча |
| General Agent | Вызов функций, диалог, память, поиск | Проверка конечного состояния среды |
| Социальное взаимодействие | Диалог с пользователем | Попарная оценка языковой моделью-судьёй |
| Следование инструкциям | Форматы, длинный контекст, структурированный вывод | Сравнение финального ответа с эталоном |
| Репозиторий | Назначение |
|---|---|
| ai-sage/GigaChat3.5-432B-A28B-Reasoning | Инференс в FP8 |
| ai-sage/GigaChat3.5-432B-A28B-Reasoning-bf16 | Дообучение и собственная квантизация |
Источники
Дата события: 2026-09-10. Дата первоисточника: 2026-09-10.