Сбер представил бенчмарк MERA Text 2.0 для оценки языковых моделей
Сбер 31 августа представил MERA Text 2.0 — новую версию бенчмарка для разработчиков и исследователей текстовых языковых моделей. Оценка пересобрана вокруг 12 тестов, разделённых на четыре группы: человекоцентричность, культурная специфика, агентные навыки и рассуждения. Публичный рейтинг прежней версии больше обновляться не будет.
Команда MERA объясняет обновление насыщением прежних задач: современные сильные модели приблизились к человеческой базовой линии, а на некоторых тестах превысили её. Из-за сжатия верхней части рейтинга старые задания хуже различали лидирующие модели, поэтому вместо добавления отдельных датасетов авторы изменили саму структуру оценки.
Человекоцентричная группа проверяет понимание загадок, механизмов юмора и характера собеседника. Культурный блок охватывает российские регионализмы, исправление реальных русскоязычных текстов и культурный код — от фольклора и поговорок до мемов, песен и кино. По данным команды, именно культурная специфика оставляет наибольшее пространство для улучшения и слабее других групп связана с общим уровнем модели.
Агентный раздел не измеряет автономного агента целиком. IFHardBench проверяет одновременное соблюдение трёх–шести формальных ограничений, SOBHard — преобразование и извлечение данных из документов, а GorillaHard — выбор инструмента и аргументов его вызова. Последний тест оценивает планирование обращения к инструменту, но не его фактическое выполнение.
В блок рассуждений вошли задачи на контекстные противоположные значения слов, логические ловушки и языковую неоднозначность. Все тестовые наборы закрыты от оцениваемых моделей, а для каждого теста предусмотрено не менее пяти формулировок инструкции. Авторы также фиксируют протоколы, параметры запуска и логи и не добавляют интеллектуальные агентные или reasoning-обвязки поверх модели.
Итоговый балл формируется в три этапа: сначала объединяются метрики внутри теста, затем тесты внутри группы и, наконец, результаты четырёх групп. На каждом уровне применяется геометрическое среднее; нулевые значения заменяются на 0,01, чтобы один провал не обнулял весь результат. Для корректного сравнения все модели требуется пересчитывать на одной версии набора.
Практический контекст: Практически новая структура полезнее единого усреднённого рейтинга: она позволяет отдельно увидеть, где модель теряет качество — в культурном контексте, строгом формате ответа или выборе инструментов. Однако MERA Text 2.0 не следует трактовать как комплексную проверку готового агента: длительные сценарии, взаимодействие со средами и сквозные рабочие конвейеры намеренно оставлены за пределами этой ветки.
Полный прогон сокращён с 23 датасетов и примерно 37 тысяч запросов до 12 датасетов и приблизительно 8700 запросов — в 4,3 раза по числу запросов. Старые отправки и их результаты сохраняются в личном кабинете, новые замеры принимаются прежним способом. На момент объявления технический отчёт ещё готовился; актуальные результаты команда рекомендует смотреть в обновляемом бенчмарке, а не в статической таблице.
| Группа | Тесты | Что проверяется |
|---|---|---|
| Human-Centric | Riddles, Humor, Characters | Метафоры, юмор, характер и контекст общения |
| Culture-Specific | RussianRegions, SAGE, RUBIN | Региональная лексика, коррекция текста и русский культурный код |
| Agentic | IFHardBench, SOBHard, GorillaHard | Инструкции, структурированные документы и выбор инструментов |
| Reasoning | Enantiosemy, NewReasoning, LIMUR | Контекст значений, логические задачи и языковая неоднозначность |
Источники
Дата события: 2026-08-31. Дата первоисточника: 2026-08-31.