Перейти к содержимому
-
  • Facebook
  • X
  • Telegram
  • Instagram
  • YouTube
AI Feed AI Feed AI Feed

Новости ИИ, нейросетей, ChatGPT и AI-технологий

Подписаться
AI Feed AI Feed AI Feed

Новости ИИ, нейросетей, ChatGPT и AI-технологий

  • Новости ИИ
  • Промты
  • Блог
  • Радар
  • API-цены
  • Локальный AI
  • Профессии

Рубрики

  • Anthropic и Claude
  • Google AI, Gemini и DeepMind
  • NVIDIA и искусственный интеллект
  • OpenAI и ChatGPT
  • Блог
  • Главные
  • Новости ИИ
  • Промты
  • Профессии
  • Сравнения нейросетей

Последние новости

  • Google показала применение Gemini в кейтеринге Edy’s Grocer
  • VK внедрила канареечную доставку снапшотов для подбора рекламы
  • Google показала четыре проекта разработчиков на Gemini 3.8 Flash
  • Google объединила закупку вертикального видео в Display & Video 360
  • Сколько стоит AI API в 2026 году: расчёт для чата, RAG и агентов
  • Новости ИИ
  • Промты
  • Блог
  • Радар
  • API-цены
  • Локальный AI
  • Профессии
Подписаться
Закрыть

Поиск

Главная/Новости ИИ/Сбер представил бенчмарк MERA Text 2.0 для оценки языковых моделей
Иллюстрация к новости: Сбер представил бенчмарк MERA Text 2.0 для оценки языковых моделей
Новости ИИ

Сбер представил бенчмарк MERA Text 2.0 для оценки языковых моделей

Alex
От Alex
26.09.2026 2 Минут чтения
◉4уникальных читателей

Сбер 31 августа представил MERA Text 2.0 — новую версию бенчмарка для разработчиков и исследователей текстовых языковых моделей. Оценка пересобрана вокруг 12 тестов, разделённых на четыре группы: человекоцентричность, культурная специфика, агентные навыки и рассуждения. Публичный рейтинг прежней версии больше обновляться не будет.

Команда MERA объясняет обновление насыщением прежних задач: современные сильные модели приблизились к человеческой базовой линии, а на некоторых тестах превысили её. Из-за сжатия верхней части рейтинга старые задания хуже различали лидирующие модели, поэтому вместо добавления отдельных датасетов авторы изменили саму структуру оценки.

Человекоцентричная группа проверяет понимание загадок, механизмов юмора и характера собеседника. Культурный блок охватывает российские регионализмы, исправление реальных русскоязычных текстов и культурный код — от фольклора и поговорок до мемов, песен и кино. По данным команды, именно культурная специфика оставляет наибольшее пространство для улучшения и слабее других групп связана с общим уровнем модели.

Агентный раздел не измеряет автономного агента целиком. IFHardBench проверяет одновременное соблюдение трёх–шести формальных ограничений, SOBHard — преобразование и извлечение данных из документов, а GorillaHard — выбор инструмента и аргументов его вызова. Последний тест оценивает планирование обращения к инструменту, но не его фактическое выполнение.

В блок рассуждений вошли задачи на контекстные противоположные значения слов, логические ловушки и языковую неоднозначность. Все тестовые наборы закрыты от оцениваемых моделей, а для каждого теста предусмотрено не менее пяти формулировок инструкции. Авторы также фиксируют протоколы, параметры запуска и логи и не добавляют интеллектуальные агентные или reasoning-обвязки поверх модели.

Итоговый балл формируется в три этапа: сначала объединяются метрики внутри теста, затем тесты внутри группы и, наконец, результаты четырёх групп. На каждом уровне применяется геометрическое среднее; нулевые значения заменяются на 0,01, чтобы один провал не обнулял весь результат. Для корректного сравнения все модели требуется пересчитывать на одной версии набора.

Практический контекст: Практически новая структура полезнее единого усреднённого рейтинга: она позволяет отдельно увидеть, где модель теряет качество — в культурном контексте, строгом формате ответа или выборе инструментов. Однако MERA Text 2.0 не следует трактовать как комплексную проверку готового агента: длительные сценарии, взаимодействие со средами и сквозные рабочие конвейеры намеренно оставлены за пределами этой ветки.

Полный прогон сокращён с 23 датасетов и примерно 37 тысяч запросов до 12 датасетов и приблизительно 8700 запросов — в 4,3 раза по числу запросов. Старые отправки и их результаты сохраняются в личном кабинете, новые замеры принимаются прежним способом. На момент объявления технический отчёт ещё готовился; актуальные результаты команда рекомендует смотреть в обновляемом бенчмарке, а не в статической таблице.

Четыре группы тестов MERA Text 2.0
Группа Тесты Что проверяется
Human-Centric Riddles, Humor, Characters Метафоры, юмор, характер и контекст общения
Culture-Specific RussianRegions, SAGE, RUBIN Региональная лексика, коррекция текста и русский культурный код
Agentic IFHardBench, SOBHard, GorillaHard Инструкции, структурированные документы и выбор инструментов
Reasoning Enantiosemy, NewReasoning, LIMUR Контекст значений, логические задачи и языковая неоднозначность

Источники

  1. Sber Tech

Дата события: 2026-08-31. Дата первоисточника: 2026-08-31.

Подписывайтесь на AI Feed в Telegram

Новые материалы об ИИ, практические разборы и сравнения инструментов — в одной удобной ленте.

Перейти в Telegram→

По теме

Продолжить чтение

Материалы по теме и практические инструменты AI Feed.
  1. 20.09.2026Сбер открыл веса и код GigaChat 3.5 Reasoning↗
  2. 29.09.2026Google показала четыре проекта разработчиков на Gemini 3.8 Flash↗
  3. 23.09.2026Google представила Gemini 3.8 Flash TTS и Flash-Lite TTS↗
  4. 22.09.2026AWS открыла Claude Opus 5.5 в Amazon Bedrock и Claude Platform↗
Как ИИ меняет IT-профессии→Радар AI-моделей→
Alex
Автор

Alex

Редактор AI Feed. Специализируется на практическом контексте технологических новостей, продуктов и инструментов.

Подпишись на меня
Другие статьи
Local AI for Mac — модели для 8–128 ГБ памяти
Назад

Какую локальную нейросеть запустить на Mac: модели для 8–128 ГБ памяти

Иллюстрация к новости: Т-Инвестиции запустили MCP-сервер для инвестиционных ИИ-агентов
Далее

Т-Инвестиции запустили MCP-сервер для инвестиционных ИИ-агентов

Свежие записи

  • Google показала применение Gemini в кейтеринге Edy’s Grocer
  • VK внедрила канареечную доставку снапшотов для подбора рекламы
  • Google показала четыре проекта разработчиков на Gemini 3.8 Flash
  • Google объединила закупку вертикального видео в Display & Video 360
  • Сколько стоит AI API в 2026 году: расчёт для чата, RAG и агентов

Свежие комментарии

Нет комментариев для просмотра.

Архивы

  • Сентябрь 2026
  • Май 2026

Рубрики

  • Anthropic и Claude
  • Google AI, Gemini и DeepMind
  • NVIDIA и искусственный интеллект
  • OpenAI и ChatGPT
  • Блог
  • Главные
  • Новости ИИ
  • Промты
  • Профессии
  • Сравнения нейросетей

    © 2026 AI Feed. Все права защищены.
    RUEN
    О проектеРедакционная политикаИсточники и методологияИсправленияКонтактыКонфиденциальностьНастройки аналитики
    Аналитика AI Feed

    Помогает понять, какие материалы полезны. Рекламное отслеживание отключено.