СберТех описал ИИ-агента для проверки технической документации
23 сентября СберТех описал ИИ-агента для технических писателей: он проверяет документацию по глоссарию непосредственно в IDE и предлагает исправления. Первая версия объединяла плагин Continue, визуальный конструктор Langflow и внутреннюю модель Qwen3-32b, но при подготовке к промышленной эксплуатации команда перешла к собственному решению на Python.
Агент предназначен не для создания документации с нуля, а для единообразного употребления терминов. Пользователь передаёт ему текст, серверная часть сверяет формулировки с глоссарием и возвращает исправленный вариант, который можно принять или отклонить. Глоссарий опубликован в репозитории GitVerse и, по данным команды, содержит более 750 терминов; его продолжают пополнять технические писатели и специалисты по кибербезопасности.
Low-code-прототип собрали за несколько часов, однако на больших текстах проявились ограничения. Модель получала слишком крупные части глоссария, могла терять ранее внесённые правки, работала медленно и потребляла много ресурсов GPU. Кроме того, визуальная схема в Langflow показалась разработчикам недостаточно надёжной для производственной среды.
Чтобы сократить контекст, команда добавила векторный поиск. Термины, допустимые и нерекомендуемые синонимы, а также английские варианты преобразуются в эмбеддинги моделью bge-m3 и сохраняются в Qdrant. Входной текст разбивается на слова, для каждого из них система ищет похожие векторы, а затем формирует мини-глоссарий для конкретного фрагмента. Экспериментальный порог сходства составляет 0,85–0,90 и зависит от выбранной эмбеддинг-модели.
Векторное хранилище работает локально в памяти через qdrant-client, без развёртывания отдельного кластера Kubernetes. Поскольку требуемой логики не было в стандартных блоках Langflow, команда переписала систему на Python за один день, после чего ещё неделю занималась отладкой. Исходный глоссарий также перевели из неоднородного Markdown в YAML, более удобный для машинного разбора.
Практический контекст: Выбор релевантных словарных статей вместо передачи модели всего справочника сокращает контекст и лучше соответствует интерактивной проверке текста. Однако архитектура по-прежнему требует человеческого контроля: по наблюдениям СберТеха, модель может добавлять лишнюю информацию, а форматирование после внесения правок иногда нарушается.
О публичной доступности или выпуске агента СберТех не сообщил. Следующим этапом команда называет учёт внутренней редакционной политики и разработку полноценного MCP-сервера с API. Логику планируется оформить как отдельные навыки, чтобы решение можно было запускать в виде скрипта или локального MCP-сервера либо обращаться к нему через API.
Источники
Дата события: 2026-09-23. Дата первоисточника: 2026-09-23.