Hugging Face внедрила Qwen3-Embedding-0.6B в поиск Papers with Code
21 августа 2026 года Hugging Face сообщила о внедрении в Papers with Code гибридного поиска научных публикаций с моделью Qwen3-Embedding-0.6B. Доступная через сайт и команду pwc search система объединяет полнотекстовую выдачу PostgreSQL с семантическим поиском через pgvector. По данным компании, она поддерживает векторы более чем для 110 000 актуальных работ из arXiv и Daily Papers.
Для каждого документа модель обрабатывает нормализованные заголовок и аннотацию. Hugging Face закрепляет точную ревизию модели, размерность результата, формат входных данных, тип инструкции, способ нормализации и хеш исходного текста. Рабочая конфигурация создаёт L2-нормализованные векторы размерностью 256; для статей используется инструкция document, а для пользовательских запросов — query.
Полное кодирование корпуса вынесено в пакетный контур на GPU через Hugging Face Jobs. Storage Buckets хранят снимки данных, манифесты и готовые векторы, а Inference Endpoints обслуживает пользовательские запросы и небольшие обновления документов. До загрузки в PostgreSQL импортёр проверяет схемы, контрольные суммы, размерность, нормализацию, уникальность идентификаторов и соответствие векторов текущему тексту статей.
Во внутреннем пилоте на 5000 публикаций GPU NVIDIA L4 кодировал около 75 статей в секунду при размерности 1024. Для 256-мерного индекса компания указала Recall@20 на уровне 0,9955 относительно точного поиска, медианную задержку HNSW 1,31 мс и p95 2,21 мс. Таблица и индекс занимали около 27% объёма версии с 1024 измерениями. Эти показатели получены Hugging Face на ограниченном наборе и независимо не воспроизводились.
Каждая ветвь поиска возвращает до 50 кандидатов. Затем система объединяет их позиции методом взаимного слияния рангов с равными весами и константой k=60. Дополнительные правила удерживают наверху точные заголовки и идентификаторы arXiv, распознают отдельные навигационные запросы, допускают неполные названия и ограниченные опечатки, но отказываются от неоднозначных нечётких совпадений.
Интерактивная модель работает в Inference Endpoint максимум с одной репликой и может масштабироваться до нуля. Клиент ограничивает ожидание одной секундой, проверяет размерность, конечность и норму полученного вектора, а после повторяющихся сбоев временно прекращает обращения. При холодном запуске, перегрузке или некорректном ответе Papers with Code пропускает семантическую ветвь и сразу возвращает полнотекстовые результаты.
Практический контекст: Разделение пакетного и интерактивного контуров практически уменьшает зависимость поиска от доступности GPU-сервиса: ресурсоёмкое кодирование каталога не выполняется при пользовательском запросе, а лексическая ветвь служит резервом. При этом воспроизводимость зависит не только от названия модели, но и от её ревизии, инструкций, размерности и нормализации. Опубликованные метрики показывают свойства выбранной архитектуры, но не заменяют оценку релевантности на разнообразных научных запросах.
| Компонент | Роль | Нагрузка |
|---|---|---|
| Hugging Face Jobs | Полное кодирование корпуса, новые поколения модели и крупные обновления | Пакетная обработка на GPU |
| Hugging Face Storage Buckets | Хранение снимков, манифестов и векторных файлов | Постоянная передача артефактов между системами |
| Hugging Face Inference Endpoints | Кодирование запросов и небольших обновлений документов | Интерактивные запросы и почасовые операции |
| PostgreSQL и pgvector | Полнотекстовый поиск и поиск ближайших векторов | Рабочее извлечение кандидатов |
Источники
Дата события: 2026-08-21. Дата первоисточника: 2026-08-21.