AWS описала развёртывание Qwen3.8-2.4T-A95B на SageMaker HyperPod
9 сентября 2026 года AWS опубликовала техническое руководство по самостоятельному развёртыванию модели Qwen3.8-2.4T-A95B на Amazon SageMaker HyperPod. Предложенная конфигурация использует vLLM и один экземпляр ml.p6-b300.48xlarge с восемью ускорителями NVIDIA B300 Blackwell Ultra; результатом становится совместимая с OpenAI точка доступа для приложений.
Qwen3.8-2.4T-A95B — модель с открытыми весами, выпущенная командой Alibaba Qwen 12 августа. По данным AWS, она содержит 2,4 трлн параметров, но активирует около 95 млрд на токен. Архитектура объединяет смесь экспертов, 69 слоёв Gated DeltaNet с ограниченным рекуррентным состоянием и 23 слоя полного внимания. Нативное контекстное окно составляет 262 144 токена и может расширяться до 1 010 000 токенов.
Главное инфраструктурное ограничение связано с объёмом весов. В формате BF16 они потребовали бы примерно 4,8 ТБ памяти, поэтому AWS предлагает квантование NVFP4 W4A4, сокращающее размер приблизительно до 1,2 ТБ. Узел p6-b300 располагает суммарно 2,1 ТБ видеопамяти HBM3e, что, по оценке AWS, оставляет около 500–700 ГБ для KV-кэша, активаций, пакетной обработки и длинного контекста.
В конфигурации vLLM модель распределяется по всем восьми GPU посредством тензорного параллелизма. AWS также включает кэширование общих префиксов, автоматический выбор инструментов, разбор рассуждений Qwen3 и встроенное спекулятивное декодирование Multi-Token Prediction. Последнее использует черновые головы внутри самой модели и не требует загрузки отдельной модели-предсказателя.
Развёртывание управляется через ресурс InferenceEndpointConfig в кластере HyperPod с Amazon EKS. Оператор отвечает за загрузку весов, назначение GPU, проверки готовности, обновления и жизненный цикл точки доступа. Для первоначальной загрузки примерно 1,2 ТБ весов и запуска контейнера AWS указывает ориентир 15–30 минут, зависящий от пропускной способности сети; локальное кэширование NVMe ускоряет последующие перезапуски.
Экземпляр ml.p6-b300.48xlarge нельзя получить по требованию: AWS требует заранее зарезервировать мощности через Flexible Training Plan и согласовать зону доступности с выделением плана. В описанном примере точка доступа также не открыта в публичный интернет, а vLLM по умолчанию не требует аутентификации, поэтому контроль сетевого доступа остаётся существенной частью производственной конфигурации.
Практический контекст: Практически эта схема ориентирована на организации, которым нужен контроль над весами и данными, но она не превращает модель такого масштаба в обычную облачную службу. Ключевые условия внедрения — зарезервированный узел из восьми B300, хранение и загрузка терабайтного файла весов, настройка Kubernetes и самостоятельная защита точки доступа. Заявления о пригодности для производственного инференса и оценки памяти принадлежат AWS; собственных измерений скорости именно этой конфигурации публикация не приводит.
| Параметр | Значение |
|---|---|
| Общее число параметров | 2,4 трлн |
| Активируется на токен | 95 млрд |
| Архитектура | Mixture of Experts, 512 маршрутизируемых и 1 общий эксперт |
| Слои | 92: 69 Gated DeltaNet и 23 полного внимания |
| Контекст | 262 144 токена; расширение до 1 010 000 |
| Максимальная длина вывода | 128 тыс. токенов |
| Ресурс | Спецификация |
|---|---|
| GPU | 8 × NVIDIA B300 Blackwell Ultra |
| Видеопамять | 288 ГБ HBM3e на GPU; 2,1 ТБ суммарно |
| Системная память | 4096 ГиБ |
| Сеть | 6400 Гбит/с EFA |
| Локальное хранилище | 3,8 ТБ NVMe SSD |
| Размер весов NVFP4 | Около 1,2 ТБ |
Источники
Дата события: 2026-09-09. Дата первоисточника: 2026-09-09.