Перейти к содержимому
-
  • https://www.facebook.com/
  • https://twitter.com/
  • https://t.me/
  • https://www.instagram.com/
  • https://youtube.com/
AI Feed AI Feed AI Feed

Новости ИИ, нейросетей, ChatGPT и AI-технологий

Подписаться
AI Feed AI Feed AI Feed

Новости ИИ, нейросетей, ChatGPT и AI-технологий

  • Новости ИИ
  • Промты
  • Блог
  • Радар нейросетей
  • Цены AI API

Рубрики

  • Anthropic и Claude
  • Google AI, Gemini и DeepMind
  • NVIDIA и искусственный интеллект
  • OpenAI и ChatGPT
  • Блог
  • Главные
  • Новости ИИ
  • Промты
  • Сравнения нейросетей

Последние новости

  • AWS описала запуск интерактивных MCP Apps в Amazon Bedrock AgentCore
  • xAI открыла доступ к Grok 4.6 в GitHub Copilot
  • Hugging Face и AWS связали Strands Robots с потоковым обучением LeRobot
  • Anthropic: Claude ускорил проектирование белков и химический анализ
  • xAI открыла Grok Build для всех планов на вебе и смартфонах
  • Новости ИИ
  • Промты
  • Блог
  • Радар нейросетей
  • Цены AI API
Подписаться
Закрыть

Поиск

Главная/Новости ИИ/AWS описала развёртывание Qwen3.8-2.4T-A95B на SageMaker HyperPod
Иллюстрация к новости: AWS описала развёртывание Qwen3.8-2.4T-A95B на SageMaker HyperPod
Новости ИИ

AWS описала развёртывание Qwen3.8-2.4T-A95B на SageMaker HyperPod

Kat
От Kat
10.09.2026 2 Минут чтения
◉1уникальных читателей

9 сентября 2026 года AWS опубликовала техническое руководство по самостоятельному развёртыванию модели Qwen3.8-2.4T-A95B на Amazon SageMaker HyperPod. Предложенная конфигурация использует vLLM и один экземпляр ml.p6-b300.48xlarge с восемью ускорителями NVIDIA B300 Blackwell Ultra; результатом становится совместимая с OpenAI точка доступа для приложений.

Qwen3.8-2.4T-A95B — модель с открытыми весами, выпущенная командой Alibaba Qwen 12 августа. По данным AWS, она содержит 2,4 трлн параметров, но активирует около 95 млрд на токен. Архитектура объединяет смесь экспертов, 69 слоёв Gated DeltaNet с ограниченным рекуррентным состоянием и 23 слоя полного внимания. Нативное контекстное окно составляет 262 144 токена и может расширяться до 1 010 000 токенов.

Главное инфраструктурное ограничение связано с объёмом весов. В формате BF16 они потребовали бы примерно 4,8 ТБ памяти, поэтому AWS предлагает квантование NVFP4 W4A4, сокращающее размер приблизительно до 1,2 ТБ. Узел p6-b300 располагает суммарно 2,1 ТБ видеопамяти HBM3e, что, по оценке AWS, оставляет около 500–700 ГБ для KV-кэша, активаций, пакетной обработки и длинного контекста.

В конфигурации vLLM модель распределяется по всем восьми GPU посредством тензорного параллелизма. AWS также включает кэширование общих префиксов, автоматический выбор инструментов, разбор рассуждений Qwen3 и встроенное спекулятивное декодирование Multi-Token Prediction. Последнее использует черновые головы внутри самой модели и не требует загрузки отдельной модели-предсказателя.

Развёртывание управляется через ресурс InferenceEndpointConfig в кластере HyperPod с Amazon EKS. Оператор отвечает за загрузку весов, назначение GPU, проверки готовности, обновления и жизненный цикл точки доступа. Для первоначальной загрузки примерно 1,2 ТБ весов и запуска контейнера AWS указывает ориентир 15–30 минут, зависящий от пропускной способности сети; локальное кэширование NVMe ускоряет последующие перезапуски.

Экземпляр ml.p6-b300.48xlarge нельзя получить по требованию: AWS требует заранее зарезервировать мощности через Flexible Training Plan и согласовать зону доступности с выделением плана. В описанном примере точка доступа также не открыта в публичный интернет, а vLLM по умолчанию не требует аутентификации, поэтому контроль сетевого доступа остаётся существенной частью производственной конфигурации.

Практический контекст: Практически эта схема ориентирована на организации, которым нужен контроль над весами и данными, но она не превращает модель такого масштаба в обычную облачную службу. Ключевые условия внедрения — зарезервированный узел из восьми B300, хранение и загрузка терабайтного файла весов, настройка Kubernetes и самостоятельная защита точки доступа. Заявления о пригодности для производственного инференса и оценки памяти принадлежат AWS; собственных измерений скорости именно этой конфигурации публикация не приводит.

Ключевые параметры Qwen3.8-2.4T-A95B
Параметр Значение
Общее число параметров 2,4 трлн
Активируется на токен 95 млрд
Архитектура Mixture of Experts, 512 маршрутизируемых и 1 общий эксперт
Слои 92: 69 Gated DeltaNet и 23 полного внимания
Контекст 262 144 токена; расширение до 1 010 000
Максимальная длина вывода 128 тыс. токенов
Ресурсы одного узла ml.p6-b300.48xlarge
Ресурс Спецификация
GPU 8 × NVIDIA B300 Blackwell Ultra
Видеопамять 288 ГБ HBM3e на GPU; 2,1 ТБ суммарно
Системная память 4096 ГиБ
Сеть 6400 Гбит/с EFA
Локальное хранилище 3,8 ТБ NVMe SSD
Размер весов NVFP4 Около 1,2 ТБ

Источники

  1. AWS AI Blog

Дата события: 2026-09-09. Дата первоисточника: 2026-09-09.

Подписывайтесь на AI Feed в Telegram

Новые материалы об ИИ, практические разборы и сравнения инструментов — в одной удобной ленте.

Перейти в Telegram→
Kat
Автор

Kat

Редактор AI Feed. Готовит новости на основе первичных источников и отвечает за ясное объяснение важных обновлений.

Подпишись на меня
Другие статьи
Иллюстрация к новости: Hugging Face внедрила Qwen3-Embedding-0.6B в поиск Papers with Code
Назад

Hugging Face внедрила Qwen3-Embedding-0.6B в поиск Papers with Code

Иллюстрация к новости: xAI открыла доступ к Grok 4.6 через Amazon Bedrock
Далее

xAI открыла доступ к Grok 4.6 через Amazon Bedrock

Свежие записи

  • AWS описала запуск интерактивных MCP Apps в Amazon Bedrock AgentCore
  • xAI открыла доступ к Grok 4.6 в GitHub Copilot
  • Hugging Face и AWS связали Strands Robots с потоковым обучением LeRobot
  • Anthropic: Claude ускорил проектирование белков и химический анализ
  • xAI открыла Grok Build для всех планов на вебе и смартфонах

Свежие комментарии

Нет комментариев для просмотра.

Архивы

  • Сентябрь 2026
  • Май 2026

Рубрики

  • Anthropic и Claude
  • Google AI, Gemini и DeepMind
  • NVIDIA и искусственный интеллект
  • OpenAI и ChatGPT
  • Блог
  • Главные
  • Новости ИИ
  • Промты
  • Сравнения нейросетей

    © 2026 AI Feed. Все права защищены.
    RUEN
    О проектеРедакционная политикаИсточники и методологияИсправленияКонтактыКонфиденциальностьНастройки аналитики
    Аналитика AI Feed

    Помогает понять, какие материалы полезны. Рекламное отслеживание отключено.