Huawei и Alibaba одновременно представили новое ИИ-железо

Huawei и Alibaba почти одновременно представили новое оборудование для ИИ-кластеров: SuperPoD Atlas 960E и чип Zhenwu V900. Обе компании строят собственные аппаратные стеки, не пытаясь копировать архитектуру NVIDIA.

Главное
  • Huawei представила Atlas 960E SuperPoD с 4096 NPU и производительностью 8 EFLOPS на FP8
  • Alibaba показала чип Zhenwu V900 с 216 ГБ HBM и интерконнектом на 1,2 ТБ/с
  • Серийное производство Zhenwu V900 и ускорителей Ascend 960 запланировано на 2027 год
Серверные стойки с ИИ-ускорителями в дата-центре — тема новости о чипах Huawei и Alibaba
Фото: Хабр: Машинное обучение

Huawei и Alibaba с разницей в несколько дней представили новое железо для ИИ. Huawei провела анонс 17 сентября на HUAWEI CONNECT 2026 в Шанхае, Alibaba — 22 сентября на Apsara Conference в Ханчжоу. Обе компании строят собственные решения для связи тысяч чипов в кластер, не пытаясь повторить архитектуру NVIDIA.

Что показала Huawei

Главный анонс — Atlas 960E SuperPoD, первый в индустрии SuperPoD на базе near-packaged optics (NPO). SuperPoD — это блок из нескольких тысяч ускорителей, связанных интерконнектом и работающих как единый компьютер с общей памятью.

Atlas 960E вмещает до 4096 NPU и выдаёт 8 EFLOPS на FP8 и 16 EFLOPS на FP4. Несколько SuperPoD объединяются в SuperCluster — до 512 000 NPU по clos-топологии, а с многоканальной топологией до миллиона.

В основе лежит оптический модуль Hi-ONE: 7,2 Тбит/с на узел со встроенным источником света. Вместо 48 000 отдельных 800G-трансиверов применяются 5500 модулей Hi-ONE, впаянных рядом с чипом. Экономия — свыше 550 кВт на систему, надёжность — до 99,8%.

Система может оснащаться ускорителями Ascend 960 в двух версиях. 960DT для обучения: до 2 PFLOPS FP8 / 4 PFLOPS FP4, 288 ГБ HBM с пропускной способностью 9,6 ТБ/с, выход в Q1 2027 года. 960PR для инференса: до 8 PFLOPS FP4, 192 ГБ памяти с пропускной способностью 2,4 ТБ/с, выход в Q3 2027 года.

Также обновлена система TaiShan 950 SuperPoD для CPU общего назначения: до 4096 узлов и единый пул памяти на 256 ТБ. В комплекте — хранилище KV-кэша OceanStor M900 петабайтного масштаба для «слоя L3.5» — контекстной памяти между GPU-памятью и диском.

Программный стек CANN для Ascend переведён на модель community-driven open source.

Что показала Alibaba

Alibaba представила Zhenwu V900 от подразделения T-Head Semiconductor. По заявлению компании, это самый мощный ИИ-чип, сделанный в Китае. Заявлено трёхкратное превосходство над предыдущим Zhenwu M890, но точных цифр FLOPS компания не раскрыла.

Подтверждённые характеристики: 216 ГБ HBM, поддержка вычислений от FP32 до FP4, обновлённые тензорные ядра с повышенной точностью на FP8/FP4, межчиповый интерконнект на 1,2 ТБ/с. Настраиваемые размеры блоков в MXFP8 и MXFP4 помогают стабилизировать производительность при масштабировании.

Кластеры на V900 масштабируются через коммутаторы ICN Switch до 500 000 ускорителей — этого, по словам компании, достаточно для моделей на 5–10 трлн параметров. Серийное производство запланировано на Q1 2027 года.

Тогда же ожидается суперускоритель Panjiu — связка Zhenwu V900, ICN Switch, сетевых карт SmartNIC Panmai и контроллеров Zhenyue. Показана и предварительная версия Zhenwu J900 следующего поколения на собственной архитектуре параллельных вычислений, релиз — Q3 2028 года.

Также представлен роадмап по процессорам: CPU Yitian 720 и Yitian 730 для агентного ИИ. Yitian 730 выйдет на RISC-V, став первым решением T-Head на собственной микроархитектуре. Предшественник Yitian 710 использовал ARM.

Глава Alibaba У Юнмин обозначил стратегию тремя словами: «ИИ-модели, ИИ-чипы, ИИ-облако». T-Head закрыла весь набор чипов для ЦОД: ускорители Zhenwu, CPU Yitian, сетевые карты Panmai и интерконнект ICN.

Из софта заметнее всего Agent Context и AgentCore — попытка закрыть «L3.5»-контекст, о котором параллельно говорит и Huawei через OceanStor M900.

Другие китайские решения

Moore Threads MTT S5000 — универсальные GPU на архитектуре PingHu с квантованием от FP8 до FP64 и заявленной совместимостью с PyTorch, vLLM и SGLang без переписывания кода.

Dongfang Suanxin DF1000 использует 14-нм техпроцесс без HBM-памяти, но с 3D-стекингом по технологии near-memory. Заявлено 520 TFLOPS на BF16, 900 ГБ/с scale-up и 6,4 ТБ/с пропускной способности памяти. Компания признаёт, что обогнать H200 — задача следующего поколения DF2000.

Для профиТехнические детали: архитектура, цифры, ссылки

Huawei Atlas 960E SuperPoD: до 4096 NPU, 8 EFLOPS FP8 / 16 EFLOPS FP4. Оптический модуль Hi-ONE — 7,2 Тбит/с на узел, 5500 модулей вместо 48 000 трансиверов, экономия свыше 550 кВт, надёжность до 99,8%. SuperCluster — до 512 000 NPU по clos-топологии, до миллиона с многоканальной топологией.

  • Ascend 960DT: 2 PFLOPS FP8 / 4 PFLOPS FP4, 288 ГБ HBM, 9,6 ТБ/с, Q1 2027
  • Ascend 960PR: 8 PFLOPS FP4, 192 ГБ, 2,4 ТБ/с, Q3 2027
  • TaiShan 950 SuperPoD: до 4096 узлов, пул памяти 256 ТБ
  • OceanStor M900: KV-кэш петабайтного масштаба, «слой L3.5»

Alibaba Zhenwu V900: 216 ГБ HBM, FP32–FP4, MXFP8/MXFP4 с настраиваемыми блоками, интерконнект 1,2 ТБ/с, до 500 000 ускорителей через ICN Switch, модели на 5–10 трлн параметров. Серийное производство — Q1 2027. Zhenwu J900 — Q3 2028. CPU Yitian 730 на RISC-V.

Moore Threads MTT S5000: архитектура PingHu, FP8–FP64, совместимость с PyTorch, vLLM, SGLang.

Dongfang Suanxin DF1000: 14 нм, без HBM, near-memory 3D-стекинг, 520 TFLOPS BF16, 900 ГБ/с scale-up, 6,4 ТБ/с памяти.

Вопросы и ответы

Когда выйдут новые чипы Huawei и Alibaba?
Ускорители Ascend 960DT — в Q1 2027, 960PR — в Q3 2027. Серийное производство Zhenwu V900 запланировано на Q1 2027.
Сколько NPU в Atlas 960E SuperPoD?
До 4096 NPU в одном блоке, производительность 8 EFLOPS на FP8 и 16 EFLOPS на FP4.
Чем Zhenwu V900 отличается от предыдущего чипа?
Alibaba заявляет трёхкратное превосходство по производительности над Zhenwu M890, но точных цифр FLOPS не раскрывает.