Nvidia: экономика AI-фабрик зависит от токенов на ватт

Nvidia связала экономику AI-фабрик с инференсом и эффективностью по токенам на ватт. Вице-президент компании Иан Бак рассказал, что Blackwell обеспечил 30-кратный рост токенов на ватт, а ускоритель Groq 3 LPX повышает скорость рассуждений.

Главное
  • Nvidia заявляет о 30-кратном росте токенов на ватт при переходе на поколение GPU Blackwell
  • Инференс не заменяет обучение: компании постоянно дообучают и выравнивают модели
  • Ускоритель Groq 3 LPX работает с платформой Vera Rubin для задач с низкой задержкой
Иан Бак, вице-президент Nvidia, выступает на мероприятии Fully Connected
Фото: SiliconANGLE AI

Экономика AI-фабрик всё меньше зависит от доступа к отдельным GPU. Как заявил вице-президент и генеральный менеджер направления гипермасштабирования и HPC в Nvidia Иан Бак, агентные системы обращаются к множеству моделей, баз данных и инструментов, поэтому весь дата-центр должен работать как единая вычислительная система.

«Вместо машин, устройств или ПК — токены, — сказал Бак на мероприятии Fully Connected в интервью theCUBE Research. — Эти активы не относятся к ИТ и не связаны с затратами. Они растут в цене, приносят доход, взаимозаменяемы, долговечны и продуктивны».

Инференс меняет экономику

Коммерческий результат AI-фабрики создаёт инференс: развёрнутые модели обрабатывают запросы и выдают токены. При этом инференс не отменяет обучение — организации постоянно обновляют модели вслед за изменением данных и рынка.

«Это не просто „настроил и забыл“, — отметил Бак. — Компании уточняют модели, выравнивают их, добавляют данные. Мы видим работу в области обучения с подкреплением и онлайн-выравнивания».

Низкая задержка создаёт отдельный экономический уровень для задач, где быстрое рассуждение стоит дороже. Ускоритель инференса Groq 3 LPX работает с платформой Nvidia Vera Rubin и повышает скорость генерации токенов на пользователя для чувствительных ко времени нагрузок.

«Если в токенах есть ценность быстрейшего мышления, LPX можно усилить поверх Vera Rubin, — сказал Бак. — Мы видим большой интерес в финтехе и других областях, где всё происходит в реальном времени».

Энергия как системное ограничение

Мощность в конечном счёте ограничивает объём вычислительной инфраструктуры, который может развернуть дата-центр. Поэтому токены на ватт становятся центральной метрикой экономики AI-фабрик и заставляют вендоров повышать производительность с каждым поколением железа.

«У дата-центров есть естественный потолок — это их энергия, — сказал Бак. — С каждым поколением GPU мы добиваемся роста токенов на ватт более чем в 10 раз. На Blackwell мы получили 30-кратное улучшение».

Меняется и масштаб проектирования систем. По словам Бака, CoreWeave даёт клиентам выбирать конфигурации или использовать сервисы инференса более высокого уровня, которые оптимизируют баланс между пропускной способностью и скоростью токенов.

«CoreWeave может сделать это для клиентов, — сказал он. — Им не нужно тонуть в выборе. Здесь важен наш партнёрский экосистемный подход».

Для профиТехнические детали: архитектура, цифры, ссылки

Ключевые тезисы Бака:

  • Экономика AI-фабрик смещается от отдельных чипов к инфраструктуре: сеть, хранение, процессоры и ПО должны работать вместе на масштабе.
  • Инференс не заменяет обучение — компании применяют обучение с подкреплением и онлайн-выравнивание для обновления моделей.
  • Groq 3 LPX работает с Vera Rubin и повышает скорость токенов на пользователя для задач с низкой задержкой (финтех и другие real-time сценарии).
  • Токены на ватт — центральная метрика: рост более чем в 10 раз на поколение GPU, на Blackwell — 30x.
  • CoreWeave даёт клиентам выбирать конфигурации или использовать сервисы инференса с оптимизацией пропускной способности и скорости токенов.

Вопросы и ответы

Что такое токены на ватт и почему это важно?
Это метрика, показывающая, сколько токенов выдаёт оборудование на единицу энергии. Мощность дата-центра ограничена, поэтому рост токенов на ватт напрямую влияет на экономику AI-фабрик.
Инференс заменяет обучение моделей?
Нет. По словам Nvidia, компании постоянно дообучают и выравнивают развёрнутые модели, используя обучение с подкреплением и онлайн-выравнивание.
Какой прирост токенов на ватт дал Blackwell?
Nvidia заявляет о 30-кратном улучшении токенов на ватт на поколении Blackwell.