Gemini 4 Argon: успехи в бенчмарках и сомнения внутри Google

Google начала развёртывать флагманскую модель Gemini 4 Argon, но внутри компании нарастают сомнения в её качестве, особенно в программировании. Официально модель лидирует в бенчмарках, однако источники Bloomberg говорят о более скромных результатах на практике.

Главное
  • Gemini 4 Argon показали узкому кругу партнёров по кибербезопасности и обещают расширить доступ после тестирования.
  • Сотрудники Google жалуются на слабый фронтенд и «бенчмаксинг» — оптимизацию под тесты в ущерб продукту.
  • Обучение подобной системы эксперты оценивают в $400 млн без учёта зарплат инженеров.
Иллюстрация к новости о модели Gemini 4 Argon и сомнениях сотрудников Google в её эффективности
Фото: 3DNews

Google начала развёртывать флагманскую модель Gemini 4 Argon, но внутри компании растут сомнения в её работе в ключевых областях, включая написание кода. Об этом сообщает Bloomberg. Официально модель показала лучшие результаты в ряде бенчмарков и обошла OpenAI Astra по безопасности, но источники утверждают, что на практике результаты скромнее.

Модель представили узкому кругу партнёров в области кибербезопасности. После дополнительного тестирования Google обещает расширить доступ и начать с подписчиков платных тарифов. Представители компании заявили, что утверждения о слабой эффективности Gemini 4 в программировании не соответствуют действительности.

Мнения сотрудников разделились

Часть сотрудников Google считает, что Anthropic Fable и OpenAI Astra развиваются быстрее, и Gemini 4 будет уступать в ряде аспектов. Другие уверены, что готовящаяся версия сравнялась с продуктами ведущих ИИ-лабораторий. Один из знакомых с разработкой сотрудников заверил, что внутри компании установился «широкий консенсус» о тщательном тестировании моделей.

Среди проблем называют неоднородные навыки в написании кода: модели с трудом даётся фронтенд. Кроме того, Gemini 4 очень крупная, и её эксплуатация обойдётся дорого, что может сказаться на рентабельности Google. Эксперты предполагают, что компания увлеклась «бенчмаксингом» — оптимизацией под тесты в ущерб качеству продукта. Источники это подтверждают.

Сильные стороны и контекст

Среди плюсов модели отмечают работу с нетекстовой информацией, например извлечение метаданных из видео, высокие уровни безопасности и естественное общение. Gemini 4 способна генерировать до 1 млн токенов за раз — примерно 750 тыс. слов. Модель разработана для длительных задач в разработке ПО, финансах, юриспруденции и кибербезопасности.

Google необходимо, чтобы Gemini 4 стала успешной: варианты Gemini используются в поиске, «Картах», Gmail и Chrome. Аудитория ИИ-обзоров в поиске и чат-бота превысила 1 млрд пользователей. В Google признали, что последняя модель уровня Pro вышла в феврале, но с тех пор зафиксировали рост показателей ИИ-продуктов.

В ноябре прошлого года Gemini 3 выступила сильнее конкурентов, в мае дебютировало семейство Gemini 3.5, а выпуск флагманской Gemini 3.5 Pro в июне, по неофициальной информации, отменили. Это нанесло урон позициям компании. Обучение подобной системы оценивают в $400 млн без учёта зарплат инженеров.

Внутри Google недовольны раздутой бюрократией и постоянной сменой приоритетов. Компанию покинули Джефф Дин, Джон Джампер и Ноам Шазир, а глава DeepMind Демис Хассабис уступил место Кораю Кавукчуоглу. Конкуренты тем временем движутся вперёд: среди потребителей популярен ИИ-агент Meta Muse, умеющий совершать покупки онлайн и записывать на приём.

Для профиТехнические детали: архитектура, цифры, ссылки
  • Gemini 4 Argon генерирует до 1 млн токенов за раз (около 750 тыс. слов).
  • Модель показала лучшие результаты в ряде бенчмарков и обошла OpenAI Astra по безопасности.
  • Обучение системы эксперты оценивают в $400 млн без учёта оплаты труда инженеров.
  • Слабые места: неоднородные навыки в коде, особенно фронтенд; высокая стоимость эксплуатации из-за размера модели.
  • Источники подтверждают «бенчмаксинг» — оптимизацию под тесты в ущерб продукту.

Вопросы и ответы

Что такое Gemini 4 Argon?
Флагманская модель Google, представленная узкому кругу партнёров по кибербезопасности. Способна генерировать до 1 млн токенов за раз.
В чём проблемы Gemini 4?
Источники Bloomberg говорят о скромных практических результатах и трудностях с программированием, особенно с фронтендом. Также модель дорога в эксплуатации.
Что такое «бенчмаксинг»?
Оптимизация ИИ-модели для высоких баллов в тестах в ущерб качеству выполнения реальных задач. Источники подтверждают, что Gemini 4 не избежала этой тенденции.

Источники

Материал подготовлен редакцией на основе указанных источников. Как мы работаем