ИИ-агенты выполняют больше работы, но решения принимают люди
Команда проекта Atria Dawn Preview выяснила, что ИИ-агенты всё чаще выполняют рутинные шаги в разработке моделей, но ключевые решения остаются за людьми. В 96,5% задач использовался ИИ, однако люди принимали 85,5% решений о методах и параметрах.
- ИИ применялся в 96,5% из 455 выполненных задач, при этом треть задач (151) была бы невозможна без ИИ.
- Люди принимали 85,5% решений о методах и параметрах и 93,4% решений о целях и масштабе.
- Медианное соотношение действий агента к вводу человека выросло с 11 до 28,5 за четыре недели.

Исследовательская команда, работавшая над агентной языковой моделью Atria Dawn Preview, опубликовала результаты наблюдений за тем, как ИИ-агенты участвуют в разработке моделей. Проект показал: агенты всё активнее выполняют промежуточные шаги, но финальные решения остаются за людьми.
Atria Dawn Preview построена на архитектуре mixture-of-experts с 744 млрд параметров и предназначена для исследовательских и инженерных задач. Модель обучалась через пайплайн, где каждая задача привязана к реальной среде исполнения: она вызывает инструменты, генерирует промежуточные результаты и проверяется по внешним сигналам — тестам, метрикам или исходным данным. По словам команды, модель лидирует в пяти из 16 бенчмарков, включая веб-поиск и кибербезопасность, но общего превосходства над конкурентами не имеет.
ИИ предлагает, человек выбирает
ИИ использовался в 96,5% рассмотренных задач. За четыре недели участники всё чаще передавали работу агентам: медианное соотношение действий агента к вводу человека выросло с 11 до 28,5. Команда предостерегает от трактовки этого как роста автономности — каждое решение человека порождало больше шагов агента, но не означало, что агенты сами принимают больше решений.
Из 455 выполненных с помощью ИИ задач 151 была оценена как невыполнимая без ИИ — примерно треть. Эти задачи распределились между 27 из 56 участников, то есть не были сосредоточены у нескольких энтузиастов. В таких случаях ИИ не ускорял существующую работу, а делал возможной ту, которую иначе не начали бы.
Наиболее частый паттерн для методов и параметров — «ИИ предлагает, человек выбирает» (55,4%). Люди приняли 85,5% решений о методах и параметрах, ИИ — лишь 9,2%. Финальное решение о целях и масштабе люди принимали в 93,4% случаев. Даже среди 151 задачи, невозможной без ИИ, люди выбирали цель в 95,4% случаев.
Люди дают контекст, а не делают работу
Похожая картина при возникновении трудностей. Из 588 задач с зафиксированными сложностями 76% продвинулись благодаря вмешательству человека, а в 23% агент справился сам. Помощь человека почти всегда была информационной: добавление контекста или уточнение требований (35,2%) либо диагностика и смена метода (34,7%). Люди редко выполняли работу сами — частичные правки составили 3,2%, полное перехватывание — 0,7%.
Когда выводы ИИ требовали доработки, после обратной связи от человека ИИ сам вносил изменения в 75,4% случаев. Узким местом было человеческое суждение, а не исполнение.
Команда описывает три фазы роли ИИ: от объекта исследования к инструменту для отдельных задач и теперь к партнёру по проекту. В текущей роли ИИ готовит и корректирует планы в рамках целей, заданных людьми. Спекулятивная четвёртая фаза — рекурсивное самоулучшение, когда более сильные модели создают более сильных преемников.
Авторы отмечают, что модель может улучшаться в своих обучающих задачах, не становясь лучше в разработке преемника. Как ИИ мог бы предлагать разнообразные исследовательские направления и оценивать их ценность до получения результатов, остаётся открытым вопросом.
Риск формальной проверки
Когда каждое решение опирается на цепочку работы агента, которую человек не в силах проверить, надзор усложняется. В худшем случае люди превращаются в проверяющих, способных лишь формально одобрить увиденное, пишет команда. Многие участники запускали агентов в автономном режиме, чтобы не прерывать длительные прогоны постоянными подтверждениями. Эта граница проводилась из удобства, а не из осознанного выбора о том, сколько полномочий давать ИИ.
Работа выходит на фоне дискуссии о рекурсивном самоулучшении. Anthropic считает, что ИИ, разрабатывающий собственного преемника, возможен раньше, чем ожидалось, и генеральный директор Дарьо Амодеи призывает в связи с этим ввести ограничение скорости для отрасли. По данным Anthropic, люди сейчас принимают лишь однозначный процент решений о направлении исследований в компании. OpenAI использует GPT-5.6 Sol на всём цикле разработки, а Google и DeepMind позволяют ИИ-агентам исследовать альтернативные стратегии через записанные траектории поиска с Dream-RSI, хотя те улучшают только стратегию поиска, а не саму модель.
Более тысячи сотрудников ведущих ИИ-компаний недавно предупредили, что их организации могут быть на пороге автоматизации ИИ-исследований. Отдельное исследование Princeton и UK AI Security Institute пришло к выводу, близкому к findings команды Atria: передовые модели справляются с исследовательской инженерией, но проваливаются на суждениях, которые действительно важны.
Для профиТехнические детали: архитектура, цифры, ссылки
Atria Dawn Preview — агентная языковая модель на архитектуре mixture-of-experts с 744 млрд параметров. Пайплайн обучения привязывает каждую задачу к реальной среде исполнения: вызов инструментов, генерация промежуточных результатов, проверка по внешним сигналам (тесты, метрики, исходные данные).
Модель лидирует в пяти из 16 бенчмарков, включая AutomationBench, CyberGym и MLE-Bench Lite, но уступает в GDPval и SWE-Bench Pro. Общего превосходства над конкурентами нет.
Ключевые метрики исследования: ИИ задействован в 96,5% задач; 151 из 455 задач (треть) оценены как невыполнимые без ИИ; медианное соотношение действий агента к вводу человека выросло с 11 до 28,5 за четыре недели; люди приняли 85,5% решений о методах и параметрах и 93,4% решений о целях и масштабе; при сбоях 76% задач продвинулись благодаря вмешательству человека, 23% агент решил сам; после обратной связи ИИ сам вносил правки в 75,4% случаев.
Вопросы и ответы
- Что такое Atria Dawn Preview?
- Агентная языковая модель на архитектуре mixture-of-experts с 744 млрд параметров, созданная для исследовательских и инженерных задач.
- Лидирует ли Atria Dawn Preview во всех бенчмарках?
- Нет, модель лидирует в пяти из 16 бенчмарков, включая веб-поиск и кибербезопасность, но уступает в GDPval и SWE-Bench Pro.
- Заменяют ли ИИ-агенты людей в разработке моделей?
- Нет, люди принимают 85,5% решений о методах и параметрах и 93,4% решений о целях и масштабе.


