ИИ обходит бухгалтеров по скорости и точности, но не закрывает отчётность сам

Исследование Mercor показало: ИИ-модели решают структурированные задачи бухучёта быстрее, точнее и дешевле лицензированных бухгалтеров. Но почти 60% задач не решены полностью — без надзора человека отчётность не закрыть.

Главное
  • В исследовании Mercor участвовали 12 лицензированных CPA со средним опытом 5,5 года
  • Полный бенчмарк APEX Accounting включает 160 задач по 10 смоделированным компаниям
  • Claude Opus 5.5 лидирует с 61,8% выполненных критериев, Fable 5.1 — 61,0%, GPT-6 Astra — 57,9%
График сравнения точности ИИ-моделей и бухгалтеров на задачах бухучёта в зависимости от даты релиза модели
Фото: The Decoder

ИИ-модели обходят лицензированных бухгалтеров в структурированных задачах бухгалтерского учёта — по скорости, точности и стоимости. К таким выводам пришло исследование компании Mercor, в котором 12 сертифицированных CPA со средним опытом пять с половиной лет решали упрощённые задачи из APEX Accounting Benchmark.

Ранее лучшие модели набирали меньше среднего результата бухгалтеров — около 37%. Сейчас те же задачи они решают почти безупречно.

Что показал полный бенчмарк

Полная версия APEX Accounting Benchmark заметно масштабнее: 160 задач по 10 смоделированным компаниям. Над ней работали более 40 специалистов со средним опытом 11 лет.

Текущие лидеры по доле выполненных критериев оценки:

При этом, по данным Mercor, ни одна модель не решила полностью почти 60% задач. Закрыть бухгалтерскую отчётность без надзора человека ИИ пока не может.

Что осталось за рамками теста

Mercor признаёт: задачи исследования проверяют именно то, что ИИ делает лучше всего — поиск деталей и точное следование инструкциям. За рамками остались ключевые части профессии: общение с клиентами, взаимодействие с коллегами и контекст, накопленный за годы работы.

Именно поэтому, по мнению Mercor, бухгалтеров нельзя заменить — хотя компания ожидает значительного роста производительности в отрасли.

Для профиТехнические детали: архитектура, цифры, ссылки

Бенчмарк APEX Accounting Benchmark: 160 задач по 10 смоделированным компаниям, создан более чем 40 специалистами со средним опытом 11 лет. В тесте с участием людей — 12 лицензированных CPA со средним опытом 5,5 года, задачи упрощённые.

Результаты моделей по доле выполненных критериев оценки: Claude Opus 5.5 — 61,8%, Fable 5.1 — 61,0%, GPT-6 Astra — 57,9%. Ни одна модель не решила полностью почти 60% задач.

Mercor отмечает ограничение методологии: задачи тестируют поиск деталей и следование инструкциям, но не включают работу с клиентами, коллегами и накопленный контекст.

Вопросы и ответы

Какие модели участвовали в исследовании Mercor?
Claude Opus 5.5 (61,8%), Fable 5.1 (61,0%) и GPT-6 Astra (57,9%) — по доле выполненных критериев оценки.
Может ли ИИ полностью заменить бухгалтера?
Нет. По данным Mercor, ни одна модель не решила полностью почти 60% задач, а тест не охватывает общение с клиентами и коллегами.
Сколько задач в полном бенчмарке APEX Accounting?
160 задач по 10 смоделированным компаниям, созданных более чем 40 специалистами со средним опытом 11 лет.