ИИ обходит бухгалтеров по скорости и точности, но не закрывает отчётность сам
Исследование Mercor показало: ИИ-модели решают структурированные задачи бухучёта быстрее, точнее и дешевле лицензированных бухгалтеров. Но почти 60% задач не решены полностью — без надзора человека отчётность не закрыть.
- В исследовании Mercor участвовали 12 лицензированных CPA со средним опытом 5,5 года
- Полный бенчмарк APEX Accounting включает 160 задач по 10 смоделированным компаниям
- Claude Opus 5.5 лидирует с 61,8% выполненных критериев, Fable 5.1 — 61,0%, GPT-6 Astra — 57,9%

ИИ-модели обходят лицензированных бухгалтеров в структурированных задачах бухгалтерского учёта — по скорости, точности и стоимости. К таким выводам пришло исследование компании Mercor, в котором 12 сертифицированных CPA со средним опытом пять с половиной лет решали упрощённые задачи из APEX Accounting Benchmark.
Ранее лучшие модели набирали меньше среднего результата бухгалтеров — около 37%. Сейчас те же задачи они решают почти безупречно.
Что показал полный бенчмарк
Полная версия APEX Accounting Benchmark заметно масштабнее: 160 задач по 10 смоделированным компаниям. Над ней работали более 40 специалистов со средним опытом 11 лет.
Текущие лидеры по доле выполненных критериев оценки:
- Claude Opus 5.5 — 61,8%
- Fable 5.1 — 61,0%
- GPT-6 Astra — 57,9%
При этом, по данным Mercor, ни одна модель не решила полностью почти 60% задач. Закрыть бухгалтерскую отчётность без надзора человека ИИ пока не может.
Что осталось за рамками теста
Mercor признаёт: задачи исследования проверяют именно то, что ИИ делает лучше всего — поиск деталей и точное следование инструкциям. За рамками остались ключевые части профессии: общение с клиентами, взаимодействие с коллегами и контекст, накопленный за годы работы.
Именно поэтому, по мнению Mercor, бухгалтеров нельзя заменить — хотя компания ожидает значительного роста производительности в отрасли.
Для профиТехнические детали: архитектура, цифры, ссылки
Бенчмарк APEX Accounting Benchmark: 160 задач по 10 смоделированным компаниям, создан более чем 40 специалистами со средним опытом 11 лет. В тесте с участием людей — 12 лицензированных CPA со средним опытом 5,5 года, задачи упрощённые.
Результаты моделей по доле выполненных критериев оценки: Claude Opus 5.5 — 61,8%, Fable 5.1 — 61,0%, GPT-6 Astra — 57,9%. Ни одна модель не решила полностью почти 60% задач.
Mercor отмечает ограничение методологии: задачи тестируют поиск деталей и следование инструкциям, но не включают работу с клиентами, коллегами и накопленный контекст.
Вопросы и ответы
- Какие модели участвовали в исследовании Mercor?
- Claude Opus 5.5 (61,8%), Fable 5.1 (61,0%) и GPT-6 Astra (57,9%) — по доле выполненных критериев оценки.
- Может ли ИИ полностью заменить бухгалтера?
- Нет. По данным Mercor, ни одна модель не решила полностью почти 60% задач, а тест не охватывает общение с клиентами и коллегами.
- Сколько задач в полном бенчмарке APEX Accounting?
- 160 задач по 10 смоделированным компаниям, созданных более чем 40 специалистами со средним опытом 11 лет.



