Модель

GPT-4o

Все материалы по теме в хронологическом порядке.

Вчера

Семь ошибок в оценке AI-агентов: тесты зелёные, а прод ломается

Tech Lead Сергей Прощаев описал семь ошибок в eval-обвязке AI-агентов, из-за которых тесты показывают успех, а о деградации команда узнаёт от поддержки. Главная причина — проверка финального текста вместо состояния системы.

2 минДля профи