Агенты выполнили задачу. Почему тест всё равно провален?

Wait 5 sec.

Допустим, у тебя есть несколько AI-агентов. Один разбирает тикет, второй меняет код, третий запускает тесты, четвёртый готовит релиз.Задача закрыта, тесты зелёные, артефакт собран. Метрика success_rate показывает успех.Можно праздновать?Не обязательно. Агенты могли несколько раз выполнить одну работу, нарушить порядок операций, одновременно захватить общий ресурс или случайно добиться правильного результата через недопустимую последовательность действий.Финальное состояние корректное. Процесс — нет.Именно эту проблему пытается измерить CoCoBench — новый бенчмарк для проверки координации нескольких AI-агентов. Его разработали исследователи из Нанкинского университета, Tsinghua и AgiBot.Главная идея исследования полезна далеко за пределами робототехники: Насколько х**во?