ai
3 мин
31 августа 2026 г.
Источник: Хабр ИИ & Нейросети

Агенты выполнили задачу. Почему тест всё равно провален?

dKosarevsky
dKosarevsky
RSS AI Ingest
Агенты выполнили задачу. Почему тест всё равно провален?

Допустим, у тебя есть несколько AI-агентов. Один разбирает тикет, второй меняет код, третий запускает тесты, четвёртый готовит релиз. Задача закрыта, тесты зелёные, артефакт собран. Метрика success_rate показывает успех. Можно праздновать? ...

Допустим, у тебя есть несколько AI-агентов. Один разбирает тикет, второй меняет код, третий запускает тесты, четвёртый готовит релиз. Задача закрыта, тесты зелёные, артефакт собран. Метрика success_rate показывает успех. Можно праздновать? Не обязательно. Агенты могли несколько раз выполнить одну работу, нарушить порядок операций, одновременно захватить общий ресурс или случайно добиться правильного результата через недопустимую последовательность действий. Финальное состояние корректное. Процесс — нет. Именно эту проблему пытается измерить CoCoBench — новый бенчмарк для проверки координации нескольких AI-агентов. Его разработали исследователи из Нанкинского университета, Tsinghua и AgiBot. Главная идея исследования полезна далеко за пределами робототехники: Насколько х**во?

Хотите внедрить ИИ в ваш бренд?

Спроектируем и развернем автономных агентов и современный цифровой стек под ваши задачи.

Рассчитать проект