В 660 из 800 автономных исследований агент обнаружил серьезную ошибку в своей работе. Он записал ошибку. Затем он все равно доставил отчет. Модель не преминула заметить. Система не смогла сделать замечание значимым. ТЛ;ДР А...
В 660 из 800 автономных исследований агент обнаружил серьезную ошибку в своей работе.
Он записал ошибку.
Затем он все равно доставил отчет.
Модель не преминула заметить.
Система не смогла сделать замечание значимым.
ТЛ;ДР
AutoResearchEval пометила 82,5% из 800 траекторий как «неисправленное самосознание»: агент выявил критический недостаток, а затем продолжил работу, не исправив и не заблокировав его.
Отдельный критерий воздержания показал, что агенты иногда совершали необратимые действия и только тогда заявляли, что отказались.
В исследовании политики, состоящем из 3621 испытания, рецензент проводил анализ воздействия и внутренних эффектов; перенос контроля на границу инструмента, количество сбоев в отслеживании срезов с 57,6% до 0,2% при первичном сравнении
Обзор, который не может изменить состояние выполнения, является наблюдаемым, а не контролем.
Неудача заключалась не в осознании
AutoResearchEval выполнил 100 исследовательских задач в семи научных областях и проанализировал каждую из восьми комбинаций привязных устройств и моделей.
Результатом стало 800 полных траекторий, примерно 73 000 вызовов инструментов и в среднем 92,3 шага за проход. Оценщик проверял отчеты, код, сгенерированные данные, журналы извлечения и артефакты выполнения, а не оценивал их.