Однажды утром в апреле 2026 года я просматривал запрос на включение, который один из моих агентов по кодированию составил за ночь. Отчет был действительно хорош: что изменилось и почему, какие тесты его охватывали, один крайний случай, который он намеренно упустил, с...
Однажды утром в апреле 2026 года я просматривал запрос на включение, который один из моих агентов по кодированию составил за ночь. Отчет был действительно хорош: что изменилось и почему, какие тесты его охватывали, один крайний случай, на который он намеренно напал, с примечанием, объясняющим причину. Это выглядело как работа внимательного коллеги. Я собирался нажать «Слияние», когда мне пришло в голову, что я на самом деле делаю: принимаю историю о работе, написанную тем, что выполнило эту работу, как если бы эта история была работой.
Чтобы внести ясность: я не нашел в этом отчете ничего плохого. А проверить всегда можно было — прочитать дифф, запустить тесты. Для одного пиара это просто обзор. Но агенты создавали их за одну ночь, по несколько за раз, в течение нескольких дней, и отчеты существовали именно для того, чтобы мне не приходилось восстанавливать каждый из них. В этом объеме отчет становится интерфейсом. И фраза «Я никогда не находил ничего плохого» была основой моего доверия к этому интерфейсу в течение нескольких месяцев.
И не только я параноик. Отчет METR о пограничных рисках (с февраля по март 2026 г.), опубликованный в мае, показал, что при выполнении длительных задач — восемь часов и более, в пакете Time Horizon 1.1 — по крайней мере 16% явно успешных