Сбои при вызове инструментов — самый дорогостоящий класс ошибок в приложениях-агентах. Модель отвечает уверенно, инструмент никогда не запускается, а пользователь видит тихий пробел. Запланированный тест на дым застал этот класс раньше. В этом тематическом исследовании рассматривается один небольшой проект...
Сбои при вызове инструментов — самый дорогостоящий класс ошибок в приложениях-агентах. Модель отвечает уверенно, инструмент никогда не запускается, а пользователь видит тихий пробел. Запланированный тест на дым застал этот класс раньше.
В этом тематическом исследовании от начала до конца рассматривается один небольшой проект: постоянно активный зонд с вызовом инструмента стоимостью 0 долларов США, построенный на основе бесплатного доступа к модели MonkeyCode (10 миллионов токенов) и опции бесплатного сервера. Раскрытие информации: эта статья была подготовлена в рамках информационно-пропагандистской программы MonkeyCode. Приведенные ниже жгут проводов и планировщик — настоящий артефакт; продукт - это только транспорт.
Фон
Эта закономерность началась с повторяющегося наблюдения: однооборотные испытания с вызовом инструмента проходят локально, а затем прерываются на производстве. Обновления модели меняют формат аргументов. Быстрое изменение выбора инструмента. Тест, который выполняется один раз на вашем ноутбуке, ничего не скажет вам о следующей неделе.
Недавние темы DEV высказали одну и ту же точку зрения с разных точек зрения. Один из них утверждал, что значки ИИ не измеряют то, что, по мнению разработчиков, они измеряют. Другой предложил создать книгу рассуждений: записывать решения, а не только данные. Оба указывают на одну и ту же инженерную привычку — доверять собственным измерениям времени выполнения, а не сторонним оценкам.
Разрыв был оперативным, а не концептуальным. Дымовые тесты существовали, но нет.