Агентские системы не вызывают LLM один раз. Они планируют, рассуждают, вызывают инструменты, наблюдают за результатами и выполняют цикл. Каждая итерация добавляет новые токены в контекстное окно, а при ценообразовании на основе токенов каждый дополнительный токен приглашения увеличивает стоимость. Для чая...
Агентские системы не вызывают LLM один раз. Они планируют, рассуждают, вызывают инструменты, наблюдают за результатами и выполняют цикл. Каждая итерация добавляет новые токены в контекстное окно, а при ценообразовании на основе токенов каждый дополнительный токен приглашения увеличивает стоимость. Для команд, использующих автономные агенты, конвейеры оценки или рабочие процессы многоэтапного кодирования, результатом часто становится шок, а не предсказуемые инженерные накладные расходы. Хорошей новостью является то, что оптимизация затрат на агентские рабочие нагрузки — это системная проблема, а не только проблема моделирования. Благодаря правильной архитектуре и модели ценообразования, соответствующей агентскому поведению, вы можете сократить расходы, не сокращая при этом возможности.
Анатомия агентских затрат
Агентские рабочие нагрузки генерируют затраты в трех измерениях: глубина, ширина и контекст.
Глубина: количество шагов рассуждения или циклов использования инструментов.
Ширина: параллельные вызовы инструментов или отправка субагента.
Контекст: накопленная история мыслей, наблюдений и предыдущих результатов, которые отправляются по каждому запросу.
При биллинге на основе токенов глубина и контекст мультипликативны. 10-шаговый агент с системным приглашением на 4000 токенов и 8000 токенов истории разговоров может повторно отправить 12 000 токенов десять раз. Эта повторная отправка - первое место