ai
3 мин
30 августа 2026 г.
Источник: Dev.to AI Feed

40 направлений, которые сократили наш счет за LLM на 71%

Info Inlet
Info Inlet
RSS AI Ingest
40 направлений, которые сократили наш счет за LLM на 71%

30 июля OpenAI сократила GPT-5.6 Luna до 0,20 доллара за миллион входных токенов и 1,20 доллара за миллион выходных — по сравнению с 1 и 6 долларов. Сокращение 80%. Azure повторила это 1 августа. Мы сделали то же, что большинство команд сделали с этой новостью: ничего. Наш шлюз отправлял каждое сообщение...

30 июля OpenAI сократила GPT-5.6 Luna до 0,20 доллара за миллион входных токенов и 1,20 доллара за миллион выходных — по сравнению с 1 и 6 долларов. Сокращение 80%. Azure повторила это 1 августа. Мы сделали то же, что большинство команд сделали с этой новостью: ничего. Наш шлюз отправлял каждый запрос сильной модели, потому что так было всегда, и потому что фраза «просто использовать дешевую модель» звучит как решение, которое возвращается в виде заявки в службу поддержки через три недели. Затем кто-то положил счет рядом с составом трафика, и неловкость стала очевидна. Подавляющее большинство наших запросов касались названия этой темы, суммирования различий, извлечения полей из этой формы, названия этого файла. Мы платили невероятную цену за создание названий документов из трех слов. Вот что мы отправили вместо этого. Это около сорока строк Go, это позволило сократить 81% запросов от дорогой модели и сократить расходы на 71%. Также сломалось четыре вещи, и это самое интересное. Подход, который не работает: классифицировать подсказку Очевидный дизайн — тот, который все пишут первым — представляет собой классификатор перед маршрутизатором: Посмотрите на входящий запрос. Решите, легко это или сложно. Отправьте его на подходящую модель. Мы построили это. Это хуже, чем кажется, потому что

Хотите внедрить ИИ в ваш бренд?

Спроектируем и развернем автономных агентов и современный цифровой стек под ваши задачи.

Рассчитать проект