В части 1 утверждалось, что большинство сбоев корпоративных агентов являются сбоями архитектуры. В этой части рассказывается об их любимой архитектурной ошибке: платить за работу слишком высокую цену, и более дешевая модель справляется с тем же успехом. Команды по умолчанию выбирают самую большую модель, потому что...
В части 1 утверждалось, что большинство сбоев корпоративных агентов являются сбоями архитектуры. В этой части рассказывается об их любимой архитектурной ошибке: платить за работу слишком высокую цену, и более дешевая модель справляется с тем же успехом.
Команды по умолчанию выбирают самую большую модель, потому что она кажется безопасной. Затем они запускают его миллиарды раз для решения таких задач, как извлечение даты из электронного письма, и задаются вопросом, почему позиция ИИ выглядит как расчет заработной платы.
Математика, которой никто не занимается
Сравните крайности текущего рынка (цены по прейскуранту на август 2026 г.):
Клод Басня 5
Прошивка DeepSeek V4 0731
Ввод / 1 млн токенов
10 долларов
~$0,14-0,22
Выход / 1 млн токенов
50 долларов США
~$0,28-0,66
Контекст
1М
1М
Веса
Собственный
МТИ, открыто
Возможность
СОТА везде
~1 балл отстает от уровня Pro
Это примерно в 20–70 раз дешевле за токен для модели, которая находится на вершине независимых индексов интеллекта, даже несмотря на то, что она уступает Fable по каждому ряду возможностей.
Теперь будьте честны относительно предостережений, потому что они имеют значение:
Flash многословен. Она генерирует гораздо больше токенов за задачу, чем медианная модель, поэтому реальный разрыв в цене за задачу меньше, чем разрыв в расчете на токен. Хотя все равно огромный.
Тесты в основном сообщаются поставщиками и ожидают независимой проверки.
Он проходит за границей. На жестком АГ