Все пишут response_format={"type": "json_object"} и идут дальше. Это очевидный выбор: вашему коду нужны структурированные данные, JSON — это структурированные данные, готово. Затем задание по извлечению выполняется для ста тысяч строк, приходит счет, и...
Все пишут response_format={"type": "json_object"} и идут дальше. Это очевидный выбор: вашему коду нужны структурированные данные, JSON — это структурированные данные, готово.
Затем задание по извлечению выполняется для ста тысяч строк, и приходит счет, и удивительная его часть ушла на фигурные скобки, двоеточия и слово subscribe_status, перепечатанное десять тысяч раз.
Сначала два слова, поскольку в них живет аргумент. Токен составляет примерно ¾ слова — модели выставляют счет за миллион из них. И они выставляют счета по двум разным ценам: входные токены (то, что вы отправляете) и выходные токены (то, что модель записывает обратно), при этом выход обычно в 5–6 раз превышает цену входных данных. При форматировании вы просите модель производить дорогие земли.
Те же 200 записей, пять форматов
Я сгенерировал 200 синтетических записей клиентов — идентификатор, имя, адрес электронной почты, город, сумму, дату регистрации, статус — и подсчитал их с помощью токенизатора o200k_base OpenAI, который лежит в основе текущих моделей GPT. Каждый раз одни и те же данные, менялась только обертка:
Формат
Токенов в строке
против красивого JSON
JSON, отступ = 2
77,8
—
JSON, компактный
52,8
−32%
JSONL
53,8
−31%
CSV-файл
29,9
−62%
ТСВ
29,8
−62%
Красиво напечатанный JSON стоит в 2,6 раза дороже, чем CSV за байтовую информацию. Нет