Вставьте длинный документ в ChatGPT и нажмите Enter. Ни секунды-двух ничего не происходит. Затем ответ начинает появляться слово за словом, с постоянной скоростью, пока не закончится. Вы видели это сотни раз. Большинство людей никогда не задумываются обо мне...
Вставьте длинный документ в ChatGPT и нажмите Enter.
Ни секунды-двух ничего не происходит. Затем ответ начинает появляться слово за словом, с постоянной скоростью, пока не закончится.
Вы видели это сотни раз. Большинство людей никогда об этом не задумываются.
Но это две совершенно разные вещи, происходящие внутри одного запроса, выполняемые на двух разных частях одного и того же графического процессора и ограниченные двумя разными узкими местами. Как только вы поймете, что это такое, многие запутанные вещи, связанные с обслуживанием моделей ИИ, перестанут сбивать с толку.
В том числе и то, почему более быстрый графический процессор иногда вообще не имеет никакого значения.
Это вторая часть серии. Первая часть посвящена расколу между VRAM и ядрами. В этом посте рассказывается, что делает каждый из них при поступлении запроса.
Пример, которому мы последуем
Я собираюсь проследить один вопрос до конца:
какая столица Франции
Просто, коротко и дает краткий ответ. Идеально подходит для наблюдения за механизмами.
Прежде чем что-либо произойдет, сервер модели уже загрузил веса модели во VRAM. Это произошло при запуске, и они остаются там. Ничто в вашем запросе не загружает модель.
Ваши слова разбиваются на токены, которые представляют собой просто кусочки слов, превращенные в числа, и помещаются