Предыдущая глава Ну а теперь рассмотрим, как нам применить обученный трансформер. И применение уже обученной модели сильно отличается от тренировки, потому что теперь приходится учитывать еще один фактор - задержку. Так что давайте разбират...
Предыдущая глава
Ну а теперь рассмотрим, как нам применить обученный трансформер. И применение уже обученной модели сильно отличается от тренировки, потому что теперь приходится учитывать еще один фактор - задержку. Так что давайте разбираться, как устроен инференс LLM и как его правильно масштабировать.
![[Перевод] Масштабирование LLM: от одного чипа до ЦОДа. Глава 5. Инференс](/_next/image?url=https%3A%2F%2Fhabrastorage.org%2Fgetpro%2Fhabr%2Fupload_files%2Fb6a%2F2f1%2F8e4%2Fb6a2f18e45e896a98a3c0f21f86eeb07.png&w=3840&q=75)