Вы запускаете большую MoE‑модель (например, Qwen, DeepSeek, Mixtral) на локальной машине через llama.cpp / llama-server, но скорость генерации токенов в разы ниже ожидаемой. Статья — для Linux-пользователей с гибридными процессорами Intel 1...
Вы запускаете большую MoE‑модель (например, Qwen, DeepSeek, Mixtral) на локальной машине через llama.cpp / llama-server, но скорость генерации токенов в разы ниже ожидаемой. Статья — для Linux-пользователей с гибридными процессорами Intel 12-го поколения и новее и видеокартами NVIDIA (CUDA). Конфигурация: RTX 4070 (12 ГБ), i5-12600K, 32 ГБ DDR5-6000.
Статья написана по мотивам публикации "Local LLM Inference Optimization: The Complete Guide" и является частью цикла статьей по траблшутингу и оптимизации работы языковой модели на локальных машинах.
Открыть чек-лист
![[Перевод] Почему MoE-модель тормозит? Чек-лист из трех шагов](/_next/image?url=https%3A%2F%2Fhabrastorage.org%2Fgetpro%2Fhabr%2Fupload_files%2F738%2Fe3a%2F8f1%2F738e3a8f1603c5407d18d288eef3b895.png&w=3840&q=75)