12.08.2026
AWQ vs GGUF vs INT4: что выбрать под ваше железо (на примерах Qwen)
Квантизация LLM: AWQ против GGUF против INT4. Что выбрать под ваше железо на примерах Qwen. VRAM, качество, скорость — разбор без воды.
квантизация
AWQ
GGUF
Qwen
LLM-инференс
Проблема
«Нам нужна Qwen, но не влезает в VRAM». Ответ почти всегда — квантизация. Но форматов несколько: AWQ, GGUF, INT4, и каждый по-разному влияет на VRAM, качество и скорость. Выбор «на слух» приводит к тому, что модель либо не влезает, либо деградирует, либо медленнее, чем могла бы.
Что за форматы
- AWQ — квантизация весов с защитой значимых каналов. Работает на GPU, дружит с vLLM. Хороший баланс VRAM/качество для серверного инференса.
- GGUF — формат llama.cpp, ориентирован на CPU и гибкость. Битовые глубины (Q4, Q5, Q8) выбираются под объём памяти.
- INT4 (GPTQ и аналоги) — 4-битные веса, популярный компромисс. На GPU даёт существенное сокращение VRAM.
На примерах Qwen
Для Qwen-7B:
- FP16 — ~14–16 ГБ VRAM. Базовое качество, но дорого.
- AWQ (4-bit) — ~5–6 ГБ. Качество близко к FP16 на типовых задачах, влезает в одну consumer-карту.
- GGUF Q4_K_M — ~4–5 ГБ, но на CPU. Скорость на порядок ниже GPU, зато гибкость и портативность.
- INT4 — ~5–6 ГБ на GPU, качество между FP16 и AWQ.
Как выбрать
- Есть GPU и нужен серверный инференс → AWQ или INT4 + vLLM.
- Только CPU или нужен портативный вариант → GGUF + llama.cpp.
- Качество критично и VRAM есть → FP16 или 8-bit.
- Всегда замеряйте — квантизация ≠ одинаковая деградация для разных моделей. Прогоните evals на своём датасете.
Вывод
Нет «лучшего» формата — есть формат под ваше железо и вашу нагрузку. GPU + сервер → AWQ/INT4. CPU + портативность → GGUF. И всегда проверяйте качество замером, а не догадкой.
Хотите так же?
Расскажите о задаче — ответим с планом и оценкой в течение 2 рабочих дней.
Обсудить задачу