Mtp
152-ФЗ
Air-Gapped
Architecture
AWQ
Benchmark
DevOps
Evals
FinOps
GGUF
Gpu
HoReCa
Iiko
Kv-Cache
LangGraph
Legal Tech
Llm-Inference
LLM-Инференс
Load-Balancing
Model-Selection
Mtp
Nginx
On-Prem
Python
Qwen
RAG
Rtx-3090
Self-Hosted
SRE
T-Pro
Tensor-Parallelism
Tokenomics
Tuning
Vllm
Автоматизация Бизнес-Процессов
Аудит ИИ-Инфраструктуры
База Знаний
Безопасность Данных
Бенчмарки
Внедрение ИИ В Бизнес
ИИ
ИИ Для 1С
Инференс
Качество
Квантизация
Корпоративный ИИ
Корпоративный ИИ On-Premise
Облако
Обучение
Окупаемость ИИ
Своё Железо vs Облако
Тономика
vLLM на 2×RTX 3090: от 18 до 100 tok/s — MTP, TP, KV-cache, OMP_NUM_THREADS
Хук: 18 tok/s → 100 tok/s за 3 недели
Первый запуск vLLM на 2×3090 дал нам 18 tok/s. Через 3 недели — 75. Разница — 4 параметра в конфиге и 2 дня отладки. Вот эти 4 параметра, и вот что пошло не так по пути.
vLLM на 2×RTX 3090: от 18 до 100 tok/s — MTP, TP, KV-cache, OMP_NUM_THREADS
Хук: 18 tok/s → 100 tok/s за 3 недели
Первый запуск vLLM на 2×3090 дал нам 18 tok/s. Через 3 недели — 75. Разница — 4 параметра в конфиге и 2 дня отладки. Вот эти 4 параметра, и вот что пошло не так по пути.
Как мы выбрали Qwen3.8-27B из 12 моделей: бенчмарки, MTP и почему 27B — sweet spot
Хук: 12 моделей, 1 победитель
Мы протестировали 12 моделей на своём 2×3090. 8 из них — мусор для агентного кодинга. 3 — нормальные. 1 — та, что мы используем каждый день. Вот как мы это выяснили.