Tensor-Parallelism
152-ФЗ
Air-Gapped
Architecture
AWQ
Benchmark
DevOps
Evals
FinOps
GGUF
Gpu
HoReCa
Iiko
Kv-Cache
LangGraph
Legal Tech
Llm-Inference
LLM-Инференс
Load-Balancing
Model-Selection
Mtp
Nginx
On-Prem
Python
Qwen
RAG
Rtx-3090
Self-Hosted
SRE
T-Pro
Tensor-Parallelism
Tokenomics
Tuning
Vllm
Автоматизация Бизнес-Процессов
Аудит ИИ-Инфраструктуры
База Знаний
Безопасность Данных
Бенчмарки
Внедрение ИИ В Бизнес
ИИ
ИИ Для 1С
Инференс
Качество
Квантизация
Корпоративный ИИ
Корпоративный ИИ On-Premise
Облако
Обучение
Окупаемость ИИ
Своё Железо vs Облако
Тономика
vLLM на 2×RTX 3090: от 18 до 100 tok/s — MTP, TP, KV-cache, OMP_NUM_THREADS
Хук: 18 tok/s → 100 tok/s за 3 недели
Первый запуск vLLM на 2×3090 дал нам 18 tok/s. Через 3 недели — 75. Разница — 4 параметра в конфиге и 2 дня отладки. Вот эти 4 параметра, и вот что пошло не так по пути.
vLLM на 2×RTX 3090: от 18 до 100 tok/s — MTP, TP, KV-cache, OMP_NUM_THREADS
Хук: 18 tok/s → 100 tok/s за 3 недели
Первый запуск vLLM на 2×3090 дал нам 18 tok/s. Через 3 недели — 75. Разница — 4 параметра в конфиге и 2 дня отладки. Вот эти 4 параметра, и вот что пошло не так по пути.