Rtx-3090
Наш опыт: 1 млрд токенов/сутки на consumer-железе
Это не теория и не «best practices из документации». Это история реального production-деплоя, который мы построили и эксплуатируем: от Tesla M40 до четырёх узлов по 2×RTX 3090, 12 протестированных моделей, 4 итерации тюнинга vLLM за 3 недели и собственный балансировщик для LLM-трафика.
Наш опыт: 1 млрд токенов/сутки на consumer-железе
Это не теория и не «best practices из документации». Это история реального production-деплоя, который мы построили и эксплуатируем: от Tesla M40 до четырёх узлов по 2×RTX 3090, 12 протестированных моделей, 4 итерации тюнинга vLLM за 3 недели и собственный балансировщик для LLM-трафика.
1 млрд токенов/сутки: финальная архитектура, тономика и что мы бы сделали по-другому
Хук: ~$4,500/год против API
1 млрд токенов в сутки. В пике. В среднем — 600–750M/сутки, ≈220–275B в год. Если бы этот объём шёл через API, он стоил бы $35–125K в год в зависимости от blended-тарифа. На нашем железе — ~$4,500/год. Вот как мы дошли до этой цифры — и как ловили себя на нечестных расчётах по пути.
vLLM на 2×RTX 3090: от 18 до 100 tok/s — MTP, TP, KV-cache, OMP_NUM_THREADS
Хук: 18 tok/s → 100 tok/s за 3 недели
Первый запуск vLLM на 2×3090 дал нам 18 tok/s. Через 3 недели — 75. Разница — 4 параметра в конфиге и 2 дня отладки. Вот эти 4 параметра, и вот что пошло не так по пути.
Как мы выбрали Qwen3.8-27B из 12 моделей: бенчмарки, MTP и почему 27B — sweet spot
Хук: 12 моделей, 1 победитель
Мы протестировали 12 моделей на своём 2×3090. 8 из них — мусор для агентного кодинга. 3 — нормальные. 1 — та, что мы используем каждый день. Вот как мы это выяснили.
Почему мы собрали LLM-сервер, который жжёт миллиард токенов в сутки
Хук: момент, когда API стал болью
В марте 2026 мы посмотрели на счёт за Claude API — $4,200 за месяц — и поняли: наш код-агент сжигает больше токенов, чем мы зарабатываем.
1 млрд токенов/сутки на consumer-железе
Обзор
Это не теория и не «best practices из документации» — это история реального production-деплоя, который мы построили и эксплуатируем: от Tesla M40 до четырёх узлов по 2×RTX 3090, 12 протестированных моделей, 4 итерации тюнинга vLLM за 3 недели и собственный балансировщик для LLM-трафика.