Наш опыт: 1 млрд токенов/сутки на consumer-железе

Это не теория и не «best practices из документации». Это история реального production-деплоя, который мы построили и эксплуатируем: от Tesla M40 до четырёх узлов по 2×RTX 3090, 12 протестированных моделей, 4 итерации тюнинга vLLM за 3 недели и собственный балансировщик для LLM-трафика.

Наш опыт: 1 млрд токенов/сутки на consumer-железе

Это не теория и не «best practices из документации». Это история реального production-деплоя, который мы построили и эксплуатируем: от Tesla M40 до четырёх узлов по 2×RTX 3090, 12 протестированных моделей, 4 итерации тюнинга vLLM за 3 недели и собственный балансировщик для LLM-трафика.

1 млрд токенов/сутки: финальная архитектура, тономика и что мы бы сделали по-другому

Хук: ~$4,500/год против API

1 млрд токенов в сутки. В пике. В среднем — 600–750M/сутки, ≈220–275B в год. Если бы этот объём шёл через API, он стоил бы $35–125K в год в зависимости от blended-тарифа. На нашем железе — ~$4,500/год. Вот как мы дошли до этой цифры — и как ловили себя на нечестных расчётах по пути.

vLLM на 2×RTX 3090: от 18 до 100 tok/s — MTP, TP, KV-cache, OMP_NUM_THREADS

Хук: 18 tok/s → 100 tok/s за 3 недели

Первый запуск vLLM на 2×3090 дал нам 18 tok/s. Через 3 недели — 75. Разница — 4 параметра в конфиге и 2 дня отладки. Вот эти 4 параметра, и вот что пошло не так по пути.

Как мы выбрали Qwen3.8-27B из 12 моделей: бенчмарки, MTP и почему 27B — sweet spot

Хук: 12 моделей, 1 победитель

Мы протестировали 12 моделей на своём 2×3090. 8 из них — мусор для агентного кодинга. 3 — нормальные. 1 — та, что мы используем каждый день. Вот как мы это выяснили.

Почему мы собрали LLM-сервер, который жжёт миллиард токенов в сутки

Хук: момент, когда API стал болью

В марте 2026 мы посмотрели на счёт за Claude API — $4,200 за месяц — и поняли: наш код-агент сжигает больше токенов, чем мы зарабатываем.

1 млрд токенов/сутки на consumer-железе

Обзор

Это не теория и не «best practices из документации» — это история реального production-деплоя, который мы построили и эксплуатируем: от Tesla M40 до четырёх узлов по 2×RTX 3090, 12 протестированных моделей, 4 итерации тюнинга vLLM за 3 недели и собственный балансировщик для LLM-трафика.

Расскажите о задаче

Ответим с планом и оценкой в течение 24 часов.