Наш опыт: 1 млрд токенов/сутки на consumer-железе
Референс-деплой CodeOnTime: 1 млрд токенов/сутки на 4×(2×RTX 3090). Пять частей — от железа и подбора модели до тюнинга vLLM, собственного балансировщика и тономики.
Это не теория и не «best practices из документации». Это история реального production-деплоя, который мы построили и эксплуатируем: от Tesla M40 до четырёх узлов по 2×RTX 3090, 12 протестированных моделей, 4 итерации тюнинга vLLM за 3 недели и собственный балансировщик для LLM-трафика.
Серия из пяти частей. Каждая читается отдельно, вместе они образуют полный путь: 0 → 1 млрд токенов/сутки на consumer-железе.
Мы пишем честно: про crash на MTP, про KV-cache, который «не влезает», про 2 недели без мониторинга и про то, что мы бы сделали по-другому. Именно это — компромиссы, ошибки и конкретные цифры — делает историю полезной.
Части серии
- Почему мы собрали LLM-сервер, который жжёт миллиард токенов в сутки — мотивация self-hosted и путь железа от Tesla M40 до 4×(2×RTX 3090).
- Как мы выбрали Qwen3.8-27B из 12 моделей — бенчмарки, MTP и почему 27B — sweet spot для агентного кодинга.
- vLLM на 2×RTX 3090: от 18 до 100 tok/s — MTP, TP, KV-cache, OMP_NUM_THREADS: 4 итерации тюнинга и финальный конфиг.
- Мы написали балансировщик для 4 реплик vLLM — почему NGINX не работает для LLM и как держим сессии на тёплой KV-cache.
- 1 млрд токенов/сутки: финальная архитектура и тономика — честный расчёт, ~$4,500/год против $35–125K API, 5 уроков пути.
Бизнес-результат в формате кейса — «1 млрд токенов/сутки на consumer-железе». Услуга, закрывающая эту задачу, — оптимизация LLM-инференса.
Хотите так же?
Расскажите о задаче — ответим с планом и оценкой в течение 2 рабочих дней.
Обсудить задачу