14.08.2026

Облако vs on-prem: когда своё железо оправдано — расчёт

Облако против on-prem для LLM-инференса: FinOps-расчёт, когда своё железо окупается. Стоимость токена, нагрузка, 152-ФЗ — считаем, а не гадаем.

FinOps on-prem облако LLM-инференс

Проблема

«Купим GPU» или «взять в облаке» — вопрос, который решают на интуиции. Между тем это чистый FinOps-расчёт: при какой нагрузке и какой цене токена своё железо начинает дешевле облака. Без расчёта легко переплатить в обе стороны.

Что входит в расчёт

  • Нагрузка — сколько токенов в день/час, пиковый и средний batch.
  • Стоимость токена в облаке — цена GPU-часа, делённая на реальный throughput (не маркетинговый).
  • Стоимость своего железа — GPU + сервер + электричество + администрирование, распределённые на срок жизни.
  • Утилизация — свой GPU часто простаивает. Облако масштабируется, своё — нет.
  • Не-финансовые факторы — 152-ФЗ, air-gapped, данные не покидают контур. Это иногда решающий аргумент сам по себе.

Когда своё железо оправдано

  1. Стабильно высокая нагрузка — GPU загружен большую часть времени, утилизация высокая.
  2. Закрытый контур — 152-ФЗ / НУЦ / air-gapped: облако просто не вариант.
  3. Долгий горизонт — железо окупается за 2–3 года при постоянной нагрузке.
  4. Предсказуемая модель — одна-две модели, стабильный промпт, не нужен масштабирование.

Когда облако лучше

  1. Пиковая/непредсказуемая нагрузка — scale-to-zero, платить только за использование.
  2. Много разных моделей — гибкость выбора без закупки.
  3. Старт — пока объём мал, своё железо не окупится.

Вывод

Это расчёт, а не вера. Считайте стоимость токена при вашей реальной нагрузке и утилизации. Высокая стабильная нагрузка или закрытый контур → своё железо. Пики и старт → облако. И часто правильный ответ — гибрид: базовая нагрузка на своём, пики — в облаке.

Хотите так же?

Расскажите о задаче — ответим с планом и оценкой в течение 2 рабочих дней.

Обсудить задачу

Расскажите о задаче

Ответим с планом и оценкой в течение 24 часов.