Мы написали балансировщик для 4 реплик vLLM: почему NGINX не работает для LLM

Хук: NGINX не понимает LLM

NGINX round-robin для LLM — это как раздавать билеты в кино: кто пришёл, тот сел. Но LLM-запросы — не билеты.

Мы написали балансировщик для 4 реплик vLLM: почему NGINX не работает для LLM

Хук: NGINX не понимает LLM

NGINX round-robin для LLM — это как раздавать билеты в кино: кто пришёл, тот сел. Но LLM-запросы — не билеты.

vLLM на 2×RTX 3090: от 18 до 100 tok/s — MTP, TP, KV-cache, OMP_NUM_THREADS

Хук: 18 tok/s → 100 tok/s за 3 недели

Первый запуск vLLM на 2×3090 дал нам 18 tok/s. Через 3 недели — 75. Разница — 4 параметра в конфиге и 2 дня отладки. Вот эти 4 параметра, и вот что пошло не так по пути.

Расскажите о задаче

Ответим с планом и оценкой в течение 24 часов.