<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Kv-Cache on CodeOnTime</title><link>https://codeontime.ru/tags/kv-cache/</link><description>Recent content in Kv-Cache on CodeOnTime</description><generator>Hugo</generator><language>ru-ru</language><lastBuildDate>Tue, 01 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://codeontime.ru/tags/kv-cache/index.xml" rel="self" type="application/rss+xml"/><item><title>Мы написали балансировщик для 4 реплик vLLM: почему NGINX не работает для LLM</title><link>https://codeontime.ru/blog/04-load-balancer/</link><pubDate>Tue, 01 Sep 2026 00:00:00 +0000</pubDate><guid>https://codeontime.ru/blog/04-load-balancer/</guid><description>&lt;h2 id="хук-nginx-не-понимает-llm"&gt;Хук: NGINX не понимает LLM&lt;/h2&gt;&#10;&lt;p&gt;NGINX round-robin для LLM — это как раздавать билеты в кино: кто пришёл, тот сел. Но LLM-запросы — не билеты.&lt;/p&gt;</description></item><item><title>vLLM на 2×RTX 3090: от 18 до 100 tok/s — MTP, TP, KV-cache, OMP_NUM_THREADS</title><link>https://codeontime.ru/blog/03-vllm-tuning/</link><pubDate>Fri, 28 Aug 2026 00:00:00 +0000</pubDate><guid>https://codeontime.ru/blog/03-vllm-tuning/</guid><description>&lt;h2 id="хук-18-toks--100-toks-за-3-недели"&gt;Хук: 18 tok/s → 100 tok/s за 3 недели&lt;/h2&gt;&#10;&lt;p&gt;Первый запуск vLLM на 2×3090 дал нам 18 tok/s. Через 3 недели — 75. Разница — &lt;strong&gt;4 параметра в конфиге и 2 дня отладки&lt;/strong&gt;. Вот эти 4 параметра, и вот что пошло не так по пути.&lt;/p&gt;</description></item></channel></rss>