<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>LLM-Инференс on CodeOnTime</title><link>https://codeontime.ru/tags/llm-%D0%B8%D0%BD%D1%84%D0%B5%D1%80%D0%B5%D0%BD%D1%81/</link><description>Recent content in LLM-Инференс on CodeOnTime</description><generator>Hugo</generator><language>ru-ru</language><lastBuildDate>Sun, 16 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://codeontime.ru/tags/llm-%D0%B8%D0%BD%D1%84%D0%B5%D1%80%D0%B5%D0%BD%D1%81/index.xml" rel="self" type="application/rss+xml"/><item><title>RAG: как мерить качество, чтобы «стало лучше» было числом</title><link>https://codeontime.ru/blog/rag-quality-measurement/</link><pubDate>Sun, 16 Aug 2026 00:00:00 +0000</pubDate><guid>https://codeontime.ru/blog/rag-quality-measurement/</guid><description>&lt;h2 id="проблема"&gt;Проблема&lt;/h2&gt;&#10;&lt;p&gt;«Мы добавили RAG и стало лучше» — как это проверить? Без измерений это мнение. А без числа нельзя ни дожать качество, ни показать окупаемость, ни сравнить два подхода. RAG-качество можно и нужно мерить.&lt;/p&gt;</description></item><item><title>Облако vs on-prem: когда своё железо оправдано — расчёт</title><link>https://codeontime.ru/blog/cloud-vs-onprem-calculation/</link><pubDate>Fri, 14 Aug 2026 00:00:00 +0000</pubDate><guid>https://codeontime.ru/blog/cloud-vs-onprem-calculation/</guid><description>&lt;h2 id="проблема"&gt;Проблема&lt;/h2&gt;&#10;&lt;p&gt;«Купим GPU» или «взять в облаке» — вопрос, который решают на интуиции. Между тем это чистый FinOps-расчёт: при какой нагрузке и какой цене токена своё железо начинает дешевле облака. Без расчёта легко переплатить в обе стороны.&lt;/p&gt;</description></item><item><title>AWQ vs GGUF vs INT4: что выбрать под ваше железо (на примерах Qwen)</title><link>https://codeontime.ru/blog/awq-vs-gguf-int4-qwen/</link><pubDate>Wed, 12 Aug 2026 00:00:00 +0000</pubDate><guid>https://codeontime.ru/blog/awq-vs-gguf-int4-qwen/</guid><description>&lt;h2 id="проблема"&gt;Проблема&lt;/h2&gt;&#10;&lt;p&gt;«Нам нужна Qwen, но не влезает в VRAM». Ответ почти всегда — квантизация. Но форматов несколько: AWQ, GGUF, INT4, и каждый по-разному влияет на VRAM, качество и скорость. Выбор «на слух» приводит к тому, что модель либо не влезает, либо деградирует, либо медленнее, чем могла бы.&lt;/p&gt;</description></item><item><title>vLLM: как читать метрики и не обмануть себя бенчмарком</title><link>https://codeontime.ru/blog/vllm-metrics-benchmark/</link><pubDate>Mon, 10 Aug 2026 00:00:00 +0000</pubDate><guid>https://codeontime.ru/blog/vllm-metrics-benchmark/</guid><description>&lt;h2 id="проблема"&gt;Проблема&lt;/h2&gt;&#10;&lt;p&gt;«Мы прогнали бенчмарк и vLLM показывает 400 tok/s» — звучит убедительно, но за этим числом легко спрятать проблему. Бенчмарк LLM-инференса — это не одно число. Если читать только «средний throughput», можно принять решение о закупке железа или выборе модели, которое потом не окупится.&lt;/p&gt;</description></item></channel></rss>