<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Инференс on CodeOnTime</title><link>https://codeontime.ru/tags/%D0%B8%D0%BD%D1%84%D0%B5%D1%80%D0%B5%D0%BD%D1%81/</link><description>Recent content in Инференс on CodeOnTime</description><generator>Hugo</generator><language>ru-ru</language><lastBuildDate>Mon, 10 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://codeontime.ru/tags/%D0%B8%D0%BD%D1%84%D0%B5%D1%80%D0%B5%D0%BD%D1%81/index.xml" rel="self" type="application/rss+xml"/><item><title>vLLM: как читать метрики и не обмануть себя бенчмарком</title><link>https://codeontime.ru/blog/vllm-metrics-benchmark/</link><pubDate>Mon, 10 Aug 2026 00:00:00 +0000</pubDate><guid>https://codeontime.ru/blog/vllm-metrics-benchmark/</guid><description>&lt;h2 id="проблема"&gt;Проблема&lt;/h2&gt;&#10;&lt;p&gt;«Мы прогнали бенчмарк и vLLM показывает 400 tok/s» — звучит убедительно, но за этим числом легко спрятать проблему. Бенчмарк LLM-инференса — это не одно число. Если читать только «средний throughput», можно принять решение о закупке железа или выборе модели, которое потом не окупится.&lt;/p&gt;</description></item></channel></rss>