<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Self-Hosted on CodeOnTime</title><link>https://codeontime.ru/tags/self-hosted/</link><description>Recent content in Self-Hosted on CodeOnTime</description><generator>Hugo</generator><language>ru-ru</language><lastBuildDate>Sun, 13 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://codeontime.ru/tags/self-hosted/index.xml" rel="self" type="application/rss+xml"/><item><title>Наш опыт: 1 млрд токенов/сутки на consumer-железе</title><link>https://codeontime.ru/blog/nash-opyt/</link><pubDate>Sun, 13 Sep 2026 00:00:00 +0000</pubDate><guid>https://codeontime.ru/blog/nash-opyt/</guid><description>&lt;p&gt;Это не теория и не «best practices из документации». Это история реального production-деплоя, который мы построили и эксплуатируем: от Tesla M40 до четырёх узлов по 2×RTX 3090, 12 протестированных моделей, 4 итерации тюнинга vLLM за 3 недели и собственный балансировщик для LLM-трафика.&lt;/p&gt;</description></item><item><title>Почему мы собрали LLM-сервер, который жжёт миллиард токенов в сутки</title><link>https://codeontime.ru/blog/01-why-and-hardware/</link><pubDate>Fri, 14 Aug 2026 00:00:00 +0000</pubDate><guid>https://codeontime.ru/blog/01-why-and-hardware/</guid><description>&lt;h2 id="хук-момент-когда-api-стал-болью"&gt;Хук: момент, когда API стал болью&lt;/h2&gt;&#10;&lt;p&gt;В марте 2026 мы посмотрели на счёт за Claude API — &lt;strong&gt;$4,200 за месяц&lt;/strong&gt; — и поняли: наш код-агент сжигает больше токенов, чем мы зарабатываем.&lt;/p&gt;</description></item><item><title>1 млрд токенов/сутки на consumer-железе</title><link>https://codeontime.ru/cases/infrastructure-tuning/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://codeontime.ru/cases/infrastructure-tuning/</guid><description>&lt;h2 id="обзор"&gt;Обзор&lt;/h2&gt;&#10;&lt;p&gt;Это не теория и не «best practices из документации» — это история реального production-деплоя, который мы построили и эксплуатируем: от Tesla M40 до четырёх узлов по 2×RTX 3090, 12 протестированных моделей, 4 итерации тюнинга vLLM за 3 недели и собственный балансировщик для LLM-трафика.&lt;/p&gt;</description></item></channel></rss>