<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Rtx-3090 on CodeOnTime</title><link>https://codeontime.ru/tags/rtx-3090/</link><description>Recent content in Rtx-3090 on CodeOnTime</description><generator>Hugo</generator><language>ru-ru</language><lastBuildDate>Sun, 13 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://codeontime.ru/tags/rtx-3090/index.xml" rel="self" type="application/rss+xml"/><item><title>Наш опыт: 1 млрд токенов/сутки на consumer-железе</title><link>https://codeontime.ru/blog/nash-opyt/</link><pubDate>Sun, 13 Sep 2026 00:00:00 +0000</pubDate><guid>https://codeontime.ru/blog/nash-opyt/</guid><description>&lt;p&gt;Это не теория и не «best practices из документации». Это история реального production-деплоя, который мы построили и эксплуатируем: от Tesla M40 до четырёх узлов по 2×RTX 3090, 12 протестированных моделей, 4 итерации тюнинга vLLM за 3 недели и собственный балансировщик для LLM-трафика.&lt;/p&gt;</description></item><item><title>1 млрд токенов/сутки: финальная архитектура, тономика и что мы бы сделали по-другому</title><link>https://codeontime.ru/blog/05-final-architecture/</link><pubDate>Wed, 02 Sep 2026 00:00:00 +0000</pubDate><guid>https://codeontime.ru/blog/05-final-architecture/</guid><description>&lt;h2 id="хук-4500год-против-api"&gt;Хук: ~$4,500/год против API&lt;/h2&gt;&#10;&lt;p&gt;&lt;strong&gt;1 млрд токенов в сутки.&lt;/strong&gt; В пике. В среднем — 600–750M/сутки, ≈220–275B в год. Если бы этот объём шёл через API, он стоил бы &lt;strong&gt;$35–125K в год&lt;/strong&gt; в зависимости от blended-тарифа. На нашем железе — &lt;strong&gt;~$4,500/год&lt;/strong&gt;. Вот как мы дошли до этой цифры — и как ловили себя на нечестных расчётах по пути.&lt;/p&gt;</description></item><item><title>vLLM на 2×RTX 3090: от 18 до 100 tok/s — MTP, TP, KV-cache, OMP_NUM_THREADS</title><link>https://codeontime.ru/blog/03-vllm-tuning/</link><pubDate>Fri, 28 Aug 2026 00:00:00 +0000</pubDate><guid>https://codeontime.ru/blog/03-vllm-tuning/</guid><description>&lt;h2 id="хук-18-toks--100-toks-за-3-недели"&gt;Хук: 18 tok/s → 100 tok/s за 3 недели&lt;/h2&gt;&#10;&lt;p&gt;Первый запуск vLLM на 2×3090 дал нам 18 tok/s. Через 3 недели — 75. Разница — &lt;strong&gt;4 параметра в конфиге и 2 дня отладки&lt;/strong&gt;. Вот эти 4 параметра, и вот что пошло не так по пути.&lt;/p&gt;</description></item><item><title>Как мы выбрали Qwen3.8-27B из 12 моделей: бенчмарки, MTP и почему 27B — sweet spot</title><link>https://codeontime.ru/blog/02-model-selection/</link><pubDate>Fri, 21 Aug 2026 00:00:00 +0000</pubDate><guid>https://codeontime.ru/blog/02-model-selection/</guid><description>&lt;h2 id="хук-12-моделей-1-победитель"&gt;Хук: 12 моделей, 1 победитель&lt;/h2&gt;&#10;&lt;p&gt;Мы протестировали 12 моделей на своём 2×3090. 8 из них — мусор для агентного кодинга. 3 — нормальные. 1 — та, что мы используем каждый день. Вот как мы это выяснили.&lt;/p&gt;</description></item><item><title>Почему мы собрали LLM-сервер, который жжёт миллиард токенов в сутки</title><link>https://codeontime.ru/blog/01-why-and-hardware/</link><pubDate>Fri, 14 Aug 2026 00:00:00 +0000</pubDate><guid>https://codeontime.ru/blog/01-why-and-hardware/</guid><description>&lt;h2 id="хук-момент-когда-api-стал-болью"&gt;Хук: момент, когда API стал болью&lt;/h2&gt;&#10;&lt;p&gt;В марте 2026 мы посмотрели на счёт за Claude API — &lt;strong&gt;$4,200 за месяц&lt;/strong&gt; — и поняли: наш код-агент сжигает больше токенов, чем мы зарабатываем.&lt;/p&gt;</description></item><item><title>1 млрд токенов/сутки на consumer-железе</title><link>https://codeontime.ru/cases/infrastructure-tuning/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://codeontime.ru/cases/infrastructure-tuning/</guid><description>&lt;h2 id="обзор"&gt;Обзор&lt;/h2&gt;&#10;&lt;p&gt;Это не теория и не «best practices из документации» — это история реального production-деплоя, который мы построили и эксплуатируем: от Tesla M40 до четырёх узлов по 2×RTX 3090, 12 протестированных моделей, 4 итерации тюнинга vLLM за 3 недели и собственный балансировщик для LLM-трафика.&lt;/p&gt;</description></item></channel></rss>