<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Architecture on CodeOnTime</title><link>https://codeontime.ru/tags/architecture/</link><description>Recent content in Architecture on CodeOnTime</description><generator>Hugo</generator><language>ru-ru</language><lastBuildDate>Wed, 02 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://codeontime.ru/tags/architecture/index.xml" rel="self" type="application/rss+xml"/><item><title>1 млрд токенов/сутки: финальная архитектура, тономика и что мы бы сделали по-другому</title><link>https://codeontime.ru/blog/05-final-architecture/</link><pubDate>Wed, 02 Sep 2026 00:00:00 +0000</pubDate><guid>https://codeontime.ru/blog/05-final-architecture/</guid><description>&lt;h2 id="хук-4500год-против-api"&gt;Хук: ~$4,500/год против API&lt;/h2&gt;&#10;&lt;p&gt;&lt;strong&gt;1 млрд токенов в сутки.&lt;/strong&gt; В пике. В среднем — 600–750M/сутки, ≈220–275B в год. Если бы этот объём шёл через API, он стоил бы &lt;strong&gt;$35–125K в год&lt;/strong&gt; в зависимости от blended-тарифа. На нашем железе — &lt;strong&gt;~$4,500/год&lt;/strong&gt;. Вот как мы дошли до этой цифры — и как ловили себя на нечестных расчётах по пути.&lt;/p&gt;</description></item><item><title>Мы написали балансировщик для 4 реплик vLLM: почему NGINX не работает для LLM</title><link>https://codeontime.ru/blog/04-load-balancer/</link><pubDate>Tue, 01 Sep 2026 00:00:00 +0000</pubDate><guid>https://codeontime.ru/blog/04-load-balancer/</guid><description>&lt;h2 id="хук-nginx-не-понимает-llm"&gt;Хук: NGINX не понимает LLM&lt;/h2&gt;&#10;&lt;p&gt;NGINX round-robin для LLM — это как раздавать билеты в кино: кто пришёл, тот сел. Но LLM-запросы — не билеты.&lt;/p&gt;</description></item></channel></rss>