LLM-Инференс
RAG: как мерить качество, чтобы «стало лучше» было числом
Проблема
«Мы добавили RAG и стало лучше» — как это проверить? Без измерений это мнение. А без числа нельзя ни дожать качество, ни показать окупаемость, ни сравнить два подхода. RAG-качество можно и нужно мерить.
RAG: как мерить качество, чтобы «стало лучше» было числом
Проблема
«Мы добавили RAG и стало лучше» — как это проверить? Без измерений это мнение. А без числа нельзя ни дожать качество, ни показать окупаемость, ни сравнить два подхода. RAG-качество можно и нужно мерить.
Облако vs on-prem: когда своё железо оправдано — расчёт
Проблема
«Купим GPU» или «взять в облаке» — вопрос, который решают на интуиции. Между тем это чистый FinOps-расчёт: при какой нагрузке и какой цене токена своё железо начинает дешевле облака. Без расчёта легко переплатить в обе стороны.
AWQ vs GGUF vs INT4: что выбрать под ваше железо (на примерах Qwen)
Проблема
«Нам нужна Qwen, но не влезает в VRAM». Ответ почти всегда — квантизация. Но форматов несколько: AWQ, GGUF, INT4, и каждый по-разному влияет на VRAM, качество и скорость. Выбор «на слух» приводит к тому, что модель либо не влезает, либо деградирует, либо медленнее, чем могла бы.
vLLM: как читать метрики и не обмануть себя бенчмарком
Проблема
«Мы прогнали бенчмарк и vLLM показывает 400 tok/s» — звучит убедительно, но за этим числом легко спрятать проблему. Бенчмарк LLM-инференса — это не одно число. Если читать только «средний throughput», можно принять решение о закупке железа или выборе модели, которое потом не окупится.