RAG: как мерить качество, чтобы «стало лучше» было числом

Проблема

«Мы добавили RAG и стало лучше» — как это проверить? Без измерений это мнение. А без числа нельзя ни дожать качество, ни показать окупаемость, ни сравнить два подхода. RAG-качество можно и нужно мерить.

RAG: как мерить качество, чтобы «стало лучше» было числом

Проблема

«Мы добавили RAG и стало лучше» — как это проверить? Без измерений это мнение. А без числа нельзя ни дожать качество, ни показать окупаемость, ни сравнить два подхода. RAG-качество можно и нужно мерить.

Облако vs on-prem: когда своё железо оправдано — расчёт

Проблема

«Купим GPU» или «взять в облаке» — вопрос, который решают на интуиции. Между тем это чистый FinOps-расчёт: при какой нагрузке и какой цене токена своё железо начинает дешевле облака. Без расчёта легко переплатить в обе стороны.

AWQ vs GGUF vs INT4: что выбрать под ваше железо (на примерах Qwen)

Проблема

«Нам нужна Qwen, но не влезает в VRAM». Ответ почти всегда — квантизация. Но форматов несколько: AWQ, GGUF, INT4, и каждый по-разному влияет на VRAM, качество и скорость. Выбор «на слух» приводит к тому, что модель либо не влезает, либо деградирует, либо медленнее, чем могла бы.

vLLM: как читать метрики и не обмануть себя бенчмарком

Проблема

«Мы прогнали бенчмарк и vLLM показывает 400 tok/s» — звучит убедительно, но за этим числом легко спрятать проблему. Бенчмарк LLM-инференса — это не одно число. Если читать только «средний throughput», можно принять решение о закупке железа или выборе модели, которое потом не окупится.

Расскажите о задаче

Ответим с планом и оценкой в течение 24 часов.