// RAG и база знаний

RAG: ответы по вашим документам, а не по интернету.

Retrieval-Augmented Generation - это когда модель перед ответом достаёт нужные фрагменты из ваших документов и отвечает по ним, с указанием источника. Так снимается главная претензия к LLM в рабочих задачах: непонятно, откуда взялся ответ и можно ли ему верить.

Из чего это состоит

Подготовка корпуса

Разбор документов, нарезка на фрагменты, чистка дублей и устаревших версий. Скучная часть, от которой качество зависит сильнее, чем от выбора модели.

Поиск, который находит нужное

Векторный поиск сам по себе часто промахивается на терминах и артикулах. Обычно нужен гибрид с обычным поиском и переранжирование.

Ответ со ссылкой на источник

Пользователь видит, из какого документа и какого места взят ответ. Без этого системе не начинают доверять, сколько её ни улучшай.

Оценка качества

Набор реальных вопросов с правильными ответами, на котором видно, стало лучше или хуже после изменений. Иначе улучшения делаются на ощупь.

// Почему мы
Знаем, что качество RAG делается на подготовке данных и поиске, а не на промпте.
Приватность: для чувствительных документов возможна схема, где данные не покидают ваш периметр.
Собираем набор для оценки с самого начала, чтобы «стало лучше» можно было показать, а не почувствовать.
Доводим до продукта: поиск живёт внутри интерфейса, которым пользуются, а не в тестовом скрипте.
// Частые вопросы

Что такое RAG простыми словами?

Модель перед ответом ищет в ваших документах подходящие куски и отвечает по ним. Как сотрудник, который перед ответом заглядывает в регламент, а не отвечает по памяти.

Чем RAG лучше дообучения модели?

Документы меняются. RAG обновляется вместе с ними: положили новую версию регламента - система отвечает по ней. Дообучение так не умеет и стоит дороже.

Наши документы уйдут наружу?

Только если вы это разрешите. Для чувствительных корпусов используем self-hosted модели или схему, где наружу уходит минимум.

Сколько документов нужно, чтобы это имело смысл?

Дело не в количестве, а в том, сколько времени люди тратят на поиск. Если ответ находится за полминуты обычным поиском, RAG не нужен.

// Читать также

Что такое RAG и когда он нужен бизнесу

RAG — это ответы модели по вашим документам, а не по интернету, с видимым источником под каждым утверждением. Разбираем, из чего он состоит, где теряется качество на нарезке и обновлении, как считать, что он работает, и когда он не нужен.

Нарезка документов для RAG: почему чанки важнее модели

Плохой ответ RAG-системы почти всегда родом не из модели, а из нарезки. Разбираем, как резать регламенты, договоры, PDF-сканы и тикеты поддержки, что ломается на корпусе из десятков тысяч длинных документов и как понять, что виновата именно нарезка.

Как обновлять базу знаний RAG, не останавливая систему

Демо живёт на статичном корпусе, продакшн — на меняющемся. Разбираем инкрементальное обновление вместо полной переиндексации, подмену индекса без рестарта, удаление документов и то, какие метрики показывают деградацию поиска раньше, чем о ней сообщат пользователи.

Бесплатный инструмент

Чек-лист: готовы ли ваши данные к RAG

PDF, 2 страницы. Без регистрации и без почты — просто файл.

Открыть →

Знания есть, а найти их невозможно? Разберём задачу.

Обсудить проект