Языковая модель знает почти всё, кроме одного — вашей компании. Она не в курсе, какие у вас цены, что написано в договоре с клиентом, какой регламент возврата и есть ли товар на складе. Спросите её об этом напрямую — и она либо честно откажется, либо придумает правдоподобный ответ. Второе хуже.
RAG — технология, которая решает ровно эту проблему. Она превращает универсальную модель в сотрудника, который прочитал все ваши документы и отвечает строго по ним.
Без RAG ИИ-агент — это умный собеседник, который угадывает. С RAG — исполнитель, который ищет ответ в ваших документах и умеет сказать «этого в базе нет».
Что такое RAG простыми словами
RAG — Retrieval-Augmented Generation, генерация, дополненная поиском. Название пугает, механика простая, в три шага:
- Вы один раз загружаете документы компании в специальную базу.
- Приходит вопрос — система сначала находит в этой базе релевантные куски текста.
- Модель формулирует ответ, опираясь на найденные куски, а не на свою общую эрудицию.
Аналогия. Вы наняли сотрудника и дали ему прочитать все инструкции, прайсы и FAQ. Но он не запоминает их наизусть — он держит папку под рукой и каждый раз сверяется. Именно поэтому он не выдумывает: перед ответом он смотрит в документ.
Ключевая деталь, которую часто упускают: модель ничего не «запоминает» и не переобучается. Документы остаются вашими, лежат в вашей базе, и обновить их — значит просто заменить файл. Дообучение модели (fine-tuning) — совсем другая, гораздо более дорогая и медленная история, и для задачи «отвечать по нашим документам» она почти никогда не нужна.
Почему обычного ChatGPT недостаточно
Универсальная модель не знает и знать не может:
- ваши цены, скидки и условия для конкретных клиентов;
- ассортимент и остатки на складе;
- внутренние регламенты — как оформить возврат, кто согласует договор;
- историю переписки с этим клиентом;
- специфику вашей отрасли в Узбекистане — от требований к документам до сложившейся практики.
Можно возразить: «а если просто вставить документы в переписку?» На маленьком объёме это работает и является нормальным первым шагом. Но десяток документов ещё поместится в один запрос, а тысяча — уже нет. И даже если поместится, вы будете платить за все эти страницы при каждом вопросе, а модель начнёт хуже находить нужное в большом объёме. RAG подставляет только те 3–5 фрагментов, которые действительно относятся к вопросу.
Как это устроено внутри
1. Разбиение на фрагменты
Документы режутся на куски по 500–1000 символов с небольшим нахлёстом. Форматы — PDF, Word, Excel, таблицы, веб-страницы, выгрузки из 1С и CRM. Нахлёст нужен, чтобы мысль, разорванная границей фрагмента, не потерялась целиком.
2. Векторизация
Каждый фрагмент превращается в набор чисел — вектор, математическое представление смысла. Это и есть главный трюк: поиск идёт не по словам, а по смыслу.
Пример. Запрос «какие есть скидки» найдёт фрагмент «специальные предложения и акции для постоянных клиентов», хотя слова «скидки» там нет вообще. Обычный поиск по ключевым словам вернул бы пустоту.
3. Векторная база
Векторы хранятся в базе — pgvector (расширение обычного PostgreSQL), Pinecone, Weaviate. Поиск по сотням тысяч фрагментов занимает миллисекунды. Для большинства компаний до 150 человек хватает pgvector: не нужен отдельный сервис, данные лежат рядом с остальными.
4. Генерация ответа
Найденные фрагменты уходят в модель вместе с вопросом и инструкцией: отвечать только по этим данным. Если ответа в них нет — так и сказать. Эта инструкция важнее, чем кажется: именно она отличает систему, которой можно доверять, от системы, которая красиво врёт.
Требуйте, чтобы агент показывал источник — название документа и раздел. Это нужно не для красоты: сотрудник может проверить ответ за десять секунд, а вы увидите, какие документы устарели.
Где RAG применяют
| Область | Что загружают в базу | Что меняется |
|---|---|---|
| Клиентская поддержка | Каталог, FAQ, условия доставки и гарантии | Типовые вопросы закрываются без оператора, человек подключается на сложных |
| Юридический отдел | Договоры, регламенты, нормативные акты РУз | Поиск нужного пункта — секунды вместо получаса |
| Отдел продаж | Коммерческие предложения, кейсы, презентации | Менеджер получает готовый ответ со ссылкой на документ |
| Онбординг | Процессы, инструкции, внутренние правила | Новичок задаёт вопросы боту, а не отвлекает коллег |
Общее у всех четырёх: ответы существуют, они записаны, но найти их дольше, чем спросить у человека. RAG убирает именно этот разрыв.
Где RAG ломается
Про это редко пишут, а стоит знать заранее — все три проблемы решаемы, но их надо предусмотреть.
Устаревшие документы. Агент честно ответит по базе — и если в базе прайс полугодовой давности, он назовёт старую цену. Технология тут ни при чём, нужен регламент обновления и ответственный за него.
Противоречия внутри базы. Если в одном документе написано одно, а в другом другое, система найдёт оба фрагмента и выдаст средневзвешенную ерунду. Загрузка документов почти всегда обнаруживает противоречия, о которых компания не знала. Это неприятно, но полезно.
Плохо структурированные исходники. Скан договора картинкой, таблица со склеенными ячейками, презентация из одних картинок — всё это либо не читается, либо режется на бессмысленные куски. Подготовка документов — обычно самая трудоёмкая часть проекта, и делает её не подрядчик, а тот, кто знает содержимое.
Сколько это стоит
Стоимость складывается из двух разных вещей, и их важно не путать.
Разработка — разовые работы: подготовка документов, настройка базы, интеграция с каналом, где люди будут спрашивать, тестирование на реальных вопросах. Мы делаем это пилотом от $1 500: один процесс, 2–3 недели, измеримый результат до расширения.
Эксплуатация — расходы на API модели, обычно десятки долларов в месяц при типовой нагрузке малого и среднего бизнеса. Векторная база на pgvector отдельных денег не стоит, если у вас уже есть PostgreSQL.
Подробный разбор бюджетов — в статье сколько стоит ИИ-автоматизация.
Частые вопросы
Наши документы попадут в обучение модели?
Нет. Фрагменты передаются в запросе и не используются для обучения — при корректной настройке и на тарифах, где это гарантировано провайдером. Сами документы остаются в вашей базе. Это стоит проверять и фиксировать в договоре, а не принимать на веру.
Сколько документов нужно для старта?
Достаточно тех, что покрывают самые частые вопросы. Обычно это 20–50 файлов, а не весь архив. Начинать со «сначала оцифруем всё» — верный способ не запуститься никогда.
Что будет, если ответа в базе нет?
Правильно настроенный агент говорит «в базе этого нет» и передаёт вопрос человеку. Это не недостаток, а требование: система, которая всегда что-то отвечает, рано или поздно ответит неправильно.
Работает ли RAG на узбекском?
Да, современные модели работают с узбекским, русским и английским. На узбекском качество поиска по смыслу немного ниже, чем на русском, — это проверяется на ваших реальных вопросах в пилоте, а не на обещаниях.
Чем это отличается от обычного поиска по сайту?
Поиск возвращает список документов и оставляет чтение вам. RAG возвращает ответ на заданный вопрос — со ссылкой на документ, если нужно проверить.
С чего начать
Соберите список из двадцати вопросов, которые чаще всего задают вашим сотрудникам клиенты или коллеги. Если ответы на них существуют в документах, но их долго искать — у вас есть задача для RAG. Если ответы живут только в головах — сначала их придётся записать, и это работа вне ИИ.
Хотите проверить на своих документах — мы делаем бесплатный разбор: смотрим, что у вас есть, и говорим прямо, если базы для RAG пока не хватает.
