AI и ML
RAG
Также называют: поиск с дополнением генерации, RAG система, чат-бот по базе знаний
Определение
RAG — схема, при которой языковая модель перед ответом ищет подходящие фрагменты в вашей базе знаний и отвечает по ним: это даёт актуальные данные и ссылку на источник без дообучения самой модели.
Конвейер состоит из двух частей. На этапе подготовки документы — регламенты, инструкции, описания услуг, переписка поддержки — режутся на фрагменты, каждый фрагмент превращается в эмбеддинг и складывается в векторное хранилище. На этапе ответа вопрос пользователя тоже переводится в вектор, из хранилища достаются ближайшие фрагменты, часто с дополнительной пересортировкой более точной моделью, и они подставляются в промпт вместе с инструкцией «отвечай только по этим материалам, при отсутствии данных так и скажи». Модель формулирует ответ и приводит ссылки на использованные документы.
Сравнение с дообучением объясняет, почему RAG стал стандартным ответом на задачу «бот по нашим документам». Дообучение переносит в модель стиль и формат, но плохо переносит факты, стоит дороже, требует данных в нужном виде и устаревает вместе с документами: обновили регламент — нужно переучивать. RAG обновляется переиндексацией, отвечает по актуальной версии документа, позволяет проверить ответ по ссылке и разграничить доступ так, чтобы сотрудник видел только то, что ему положено. Для внутренней базы знаний, поддержки и подбора по каталогу это решающие свойства.
Качество RAG определяется поиском, а не моделью, и это главное практическое открытие для большинства команд. Если нужный фрагмент не нашёлся, самая сильная модель ответит неправильно или откажется отвечать. Отсюда рабочие точки внимания: как нарезаны документы (слишком мелко — теряется контекст, слишком крупно — в промпт попадает мусор), есть ли пересортировка результатов, учитываются ли синонимы и профессиональный жаргон, комбинируется ли векторный поиск с обычным полнотекстовым. И обязательный элемент — набор тестовых вопросов с эталонными ответами, на котором проверяется каждое изменение конвейера.
Смежные термины
- LLMLLM — большая языковая модель: нейросеть, обученная на огромных объёмах текста предсказывать следующий токен, из-за чего она умеет писать, пересказывать и отвечать, но не хранит фактов как база данных и может уверенно ошибаться.
- ЭмбеддингиЭмбеддинги — числовые векторы, в которые модель переводит текст, картинку или товар так, что близкие по смыслу объекты оказываются рядом в пространстве: на этом строятся семантический поиск, рекомендации и поиск дублей.
- Промпт-инжинирингПромпт-инжиниринг — проектирование инструкций для языковой модели: роль, контекст, задача, формат ответа и ограничения формулируются так, чтобы результат был воспроизводимым, а качество проверялось на наборе тестовых примеров, а не на впечатлении.
- AI-агентAI-агент — программа, где языковая модель не просто отвечает, а действует: получает цель, сама выбирает инструменты (поиск, API, база данных, отправка письма), выполняет шаги в цикле и останавливается, когда задача решена или исчерпан лимит.
- 152-ФЗ152-ФЗ — закон «О персональных данных», который обязывает собирать данные россиян в базах на территории России, уведомлять Роскомнадзор об обработке, брать отдельное согласие на неё и сообщать об утечке в течение 24 часов.
Услуги по теме
- Разработка AI и ML-решенийМы делаем AI, который решает конкретную задачу и окупается, а не демо ради демо. Классификаторы, рекомендации, обработка текста и документов, ассистенты на LLM, интеграция моделей в существующий продукт.
- IT-консалтинг и продуктовый аудитСамые дорогие ошибки в разработке делаются до первой строчки кода: неверно понятая задача, стек, выбранный по привычке подрядчика, и ТЗ, которого нет. Консалтинг нужен, чтобы разобраться до того, как начнётся счётчик разработки: что именно строить, из чего, за сколько и в каком порядке. Результат — документ, а не мнение на созвоне.
- Разработка веб-приложений и Telegram Mini AppКогда сайта уже мало и нужен продукт: личный кабинет, дашборд, внутренний сервис или Mini App внутри Telegram. Проектируем архитектуру, пишем бэкенд и фронтенд, доводим до релиза.
Почитать подробнее
- ИИ-ассистент на своей базе знаний: как работает RAG и сколько стоит внедрениеРазбираем, чем RAG-ассистент отличается от бота с кнопками и от LLM без данных, откуда берутся галлюцинации и что их реально снижает, сколько стоит SaaS против кастомной разработки и на каком месяце проект выходит в ноль.
- Где бизнесу реально нужен AI и ML, а где это дорогой хайпИИ окупается там, где есть повторяющееся решение, много однотипных данных и допустимость ошибки. Если хоть одного условия нет — не надо. Разбираем задачи, которые действительно работают, реалистичную точность, стоимость эксплуатации и формат пилота на 4–6 недель.
Нужна помощь с этим на практике?
Мы не только объясняем термины, но и делаем это руками. Опишите задачу — разберём и пришлём смету по этапам.