Что это
RAG — от английского retrieval-augmented generation, «генерация, дополненная поиском». Расшифровка описывает сам механизм: retrieval, поиск нужных фрагментов, и generation, генерация ответа на их основе.
Архитектуру придумали не вчера — статья Патрика Льюиса с соавторами (исследователи из корпоративной ИИ-лаборатории, а также университетов UCL и NYU) вышла в мае 2020 года на конференции NeurIPS. Смысл был в том, что модель не обязана «помнить» весь мир внутри своих весов — она может подглядывать во внешнюю базу знаний в момент ответа, как человек лезет в справочник вместо того, чтобы всё зазубрить.
Как это работает
Коротко: ваш вопрос превращают в вектор (эмбеддинг), ищут в базе ближайшие по смыслу фрагменты текста (чанки) через векторный поиск, подставляют найденное нейросети как контекст — и только после этого она формулирует ответ, опираясь на подставленные фрагменты, а не на смутную память из обучения.
Именно так работает большинство современных ИИ-поисковиков: Perplexity, ChatGPT с включённым поиском, Google AI Mode, Яндекс Нейро — все они сначала ищут, потом генерируют, а не просто «вспоминают».
Почему это важно вам
RAG — причина, по которой ваш сайт вообще может попасть в ответ нейросети: без этапа поиска модель отвечала бы только тем, что видела при обучении, и свежие статьи туда попасть не могли бы в принципе.
Практический вывод: чтобы стать «найденным фрагментом», текст должен хорошо резаться на самостоятельные куски — с чёткой структурой, короткими самодостаточными абзацами, отдельными ответами на отдельные вопросы.