Термин

Эмбеддинг (вектор смысла)

Числовое представление текста — набор из сотен или тысяч чисел, где смысл фразы закодирован так, что похожие по смыслу тексты оказываются близко друг к другу, даже без общих слов.

Что это

Эмбеддинг — от английского embedding, «вложение». Нейросеть превращает любой фрагмент текста в длинный список чисел — вектор. Устроено это так, что фразы с похожим смыслом получают похожие векторы, а с разным — далёкие друг от друга, даже если ни одного общего слова между ними нет.

Пример: фразы «как найти учеников без рекламы» и «привлечение клиентов без бюджета на трафик» не имеют общих слов, кроме предлогов, но по смыслу — об одном и том же. Их эмбеддинги окажутся рядом в этом числовом пространстве, потому что модель кодирует не буквы, а смысл.

Зачем это нужно

Именно эмбеддинги делают возможным векторный поиск — поиск не по совпадению слов, а по близости смысла. Каждый чанк вашего текста при индексации превращают в такой вектор и кладут в базу; когда приходит вопрос, его тоже превращают в вектор и ищут ближайшие.

Без этого шага ИИ-поиск работал бы как обычный поиск по ключевым словам девяностых — совпадение фраз буква в букву, без понимания синонимов и перефразировок.

Почему это важно вам

Для вас это означает: не нужно гадать точную формулировку, которую наберёт пользователь. Если смысл материала передан ясно, эмбеддинг найдёт его и по перефразированному вопросу — при условии, что текст вообще написан понятным языком, без двусмысленностей и жаргона, который меняет смысл фразы для машины так же, как для человека.