Wektor semantyczny (embedding)

Wektor semantyczny (embedding) to liczbowa reprezentacja fragmentu tekstu w przestrzeni wielowymiarowej, w której bliskość między wektorami odpowiada bliskości znaczenia, co pozwala silnikowi RAG odnaleźć fragmenty treści semantycznie pasujące do zapytania użytkownika.

Najważniejsze

  • Wektor semantyczny powstaje dla każdego fragmentu strony osobno: potok RAG dzieli treść na akapity i nagłówki, a następnie zamienia każdy z nich na osobny wektor.
  • Fragment zawierający nierozwiązane zaimki lub odesłania do wcześniejszego kontekstu generuje niespójny wektor, co obniża jego szansę na pobranie przez silnik podczas odpowiadania na zapytanie.
  • Strony z 15 lub więcej rozpoznanymi encjami są cytowane częściej (Wellows, r=0,76, n=15 847 wyników AI Overview), co wskazuje, że gęstość znaczeniowa fragmentu wpływa na jakość jego wektora i szansę na selekcję.

Jak to działa

Potok RAG przetwarza stronę jako zbiór oddzielnych fragmentów: każdy akapit lub sekcja wyznaczona nagłówkiem otrzymuje własny wektor semantyczny. Podczas generowania odpowiedzi silnik oblicza podobieństwo wektora zapytania do wektorów wszystkich zindeksowanych fragmentów i pobiera te z najwyższym wynikiem. Fragment, który niesie pełną myśl i zawiera konkretne encje, uzyskuje wektor precyzyjnie opisujący swój temat. Przykładowo: akapit definiujący pojęcie wraz z nazwą własną i liczbą będzie bliżej wektora zapytania o to pojęcie niż akapit ogólny z zaimkami odsyłającymi do poprzedniego zdania.

Powiązane pojęcia

Przeczytaj więcej

Czy AI poleca Państwa firmę?

Bezpłatny Zwiad pokaże to czarno na białym: co odpowiada Państwa serwer robotom AI i kogo silnik wymienia na jedno pytanie z Państwa kategorii. Pierwszy krok kosztuje 0 zł.