Dzielenie na fragmenty (chunking)

Dzielenie na fragmenty to mechanizm przetwarzania treści w potokach RAG, w którym strona jest rozbijana na mniejsze, osobno osadzane w przestrzeni wektorowej jednostki tekstu, a następnie pobierana jest tylko ta jednostka, która semantycznie najlepiej odpowiada zapytaniu użytkownika.

Najważniejsze

  • Dzielenie na fragmenty odbywa się na granicach akapitów i nagłówków, dlatego każdy akapit powinien nieść pełną, zamkniętą myśl, zrozumiałą po wyjęciu ze strony.
  • Fragment zawierający nierozwiązane zaimki lub odwołania do wcześniejszego kontekstu (np. „jak wspomniano wyżej”) generuje niespójny embedding i może zostać pominięty przez silnik przy pobieraniu wyników.
  • Strony z 15 lub więcej rozpoznanymi encjami są cytowane częściej (Wellows, r=0,76, n=15 847), co wskazuje, że gęstość encji w obrębie fragmentu sprzyja jego trafności semantycznej.

Jak to działa

Potoki RAG dzielą stronę na fragmenty, zamieniają każdy z nich na osobny wektor i przy każdym zapytaniu pobierają top-k fragmentów o najwyższym podobieństwie semantycznym do zapytania. Oznacza to, że silnik nigdy nie czyta całej strony: ocenia i cytuje konkretny fragment. Przykład: artykuł o kredytach hipotecznych podzielony na akapity tematyczne daje silnikowi możliwość pobrania wyłącznie sekcji o wymaganiach wkładu własnego, bez pobierania reszty tekstu. Autor treści, który pisze każdy akapit jako samodzielną jednostkę z pełnym podmiotem i orzeczeniem, zwiększa szansę, że właśnie ten fragment trafi do odpowiedzi.

Powiązane pojęcia

Przeczytaj więcej

Czy AI poleca Państwa firmę?

Bezpłatny Zwiad pokaże to czarno na białym: co odpowiada Państwa serwer robotom AI i kogo silnik wymienia na jedno pytanie z Państwa kategorii. Pierwszy krok kosztuje 0 zł.