Dzielenie na fragmenty (chunking)
Dzielenie na fragmenty to mechanizm przetwarzania treści w potokach RAG, w którym strona jest rozbijana na mniejsze, osobno osadzane w przestrzeni wektorowej jednostki tekstu, a następnie pobierana jest tylko ta jednostka, która semantycznie najlepiej odpowiada zapytaniu użytkownika.
Najważniejsze
- Dzielenie na fragmenty odbywa się na granicach akapitów i nagłówków, dlatego każdy akapit powinien nieść pełną, zamkniętą myśl, zrozumiałą po wyjęciu ze strony.
- Fragment zawierający nierozwiązane zaimki lub odwołania do wcześniejszego kontekstu (np. „jak wspomniano wyżej”) generuje niespójny embedding i może zostać pominięty przez silnik przy pobieraniu wyników.
- Strony z 15 lub więcej rozpoznanymi encjami są cytowane częściej (Wellows, r=0,76, n=15 847), co wskazuje, że gęstość encji w obrębie fragmentu sprzyja jego trafności semantycznej.
Jak to działa
Potoki RAG dzielą stronę na fragmenty, zamieniają każdy z nich na osobny wektor i przy każdym zapytaniu pobierają top-k fragmentów o najwyższym podobieństwie semantycznym do zapytania. Oznacza to, że silnik nigdy nie czyta całej strony: ocenia i cytuje konkretny fragment. Przykład: artykuł o kredytach hipotecznych podzielony na akapity tematyczne daje silnikowi możliwość pobrania wyłącznie sekcji o wymaganiach wkładu własnego, bez pobierania reszty tekstu. Autor treści, który pisze każdy akapit jako samodzielną jednostkę z pełnym podmiotem i orzeczeniem, zwiększa szansę, że właśnie ten fragment trafi do odpowiedzi.
Powiązane pojęcia
- RAG (generowanie wspomagane pobieraniem) Generowanie wspomagane pobieraniem (RAG) to architektura, w której model językowy przed wygenerowaniem odpowiedzi pobiera z zewnętrznego indeksu fragmenty dokumentów semantycznie zbliżone do zapytania, a następnie włącza je do kontekstu generowania, co pozwala odpowiedzi opierać się na aktualnych, konkretnych źródłach.
- Wektor semantyczny (embedding) Wektor semantyczny (embedding) to liczbowa reprezentacja fragmentu tekstu w przestrzeni wielowymiarowej, w której bliskość między wektorami odpowiada bliskości znaczenia, co pozwala silnikowi RAG odnaleźć fragmenty treści semantycznie pasujące do zapytania użytkownika.
- Samodzielny fragment Samodzielny fragment to sekcja treści, która niesie pełną myśl i jest zrozumiała po wyjęciu ze strony, bez odwoływania się do otaczającego kontekstu, co pozwala silnikowi generatywnemu pobrać ją i zacytować bez zniekształcenia sensu.