RAG, czyli skąd AI bierze źródła do odpowiedzi (po ludzku)

Piotr Czerwiński
Piotr CzerwińskiZałożyciel CiteLyzer
7 min czytania
Udostępnij

RAG (Retrieval-Augmented Generation) to technika, w której model AI najpierw wyszukuje pasujące fragmenty treści, a dopiero potem pisze odpowiedź na ich podstawie, zamiast polegać wyłącznie na pamięci z treningu. Tak działają odpowiedzi z wyszukiwaniem w ChatGPT, Perplexity i AI Overviews. Dla Ciebie oznacza to, że fragment Twojej strony może trafić prosto do odpowiedzi, którą czyta klient.

Zapytaj ChatGPT o coś, co wydarzyło się w zeszłym tygodniu. Zanim odpowie, przez moment przeszukuje internet, a w gotowej odpowiedzi pojawiają się odnośniki do stron. Ten krótki moment to RAG w akcji: mechanizm, dzięki któremu AI nie musi polegać wyłącznie na własnej pamięci.

Skrót brzmi technicznie, ale zasada jest prosta i da się ją wytłumaczyć bez informatyki. Warto ją znać, bo to właśnie przez ten mechanizm treść Twojej strony może trafić prosto do odpowiedzi, którą czyta Twój klient. W tym artykule rozkładam RAG na części: jak działa krok po kroku, dlaczego ogranicza zmyślanie i co z tego wynika dla Twojej firmy.

Czym jest RAG, tłumacząc po ludzku?

RAG to skrót od Retrieval-Augmented Generation, po polsku: generowanie wspomagane wyszukiwaniem. Za tą nazwą stoi jedna zmiana. Model nie odpowiada wyłącznie z tego, co zapamiętał podczas treningu. Najpierw wyszukuje fragmenty treści pasujące do pytania, a dopiero potem pisze odpowiedź na ich podstawie.

Najbliższa życiu analogia to student, który przed odpowiedzią zagląda do notatek. Dalej mówi własnymi słowami i sam układa wypowiedź, ale opiera ją na tym, co ma przed oczami, a nie na tym, co pamięta z wykładu sprzed roku. Notatkami są tu strony internetowe, w tym być może Twoja.

Sam termin pochodzi z 2020 roku, z pracy badawczej zespołu Facebook AI Research pod kierunkiem Patricka Lewisa. Od tamtej pory RAG stał się standardem: to na nim opierają się odpowiedzi z wyszukiwaniem w największych silnikach AI.

Jak działa RAG krok po kroku?

Cały mechanizm sprowadza się do trzech kroków, które dzieją się w kilka sekund, zanim zobaczysz odpowiedź.

  • Zapytanie. Silnik dostaje Twój prompt i ocenia, czy wystarczy mu wiedza z treningu, czy potrzebuje świeżych informacji z sieci. Prośby o polecenie firmy, pytania o ceny albo o bieżące wydarzenia zwykle uruchamiają wyszukiwanie.
  • Pobranie fragmentów, po angielsku retrieval. Silnik odpytuje wyszukiwarkę albo własny indeks i wybiera od kilku do kilkunastu fragmentów stron, które najlepiej pasują do pytania. Nie pobiera całych stron, tylko wycinki: akapit, tabelę albo listę.
  • Generowanie z cytowaniem. Model dostaje te fragmenty jako materiał, pisze na ich podstawie odpowiedź i wskazuje strony, z których korzystał, jako źródła.

Z Twojej perspektywy widać tylko efekt końcowy: odpowiedź i odnośniki pod nią albo obok niej. Kolejność kroków ma jednak znaczenie. Najpierw wybór fragmentów, dopiero potem tekst. Jeśli Twoja strona nie przeszła przez krok drugi, nie ma jak pojawić się w trzecim.

Dlaczego RAG ogranicza zmyślanie, ale go nie eliminuje?

Model językowy bez dostępu do źródeł odpowiada z pamięci. Gdy brakuje mu wiedzy, potrafi pewnym tonem uzupełnić luki czymś, co tylko brzmi prawdopodobnie. Branża nazywa to halucynacjami, a po polsku najuczciwiej: zmyślaniem.

RAG ogranicza ten problem u samego źródła. Model ma przed oczami konkretny tekst, więc mniej zgaduje. Ty z kolei możesz kliknąć w odnośnik i porównać odpowiedź z tym, co naprawdę stoi na cytowanej stronie. Odpowiedzi z samej pamięci nie da się zweryfikować jednym kliknięciem.

Do zera jednak nie schodzi. Model potrafi źle streścić pobrany fragment, skleić dwa fragmenty z różnych stron w fałszywą całość albo oprzeć się na źródle nieaktualnym lub po prostu słabym. A gdy wyszukiwanie nie zwróci nic sensownego, wraca do odpowiadania z pamięci. Odpowiedź z odnośnikami jest więc zwykle bliższa faktom, ale nie jest ich gwarancją.

Gdzie RAG spotyka Twoją firmę?

Ten mechanizm pracuje wszędzie tam, gdzie Twoi klienci zadają dziś pytania: ChatGPT, Gemini, Perplexity, AI Overviews i AI Mode mają własne warianty RAG. W ChatGPT to tryb z wyszukiwaniem, w Perplexity przypisy przy zdaniach, w AI Overviews i AI Mode odpowiedź zbudowana nad wynikami Google.

Różni się za to zaplecze. ChatGPT czerpie głównie z indeksu Bing, co opisałem w osobnym artykule o Bingu i widoczności w ChatGPT. Gemini opiera się na wyszukiwarce Google, Perplexity buduje indeks po swojemu, a AI Overviews i AI Mode są częścią wyników Google. Obecność w jednym silniku nie przenosi się więc automatycznie na pozostałe.

Teraz najważniejsze. Gdy klient prosi o polecenie firmy z Twojej branży, silnik pobiera fragmenty rankingów, katalogów, artykułów oraz stron firmowych i z nich składa odpowiedź. Treść Twojej strony może zostać dosłownie pobrana do odpowiedzi, którą klient czyta. To nie metafora: akapit, który dziś stoi na Twojej stronie, bywa jutro materiałem odpowiedzi. Czym dokładnie są źródła w odpowiedziach AI i jak je czytać, wyjaśniam w osobnym artykule.

Jak pisać, żeby fragment Twojej strony trafił do odpowiedzi?

Kluczowe słowo brzmi: fragment. RAG nie ocenia całej strony i nie zabiera jej w całości. Wycina kawałek, który pasuje do pytania. Z tego wynikają trzy praktyczne zasady.

  • Fragment musi bronić się sam. Akapit, który odpowiada na pytanie klienta, powinien zawierać komplet: czego dotyczy, dla kogo i jaka jest odpowiedź. Fragment w stylu „jak wspomnieliśmy wyżej" traci sens po wycięciu z kontekstu, więc silnik ma powód sięgnąć po cudzy.
  • Treść musi być czytelna dla maszyn. Nagłówki, które brzmią jak pytania klientów, krótkie akapity oraz tekst w zwykłym HTML zamiast ukrytego w skryptach. Silnik wybiera fragmenty w ułamkach sekund i wygrywają te, których nie trzeba rozszyfrowywać.
  • Boty muszą mieć wstęp na stronę. Plik robots.txt, który blokuje boty AI, wyklucza Cię z kroku pobierania, a strona odpowiadająca błędami nie ma czego oddać. Bez dostępu nie ma fragmentów, a bez fragmentów nie ma cytowania.
Piotr Czerwiński

Z własnego doświadczenia

Mierzę widoczność własnej domeny w pięciu silnikach AI. Pierwsze cytowania nie prowadziły do strony głównej, choć to ona opisuje produkt najszerzej. Prowadziły do artykułu napisanego pod jedno konkretne pytanie, z odpowiedzią w pierwszym akapicie. Silnik nie szukał najważniejszej strony w serwisie, tylko fragmentu, który najlepiej pasował do promptu. Od tamtej pory każdy tekst zaczynam od akapitu, który mógłby stanąć w odpowiedzi sam.

Piotr Czerwiński · Założyciel CiteLyzer

Sedno

RAG to mechanizm, w którym silnik AI najpierw pobiera fragmenty treści, a potem buduje z nich odpowiedź ze wskazaniem źródeł. Ogranicza zmyślanie, choć go nie eliminuje, i daje Twojej stronie realną drogę do odpowiedzi, którą czyta klient.

Pamiętaj tylko, że to jedna z warstw wiedzy modelu. Obok niej istnieje pamięć treningowa, której nie poprawisz punktowo, oraz wszystko to, co piszą o Tobie inni. Ten szerszy podział rozbieram w artykule o tym, skąd ChatGPT bierze informacje o firmach.

I ostatnia rzecz: nie zgadniesz, czy Twoje fragmenty faktycznie trafiają do odpowiedzi. To widać dopiero w pomiarze. Zadawaj silnikom prompty, które zadałby Twój klient, i notuj, czy pada Twoja nazwa i czy Twoja domena jest w źródłach. Powtarzaj, bo pojedyncza odpowiedź to obraz jednej chwili. Przy większej liczbie promptów i pięciu silnikach tę pracę przejmuje narzędzie do monitoringu widoczności marki w AI.

Najczęstsze pytania

Co to jest RAG w prostych słowach?

RAG (Retrieval-Augmented Generation) to sposób działania AI, w którym model przed odpowiedzią wyszukuje pasujące fragmenty treści i dopiero na ich podstawie pisze odpowiedź. Działa jak student, który przed odpowiedzią zagląda do notatek: mówi własnymi słowami, ale opiera się na tym, co właśnie przeczytał.

Czy ChatGPT korzysta z RAG?

Tak, w trybie z wyszukiwaniem. Gdy ChatGPT potrzebuje aktualnych informacji, pobiera fragmenty stron z indeksu Bing i buduje z nich odpowiedź z odnośnikami do źródeł. Nie robi tego przy każdym pytaniu: na proste albo ponadczasowe pytania odpowiada z pamięci treningowej, bez sięgania do sieci.

Czy RAG eliminuje zmyślanie (halucynacje) AI?

Nie, tylko je ogranicza. Model z pobranymi fragmentami przed oczami mniej zgaduje, ale nadal potrafi źle streścić źródło, skleić fragmenty z różnych stron albo oprzeć się na nieaktualnej treści. Odpowiedź z odnośnikami łatwiej za to zweryfikować, bo widzisz, skąd pochodzi.

Skąd RAG bierze źródła do odpowiedzi?

Z indeksów wyszukiwania. ChatGPT czerpie głównie z Bing, Gemini z wyszukiwarki Google, Perplexity z własnego indeksu, a AI Overviews i AI Mode również z Google. Silnik pobiera z nich nie całe strony, tylko fragmenty, które najlepiej pasują do pytania, i na nich opiera odpowiedź.

Jak sprawdzić, czy moja strona trafia do odpowiedzi AI?

Zadaj silnikom AI pytania, które zadałby Twój klient, i przy każdej odpowiedzi zanotuj, czy pada Twoja nazwa i czy Twoja domena jest wśród źródeł. Powtórz pomiar po kilku dniach, bo odpowiedzi się zmieniają. Przy większej liczbie promptów i silników regularne pomiary przejmie narzędzie do monitoringu widoczności marki w AI.

Sprawdź, czy AI poleca Twoją firmę

CiteLyzer śledzi, czy ChatGPT, Gemini, Perplexity, AI Overviews i AI Mode cytują i polecają Twoją firmę, i pokazuje, co poprawić. Wynik zobaczysz w kilka minut.