Czy ChatGPT znajdzie Twoją sitemapę? Trzy mechanizmy odkrywania

Piotr Czerwiński
Piotr CzerwińskiZałożyciel CiteLyzer i HiddenJobs
7 min czytania
Udostępnij

Crawlery AI odkrywają Twoją sitemapę na trzy sposoby: przez dyrektywę Sitemap: w pliku robots.txt, przez utarte ścieżki w rodzaju /sitemap.xml oraz przez ręczne zgłoszenie w Google Search Console. Tylko pierwsza ścieżka działa dla wszystkich silników AI. Sitemapa zgłoszona wyłącznie w panelu Google jest dla GPTBot czy PerplexityBot niewidzialna, jakby jej nie było.

Wpisujesz w Google Search Console adres sitemapy, klikasz „Prześlij” i status zmienia się na zielony. Załatwione? Dla Google tak. Ale GPTBot, który zbiera treści dla ChatGPT, tego zgłoszenia nigdy nie zobaczy, bo ono żyje wyłącznie wewnątrz panelu Google.

Crawlery AI nie mają swojego odpowiednika Search Console. Muszą znaleźć Twoją sitemapę same, korzystając z publicznych mechanizmów odkrywania. Tych mechanizmów jest niewiele. Warto wiedzieć, jak działają, bo od nich zależy, czy niezależne boty w ogóle poznają pełną listę Twoich stron.

Stawka jest prosta. Strona, której crawler nie odkryje, nie trafi do bazy treści, z której model AI buduje odpowiedzi. A skoro klient coraz częściej pyta ChatGPT zamiast przeglądać wyniki Google, każda ścieżka odkrywania, którą zamykasz przed botem, zmniejsza Twoje szanse na wzmiankę w odpowiedzi.

Jak crawlery odkrywają sitemapę? Trzy ścieżki

Sitemapa sama się nie ogłasza. Bot, który trafia na Twoją domenę, może się o niej dowiedzieć na trzy sposoby. Każdy z nich ma inny zasięg i to właśnie te różnice decydują, które silniki AI zobaczą Twoją mapę strony.

Porządkuję je od najbardziej wiarygodnego:

  • Dyrektywa Sitemap: w pliku robots.txt. Jedyny oficjalny mechanizm ogłaszania sitemapy, opisany w standardzie sitemaps.org. Widzi go każdy bot, który czyta robots.txt, a czytają go praktycznie wszystkie.
  • Ścieżki konwencyjne. Bot zgaduje utarte adresy: /sitemap.xml, /sitemap_index.xml i podobne. To nie standard, tylko przyzwyczajenie, które zwykle działa.
  • Ręczne zgłoszenie w Google Search Console lub Bing Webmaster Tools. Wygodne, ale prywatne: wie o nim wyłącznie ta jedna wyszukiwarka.

Dlaczego dyrektywa Sitemap: w robots.txt jest najpewniejsza?

Standard sitemaps.org przewiduje dokładnie jeden sposób ogłaszania sitemapy: linię Sitemap: z pełnym adresem w pliku robots.txt. Wygląda to tak: Sitemap: https://twojadomena.pl/sitemap.xml. Linii może być kilka, po jednej na każdą sitemapę.

Dyrektywa przyjmuje absolutne URL-e, także spoza Twojego hosta. Sitemapa trzymana na CDN-ie albo subdomenie jest w pełni zgodna ze standardem, o ile robots.txt wskazuje jej pełny adres.

Z tego mechanizmu korzystają najpopularniejsze systemy. Yoast ogłasza w robots.txt swój sitemap_index.xml, a WordPress bez wtyczek wpisuje tam wp-sitemap.xml. Dzięki temu bot, który przeczyta robots.txt, znajdzie sitemapę niezależnie od tego, jak nietypową nazwę nosi.

Siła tego mechanizmu bierze się z jednego przyzwyczajenia botów: robots.txt to pierwszy plik, po który grzeczny crawler sięga przed pobraniem czegokolwiek innego, bo tam sprawdza, co wolno mu odwiedzić. Skoro i tak go czyta, linię Sitemap: dostaje niejako przy okazji. Nie musi zgadywać ani niczego szukać.

Jakie adresy sitemapy boty sprawdzają w ciemno?

Druga ścieżka to zgadywanie. Gdy robots.txt milczy, bot może odpytać kilka utartych adresów, pod którymi sitemapy leżą najczęściej.

Zgadywanie ma jednak słaby punkt: to konwencja, nie standard. Jeśli Twoja sitemapa nazywa się inaczej, na przykład /mapa-strony.xml, bot polegający na konwencji jej nie znajdzie. Nie masz też gwarancji, że konkretny crawler w ogóle zgaduje, ani które adresy sprawdza. Te sprawdzane najczęściej to:

  • /sitemap.xml. Domyślna nazwa i pierwszy strzał każdego bota. Używa jej większość generatorów oraz frameworków.
  • /sitemap_index.xml. Indeks sitemap znany z wtyczki Yoast, spotykany na ogromnej liczbie stron na WordPressie.
  • /wp-sitemap.xml. Sitemapa wbudowana w sam WordPress, generowana bez żadnej wtyczki.
  • /sitemap.xml.gz. Skompresowany wariant, spotykany głównie w starszych sklepach internetowych.

Dlaczego zgłoszenie w Google Search Console nie wystarczy?

Trzecia ścieżka wygląda najporządniej, a ma najwęższy zasięg. Sitemapę zgłoszoną w Google Search Console widzi wyłącznie Google, a zgłoszoną w Bing Webmaster Tools wyłącznie Bing. To zapis w prywatnej bazie wyszukiwarki, nie publiczna informacja.

Ta pułapka bierze się z przyzwyczajenia. Większość poradników SEO kończy temat sitemapy na kroku „zgłoś ją w Search Console”, bo ta lista powstała w czasach, gdy liczył się tylko Google. Punkt odhaczony, sitemapa „działa”. Tyle że dziś po Twoje treści przychodzą też boty, które z Google nie mają nic wspólnego.

Dla części silników AI to wystarcza. AI Overviews i AI Mode korzystają z indeksu Google, więc zgłoszenie w GSC im służy. Wyszukiwanie w ChatGPT opiera się w dużej mierze na indeksie Bing, więc pomaga mu zgłoszenie w Bing Webmaster Tools.

Problem zaczyna się przy niezależnych crawlerach. GPTBot, PerplexityBot i ClaudeBot budują własne indeksy i nie mają wglądu w panele Google ani Bing. Sitemapa zgłoszona tylko tam jest dla nich niewidzialna, jakby nie istniała. A jeśli w dodatku nie leży pod konwencyjnym adresem, nie znajdzie jej żaden z nich.

Który silnik AI widzi którą ścieżkę?

Zbierzmy to w jednym miejscu. Linia podziału przebiega między silnikami, które korzystają z indeksów wyszukiwarek, a tymi, które budują własny indeks niezależnym crawlerem. Pierwsze dziedziczą to, co wie Google albo Bing, razem z Twoimi zgłoszeniami w panelach. Drugie widzą wyłącznie to, co publiczne.

Poniżej cztery grupy silników i ścieżki, którymi każda z nich może dojść do Twojej sitemapy:

  • AI Overviews i AI Mode (indeks Google). Widzą sitemapę z robots.txt, z konwencyjnych ścieżek oraz ze zgłoszenia w Google Search Console. Najłatwiejsza publiczność.
  • Wyszukiwanie w ChatGPT (w dużej mierze indeks Bing, uzupełniany własnym crawlerem OpenAI). Widzi robots.txt, konwencyjne ścieżki i zgłoszenie w Bing Webmaster Tools. Zgłoszenie w GSC nic mu nie mówi.
  • GPTBot i ClaudeBot (niezależne crawlery OpenAI i Anthropic). Widzą tylko mechanizmy publiczne: robots.txt oraz konwencyjne ścieżki. Panele wyszukiwarek są poza ich zasięgiem.
  • PerplexityBot (własny indeks Perplexity). Tak samo: robots.txt i konwencje. Nic z GSC, nic z Bing Webmaster Tools.

Sedno

Jeśli masz zrobić jedną rzecz po tym artykule, wpisz sitemapę do robots.txt. Otwórz twojadomena.pl/robots.txt i sprawdź, czy jest tam linia zaczynająca się od Sitemap:. Jeśli jej nie ma, dopisz ją z pełnym adresem. Ta jedna linia rozszerza pokrycie z dwóch ekosystemów wyszukiwarek na wszystkie silniki AI, które korzystają z publicznych mechanizmów odkrywania. Zgłoszeń w GSC i Bing Webmaster Tools nie usuwaj, one dalej robią swoją robotę dla Google oraz Bing.

I jedno uczciwe zastrzeżenie na koniec: sitemapa to pomoc, nie warunek. Crawlery przede wszystkim chodzą po linkach, więc dobrze polinkowana strona zostanie odkryta także bez niej. Brak sitemapy to nie katastrofa, tylko utrudnienie. Bot potrzebuje więcej czasu, żeby dotrzeć do stron głęboko w strukturze, a Ty tracisz prosty sposób wskazania mu, co jest ważne i co się zmieniło. Skoro jedna linia w robots.txt załatwia sprawę wszędzie naraz, szkoda z niej nie skorzystać.

Najczęstsze pytania

Czy sitemapa jest konieczna, żeby ChatGPT znalazł moją stronę?

Nie. Crawlery odkrywają strony przede wszystkim przez linki, a sitemapa tylko im to ułatwia. Bez niej bot może potrzebować więcej czasu, żeby dotrzeć do podstron głęboko w strukturze, ale dobrze polinkowana witryna zostanie odkryta i bez sitemapy.

Czy sitemapa zgłoszona w Google Search Console działa dla silników AI?

Tylko dla tych, które korzystają z indeksu Google, czyli AI Overviews i AI Mode. Wyszukiwanie w ChatGPT opiera się w dużej mierze na indeksie Bing, więc przydaje mu się zgłoszenia w Bing Webmaster Tools. Niezależne crawlery, jak GPTBot, PerplexityBot i ClaudeBot, nie widzą żadnego z tych zgłoszeń.

Gdzie umieścić sitemapę, żeby widziały ją wszystkie crawlery AI?

Ogłoś ją w pliku robots.txt linią Sitemap: z pełnym adresem. To jedyny oficjalny mechanizm ze standardu sitemaps.org i jedyny, który czyta każdy bot, niezależnie od tego, na czyim indeksie pracuje.

Czy sitemapa może leżeć na innej domenie, na przykład na CDN-ie?

Tak. Dyrektywa Sitemap: w robots.txt przyjmuje absolutne URL-e, także wskazujące inny host. Sitemapa na CDN-ie albo subdomenie jest zgodna ze standardem, o ile robots.txt podaje jej pełny adres.

Jak sprawdzić, czy moja sitemapa jest ogłoszona w robots.txt?

Otwórz w przeglądarce adres twojadomena.pl/robots.txt i poszukaj linii zaczynającej się od Sitemap:. Jeśli jej nie ma, dopisz ją z pełnym adresem sitemapy. Zajmie to chwilę, a od razu ogłosi mapę strony wszystkim botom, które czytają robots.txt.

Sprawdź, czy AI poleca Twoją markę

CiteLyzer śledzi, czy ChatGPT, Perplexity, Gemini i Google AI Overviews cytują i polecają Twoją markę — i pokazuje, co poprawić. Zacznij od 14 dni za darmo.