Knowledge cutoff - dlaczego AI opowiada o Twojej firmie stare rzeczy

Piotr Czerwiński
Piotr CzerwińskiZałożyciel CiteLyzer
7 min czytania
Udostępnij

Knowledge cutoff to data graniczna wiedzy modelu AI: dzień, w którym zakończono zbieranie danych do jego treningu. Wszystko, co wydarzyło się po tej dacie, dla modelu nie istnieje, dopóki nie sięgnie do wyszukiwania. Dlatego ChatGPT potrafi pewnym tonem opisywać Twoją starą ofertę, nieaktualny cennik albo prezesa, który dawno odszedł.

Wyobraź sobie: firma przeniosła siedzibę, strona i mapy są aktualne, a ChatGPT dalej wysyła klientów pod stary adres. Bez wahania, tonem kogoś, kto właśnie sprawdził. To nie usterka. Tak z założenia działa knowledge cutoff, czyli data graniczna wiedzy modelu.

O tym mechanizmie wspomniałem już w artykule „Skąd ChatGPT bierze informacje o firmach". Dane treningowe to pierwsza z trzech opisanych tam warstw wiedzy modelu, obok wyszukiwania na żywo i cudzych treści w sieci. Tu biorę tę pierwszą warstwę pod lupę. Zobaczysz, dlaczego wiedza z treningu się starzeje, jak sprawdzić, którą wersję Twojej firmy model pamięta, i co realnie da się z tym zrobić.

Czym jest knowledge cutoff, czyli data graniczna wiedzy modelu?

Model AI uczy się na ogromnym zbiorze tekstów z internetu, a ten zbiór ma datę zamknięcia. Artykuły, katalogi i strony sprzed tej daty weszły do pamięci modelu. Wszystko późniejsze nie weszło i już nie wejdzie. Ta data zamknięcia to właśnie knowledge cutoff.

Dla modelu świat kończy się w dniu granicznym. Nowa oferta, zmiana nazwy, przeprowadzka albo nowy zarząd: z jego perspektywy te wydarzenia nie zaistniały. Zapytany o coś późniejszego, model albo przyzna, że nie wie, albo odpowie starą wiedzą, jakby nic się nie zmieniło. Dopiero sięgnięcie do wyszukiwania daje mu szansę zobaczyć stan dzisiejszy.

Każdy model ma własną datę graniczną i zwykle jest ona starsza, niż podpowiada intuicja. Między zamknięciem danych a udostępnieniem modelu mijają miesiące treningu i testów. Model, z którym rozmawiasz dziś, opisuje więc świat sprzed wielu miesięcy, a bywa, że znacznie starszy.

Po czym poznasz, że AI opisuje starą wersję Twojej firmy?

Objawy są zawsze podobne. Model wymienia usługę, którą dawno wycofano, podaje cennik sprzed podwyżki, przedstawia byłego prezesa jako obecnego albo zaprasza do zamkniętej lokalizacji. I robi to z pełnym przekonaniem: nie zastrzega, że opisuje stan sprzed lat, tylko podaje starą wersję Twojej firmy jako aktualną.

Ta pewność siebie to najbardziej zdradliwa część. Model nie czuje, że jego wiedza się zestarzała. Odpowiedź z pamięci treningowej i odpowiedź po wyszukiwaniu wyglądają dla klienta tak samo wiarygodnie: płynny tekst i konkretne fakty. Tylko że jedne fakty pochodzą z dzisiejszej sieci, a drugie sprzed daty granicznej.

Klient ogląda tę starą wersję częściej, niż myślisz. Wiele pytań nie uruchamia wyszukiwania: model uznaje, że zna odpowiedź, i odpowiada z pamięci. Poznasz to po braku odnośników do źródeł. Pytania w rodzaju „czym zajmuje się firma X" albo „czy firmie X można zaufać" często dostają odpowiedź właśnie z tej zamrożonej warstwy.

Dlaczego modele AI nie aktualizują wiedzy na bieżąco?

Trening modelu to operacja przeprowadzana raz na jakiś czas, nie codziennie. Trwa tygodniami, pochłania ogromną moc obliczeniową i wymaga długich testów. Nikt nie aktualizuje modelu co wieczór, żeby nadążyć za wczorajszymi zmianami na stronach firm.

Ważniejsza jest jednak druga rzecz: aktualizacja wiedzy nie polega na edycji. Nie istnieje mechanizm „popraw wpis o mojej firmie w modelu". Świeższa wiedza przychodzi dopiero z nową wersją modelu, wytrenowaną od nowa na świeższym zbiorze danych. Do tego czasu stara wersja Twojej firmy jest wbudowana w model na stałe.

Dostawcy łagodzą ten problem wyszukiwaniem: model sięga do internetu, gdy uzna, że pytanie wymaga aktualnych informacji. To jednak nakładka na zamrożoną pamięć, nie jej naprawa. Gdy wyszukiwanie się nie uruchomi, na wierzch wychodzi wiedza sprzed daty granicznej.

Jak sprawdzić, co model pamięta o Twojej firmie?

Test zajmuje kilka minut. Otwórz nową rozmowę, żeby wcześniejsze wątki nie podpowiadały modelowi kontekstu. Poproś wprost: „odpowiedz z własnej wiedzy, bez wyszukiwania w internecie". Potem zadaj pytania, które zadałby klient: czym zajmuje się Twoja firma, co oferuje, gdzie działa i kto nią kieruje.

Odpowiedź porównaj z prawdą punkt po punkcie. Zgadza się oferta? Ceny? Nazwiska? Adresy? Każda rozbieżność pokazuje wiek pamięci modelu. Sprawdź jeszcze, czy w odpowiedzi nie ma odnośników do źródeł: ich brak zwykle oznacza, że model odpowiadał z pamięci, a nie z sieci.

Może się też okazać, że model nie wie o Tobie nic albo myli Cię z inną firmą o podobnej nazwie. To również cenny wynik: znaczy, że w danych treningowych było o Tobie za mało. Powtórz test w kilku modelach, bo każdy trenowano na innym zbiorze i z inną datą graniczną. Ta sama firma potrafi mieć w jednym modelu opis sprzed lat, w drugim całkiem trafny, a w trzecim żaden.

Piotr Czerwiński

Z własnego doświadczenia

Mierzę widoczność własnego produktu w kilku silnikach AI, a produkt jest młodszy niż daty graniczne modeli, które go opisują. Pytane bez wyszukiwania, modele nie mają go skąd znać: przyznają, że nie wiedzą, albo zgadują. Ten sam prompt z wyszukiwaniem daje już konkretną odpowiedź ze źródłami. Dwie warstwy wiedzy widać wtedy jak na dłoni i właśnie ta różnica przekonała mnie, żeby mierzyć je osobno.

Piotr Czerwiński · Założyciel CiteLyzer

Co możesz zrobić ze starą wiedzą modelu, a czego się nie da?

Zacznij od rzeczy niemożliwej, bo ta wiedza oszczędza pieniądze: pamięci modelu nie edytujesz. Żaden formularz, żadna usługa i żaden zabieg na stronie nie poprawią tego, co model zapamiętał z treningu. Jeśli ktoś oferuje „aktualizację danych w ChatGPT", oferuje coś, czego dostawcy modeli nie udostępniają.

Realne pole działania leży obok pamięci, nie w niej:

  • Wymuś świeżość przez wyszukiwanie. Model, który szuka, czyta dzisiejszy internet. Aktualna, konkretna strona firmy oraz aktualne cudze treści (katalogi, rankingi i artykuły branżowe) sprawiają, że warstwa wyszukiwania ma skąd wziąć poprawną wersję.
  • Zadbaj o spójną narrację w wielu miejscach. Kolejny trening zbierze to, co będzie wtedy w sieci. Im więcej źródeł opisuje firmę zgodnie i aktualnie, tym większa szansa, że następna wersja modelu zapamięta wersję poprawioną, a nie mieszankę starego z nowym.
  • Wpisz cierpliwość w plan. Nowe wersje modeli wychodzą co pewien czas i dopiero one wymieniają zamrożoną pamięć. Treści publikowane dziś pracują na odpowiedzi z wyszukiwania od razu, a na pamięć modeli z opóźnieniem.

Sedno

Knowledge cutoff sprawia, że każdy model AI opisuje Twoją firmę z opóźnieniem, a wyszukiwanie tylko czasami to opóźnienie nadrabia. Klient nie widzi, z której warstwy przyszła odpowiedź. Ty możesz to zobaczyć.

ChatGPT, Gemini, Perplexity, AI Overviews i AI Mode potrafią tego samego dnia pokazać różne obrazy tej samej firmy: jeden z pamięci, drugi z wyszukiwania, trzeci sklejony z obu. Pojedyncze sprawdzenie daje obraz jednej chwili, więc liczy się powtarzalność. Regularny pomiar pokazuje, którą wersję Twojej firmy silniki serwują dziś, gdzie odpowiedź jest aktualna, a gdzie odgrzewana, i czy Twoje poprawki w sieci zaczynają być widoczne. Ręcznie zrobisz to raz. Systematycznie robi to monitoring widoczności marki w AI, a Ty zaczynasz od tego, że wiesz, zamiast zgadywać.

Najczęstsze pytania

Czym jest knowledge cutoff w modelach AI?

Knowledge cutoff, po polsku data graniczna wiedzy, to dzień, w którym zakończono zbieranie danych do treningu modelu. Model zna tylko to, co było w sieci przed tą datą. Wszystko późniejsze dla niego nie istnieje, dopóki nie sięgnie do wyszukiwania na żywo.

Dlaczego ChatGPT podaje nieaktualne informacje o mojej firmie?

Bo na wiele pytań odpowiada z pamięci treningowej, bez zaglądania do internetu, a ta pamięć kończy się na dacie granicznej. Jeśli oferta, ceny albo zarząd zmieniły się później, model dalej opisuje starą wersję i robi to pewnym tonem. Brak odnośników do źródeł w odpowiedzi zwykle zdradza, że mówi z pamięci.

Czy da się zaktualizować wiedzę ChatGPT o mojej firmie?

Nie bezpośrednio: pamięci modelu nikt z zewnątrz nie edytuje. Możesz natomiast zadbać o aktualne treści na stronie i w cudzych źródłach, po które model sięga podczas wyszukiwania, oraz o spójny opis firmy w wielu miejscach. Kolejna wersja modelu, trenowana na świeższych danych, ma wtedy szansę zapamiętać wersję poprawioną.

Jak sprawdzić, jaką wersję firmy pamięta model AI?

Otwórz nową rozmowę i poproś model, żeby odpowiedział z własnej wiedzy, bez wyszukiwania w internecie. Zadaj pytania o ofertę, ceny, lokalizacje i zarząd, a odpowiedź porównaj ze stanem faktycznym. Powtórz test w kilku modelach, bo każdy ma inną datę graniczną.

Jak długo model AI będzie opisywać starą wersję firmy?

Pamięć treningowa zmienia się dopiero wraz z nową wersją modelu, a te wychodzą co pewien czas, nie na żądanie. Wcześniej aktualne informacje mogą docierać do odpowiedzi przez warstwę wyszukiwania, o ile świeże treści o firmie są w sieci i model zdecyduje się szukać. Dlatego poprawki publikowane dziś działają najpierw na wyszukiwanie, a na pamięć modeli z opóźnieniem.

Zobacz, co AI mówi o Twojej firmie

Raport widoczności w AI pokazuje, czy ChatGPT, Gemini, Perplexity, AI Overviews i AI Mode wymieniają Twoją firmę i kogo polecają zamiast Ciebie. Gotowy w około 5 minut, 99 zł netto.