Przejdź do treści
SEO

Jak zablokować boty AI w robots.txt bez szkody dla widoczności w wyszukiwarce

How to Block AI Crawlers in robots.txt Without Hurting Search
W tym artykule
  1. Które tokeny user-agent w robots.txt odpowiadają za trenowanie AI, a które za wyszukiwarkę?
  2. Jak zablokować boty AI w robots.txt krok po kroku
  3. Jak wygląda bezpieczny robots.txt z Google-Extended i GPTBot
  4. Dlaczego robots.txt to prośba, a nie zamek
  5. Jak sprawdzić, które boty AI nadal odwiedzają twoją stronę
  6. Błędy, które kosztują widoczność w wyszukiwarce przy rezygnacji z trenowania AI
  7. FAQ

Chcesz zablokować boty AI i nie stracić widoczności w wyszukiwarce? Każdy token służący do trenowania AI, na przykład GPTBot i Google-Extended, dostaje w robots.txt własną grupę z Disallow: /, a roboty wyszukiwarek, takie jak Googlebot i OAI-SearchBot, zostają dopuszczone. Tyle w skrócie. Jedno zastrzeżenie na start: robots.txt to prośba, którą uczciwe boty respektują. Niczego nie wymusza. Poniżej omawiam tokeny, które mają znaczenie, kolejne kroki konfiguracji, przykładowy plik, ograniczenia tej metody, sposób sprawdzenia efektu i błędy, które kosztują pozycje.

Które tokeny user-agent w robots.txt odpowiadają za trenowanie AI, a które za wyszukiwarkę?

Trenowanie AI i indeksowanie na potrzeby wyszukiwarki działają na osobnych tokenach user-agent. Dzięki temu każdy z nich możesz dopuścić albo zablokować niezależnie. Token user-agent w robots.txt to nazwa wpisywana w linii User-agent:. Jest krótsza niż pełny ciąg user agent, który bot wysyła w żądaniach HTTP (te dwie rzeczy ciągle się ludziom mylą). W Google wyszukiwarką zajmuje się Googlebot. Google-Extended służy do rezygnacji z trenowania AI. Lista popularnych crawlerów Google podaje, że Google-Extended nie wpływa na obecność w wyszukiwarce Google i nie jest sygnałem rankingowym. A Google-CloudVertexBot? Obejmuje tylko indeksowanie zlecane przez właścicieli stron przy budowie agentów Vertex AI. Na wyszukiwarkę nie wpływa.

OpenAI dzieli swoje boty w ten sam sposób. Blokując user agent GPTBot, informujesz OpenAI, że pobrane treści nie mają trafiać do trenowania jego modeli bazowych. OAI-SearchBot to osobna sprawa: od niego zależy, czy pojawisz się w wynikach wyszukiwania. Dokumentacja crawlerów OpenAI mówi, że każde z tych ustawień działa niezależnie od pozostałych. Moja rada: przepisuj tokeny dokładnie tak, jak podają je dostawcy, i sprawdzaj te strony przed każdą zmianą. Listy się zmieniają.

Jak zablokować boty AI w robots.txt krok po kroku

Jedna grupa na każdy token trenowania AI z Disallow: /. Istniejące grupy dla wyszukiwarek zostawiasz bez zmian. To naprawdę wszystko.

  1. Otwórz obecny plik robots.txt w katalogu głównym strony.
  2. Zostaw bez zmian dotychczasowe reguły dla Googlebota i User-agent: *.
  3. Dodaj grupę dla GPTBot z Disallow: /.
  4. Dodaj grupę dla Google-Extended z Disallow: /.
  5. Zapisz i wdróż plik, a potem otwórz wersję produkcyjną w przeglądarce, żeby upewnić się, że serwer faktycznie ją zwraca.

Nie wstawiaj Disallow: / pod User-agent: *, żeby zatrzymać boty AI. Nigdy. Ta reguła odcina też roboty wyszukiwarek i wtedy masz dużo większy problem niż trenowanie AI. Jeśli chcesz tylko częściowo zrezygnować z trenowania AI, dodaj ścieżki Allow i Disallow wewnątrz grupy dla AI. Przykładowe grupy od Google robią dokładnie to: dopuszczają jedną stronę archiwum i blokują resztę archiwum.

Jak wygląda bezpieczny robots.txt z Google-Extended i GPTBot

Bezpieczny plik dopuszcza roboty wyszukiwarek, a każdemu botowi trenującemu AI daje osobną grupę:

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml

Crawler stosuje się do grupy, która wymienia jego własny token, i pomija grupę ogólną. Proste. Niektóre crawlery Google mają jednak więcej niż jeden token, a Google podaje, że reguła obowiązuje, gdy pasuje którykolwiek z nich. Grupa dla OAI-SearchBot jest opcjonalna. Po co ją zostawiać? Jasno pokazuje twoją intencję, jeśli chcesz być widoczny w wynikach wyszukiwania ChatGPT, a jednocześnie rezygnujesz z trenowania. Z kolei wpis Google-Extended w robots.txt jest oddzielony od Googlebota, więc indeksowanie działa jak dotąd.

Dlaczego robots.txt to prośba, a nie zamek

robots.txt mówi dobrze wychowanym crawlerom, czego sobie życzysz. Nie zatrzyma bota, który postanowi go zignorować. Google deklaruje, że jego popularne crawlery zawsze przestrzegają robots.txt przy automatycznym indeksowaniu. Inni operatorzy mają własne zasady, a niektórzy w ogóle pomijają ten plik. Kusi cię, żeby obejść to, podając botom inną treść niż odwiedzającym? Nie rób tego. To cloaking, a nasz poradnik o zasadach cloakingu wobec botów wyjaśnia, dlaczego wyszukiwarki za to karzą. Tutaj trzymam się robots.txt, bo kontrola dostępu to zupełnie osobny temat.

Jak sprawdzić, które boty AI nadal odwiedzają twoją stronę

Logi serwera pokażą, które crawlery faktycznie pobierają strony po zmianie. Filtrowanie opisujemy w poradniku o rozpoznawaniu botów w logach. Ciąg user agent może jednak podrobić każdy, więc zanim zaufasz botowi, sprawdź, czy jest tym, za kogo się podaje. Służy do tego odwrotne zapytanie DNS, a jak to zrobić, pokazuje poradnik o sprawdzaniu PTR dla IP botów. W logach szukaj:

  • żądań stron od zablokowanych tokenów po wdrożeniu zmiany,
  • tego, czy te boty pobrały sam plik robots.txt,
  • Googlebota indeksującego w swoim zwykłym tempie.

Przy widoczności w wyszukiwarce uzbrój się w cierpliwość, bo zmiany mogą przyjść z opóźnieniem. Według informacji OpenAI o jego botach dostosowanie wyników wyszukiwania po aktualizacji robots.txt może zająć jego systemom ~24 godziny.

Błędy, które kosztują widoczność w wyszukiwarce przy rezygnacji z trenowania AI

Utrata ruchu z wyszukiwarki zwykle wynika z dwóch rzeczy: zablokowania niewłaściwego tokenu albo zbyt szerokiej reguły. Przypadkiem zablokujesz Googlebot-Image albo Googlebot-Video, a twoje obrazy lub filmy wypadną z Google Grafika, Discover i innych funkcji wyszukiwarki, które pokazują multimedia. Zablokujesz OAI-SearchBot, choć chodziło ci tylko o GPTBot, i znikasz z wyników wyszukiwania ChatGPT. Zdarza się też odwrotna sytuacja. Część właścicieli zakłada, że Google-Extended wpływa na pozycje, i na wszelki wypadek nie rezygnuje z trenowania, choć Google podaje, że tak nie jest.

Tak, boty AI da się zablokować kilkoma precyzyjnymi grupami i nie ruszać przy tym wyszukiwarki, pod warunkiem że co jakiś czas sprawdzasz listy tokenów u dostawców. Zasady się nie zmieniają, jeśli twoje serwery źródłowe stoją za proxy NGINX dla twoich stron, bo plik i tak jest serwowany z domeny głównej. Więcej poradników o indeksowaniu znajdziesz w archiwum bloga Jalvo.

FAQ

Czy zablokowanie Google-Extended usunie moją stronę z wyszukiwarki Google?

Nie. Google podaje, że Google-Extended nie wpływa na obecność strony w wyszukiwarce Google i nie jest sygnałem rankingowym. Googlebot dalej indeksuje twoje strony tak jak wcześniej. Ten token decyduje tylko o tym, czy twoje treści trafią do trenowania AI w Google.

Czym różni się GPTBot od OAI-SearchBot?

GPTBot dotyczy trenowania: jego zablokowanie mówi OpenAI, żeby nie używało twoich treści do modeli bazowych. OAI-SearchBot decyduje o tym, czy twoje strony pojawiają się w wynikach wyszukiwania ChatGPT. Każdy ustawiasz osobno, więc zablokowanie pierwszego i dopuszczenie drugiego jest jak najbardziej w porządku.

Czy robots.txt zatrzyma każdego crawlera AI?

Nie. robots.txt to dobrowolny standard i stosują się do niego tylko uczciwe boty. Sprawdź w logach serwera, które crawlery nadal pobierają strony, i potwierdź ich tożsamość odwrotnym zapytaniem DNS, zanim uznasz je za prawdziwe.

UdostępnijLinkedInX
Zespół Web Systems

Zespół, który tworzy i utrzymuje Jalvo.

Daj każdej stronie własne IP.

Pierwszą domenę dodasz w kilka minut.

Zacznij teraz

Wybierz, na które pliki cookie się zgadzasz. Niezbędne pliki cookie utrzymują działanie strony i logowania, nie można ich wyłączyć.