{"id":2227,"date":"2026-07-23T10:08:00","date_gmt":"2026-07-23T09:08:00","guid":{"rendered":"https:\/\/jalvo.eu\/jak-zablokowac-boty-ai-w-robots-txt\/"},"modified":"2026-09-25T03:46:36","modified_gmt":"2026-09-25T02:46:36","slug":"jak-zablokowac-boty-ai-w-robots-txt","status":"publish","type":"post","link":"https:\/\/jalvo.eu\/pl\/jak-zablokowac-boty-ai-w-robots-txt\/","title":{"rendered":"Jak zablokowa\u0107 boty AI w robots.txt bez szkody dla widoczno\u015bci w wyszukiwarce"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\">Chcesz zablokowa\u0107 boty AI i nie straci\u0107 widoczno\u015bci w wyszukiwarce? Ka\u017cdy token s\u0142u\u017c\u0105cy do trenowania AI, na przyk\u0142ad GPTBot i Google-Extended, dostaje w robots.txt w\u0142asn\u0105 grup\u0119 z <code>Disallow: \/<\/code>, a roboty wyszukiwarek, takie jak Googlebot i OAI-SearchBot, zostaj\u0105 dopuszczone. Tyle w skr\u00f3cie. Jedno zastrze\u017cenie na start: robots.txt to pro\u015bba, kt\u00f3r\u0105 uczciwe boty respektuj\u0105. Niczego nie wymusza. Poni\u017cej omawiam tokeny, kt\u00f3re maj\u0105 znaczenie, kolejne kroki konfiguracji, przyk\u0142adowy plik, ograniczenia tej metody, spos\u00f3b sprawdzenia efektu i b\u0142\u0119dy, kt\u00f3re kosztuj\u0105 pozycje.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Kt\u00f3re tokeny user-agent w robots.txt odpowiadaj\u0105 za trenowanie AI, a kt\u00f3re za wyszukiwark\u0119?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Trenowanie AI i indeksowanie na potrzeby wyszukiwarki dzia\u0142aj\u0105 na osobnych tokenach user-agent. Dzi\u0119ki temu ka\u017cdy z nich mo\u017cesz dopu\u015bci\u0107 albo zablokowa\u0107 niezale\u017cnie. <strong>Token user-agent w robots.txt<\/strong> to nazwa wpisywana w linii <code>User-agent:<\/code>. Jest kr\u00f3tsza ni\u017c pe\u0142ny ci\u0105g user agent, kt\u00f3ry bot wysy\u0142a w \u017c\u0105daniach HTTP (te dwie rzeczy ci\u0105gle si\u0119 ludziom myl\u0105). W Google wyszukiwark\u0105 zajmuje si\u0119 Googlebot. Google-Extended s\u0142u\u017cy do rezygnacji z trenowania AI. <a href=\"https:\/\/developers.google.com\/crawling\/docs\/crawlers-fetchers\/google-common-crawlers\" rel=\"nofollow noopener\" target=\"_blank\">Lista popularnych crawler\u00f3w Google<\/a> podaje, \u017ce Google-Extended nie wp\u0142ywa na obecno\u015b\u0107 w wyszukiwarce Google i nie jest sygna\u0142em rankingowym. A Google-CloudVertexBot? Obejmuje tylko indeksowanie zlecane przez w\u0142a\u015bcicieli stron przy budowie agent\u00f3w Vertex AI. Na wyszukiwark\u0119 nie wp\u0142ywa.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">OpenAI dzieli swoje boty w ten sam spos\u00f3b. Blokuj\u0105c <strong>user agent GPTBot<\/strong>, informujesz OpenAI, \u017ce pobrane tre\u015bci nie maj\u0105 trafia\u0107 do trenowania jego modeli bazowych. OAI-SearchBot to osobna sprawa: od niego zale\u017cy, czy pojawisz si\u0119 w wynikach wyszukiwania. <a href=\"https:\/\/developers.openai.com\/api\/docs\/bots\" rel=\"nofollow noopener\" target=\"_blank\">Dokumentacja crawler\u00f3w OpenAI<\/a> m\u00f3wi, \u017ce ka\u017cde z tych ustawie\u0144 dzia\u0142a niezale\u017cnie od pozosta\u0142ych. Moja rada: przepisuj tokeny dok\u0142adnie tak, jak podaj\u0105 je dostawcy, i sprawdzaj te strony przed ka\u017cd\u0105 zmian\u0105. Listy si\u0119 zmieniaj\u0105.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Jak zablokowa\u0107 boty AI w robots.txt krok po kroku<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Jedna grupa na ka\u017cdy token trenowania AI z <code>Disallow: \/<\/code>. Istniej\u0105ce grupy dla wyszukiwarek zostawiasz bez zmian. To naprawd\u0119 wszystko.<\/p>\n\n\n\n<ol class=\"wp-block-list\">\n<li>Otw\u00f3rz obecny plik robots.txt w katalogu g\u0142\u00f3wnym strony.<\/li>\n<li>Zostaw bez zmian dotychczasowe regu\u0142y dla Googlebota i <code>User-agent: *<\/code>.<\/li>\n<li>Dodaj grup\u0119 dla GPTBot z <code>Disallow: \/<\/code>.<\/li>\n<li>Dodaj grup\u0119 dla Google-Extended z <code>Disallow: \/<\/code>.<\/li>\n<li>Zapisz i wdr\u00f3\u017c plik, a potem otw\u00f3rz wersj\u0119 produkcyjn\u0105 w przegl\u0105darce, \u017ceby upewni\u0107 si\u0119, \u017ce serwer faktycznie j\u0105 zwraca.<\/li>\n<\/ol>\n\n\n\n<p class=\"wp-block-paragraph\">Nie wstawiaj <code>Disallow: \/<\/code> pod <code>User-agent: *<\/code>, \u017ceby zatrzyma\u0107 boty AI. Nigdy. Ta regu\u0142a odcina te\u017c roboty wyszukiwarek i wtedy masz du\u017co wi\u0119kszy problem ni\u017c trenowanie AI. Je\u015bli chcesz tylko cz\u0119\u015bciowo <em>zrezygnowa\u0107 z trenowania AI<\/em>, dodaj \u015bcie\u017cki Allow i Disallow wewn\u0105trz grupy dla AI. Przyk\u0142adowe grupy od Google robi\u0105 dok\u0142adnie to: dopuszczaj\u0105 jedn\u0105 stron\u0119 archiwum i blokuj\u0105 reszt\u0119 archiwum.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Jak wygl\u0105da bezpieczny robots.txt z Google-Extended i GPTBot<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Bezpieczny plik dopuszcza roboty wyszukiwarek, a ka\u017cdemu botowi trenuj\u0105cemu AI daje osobn\u0105 grup\u0119:<\/p>\n\n\n\n<pre><code>User-agent: GPTBot\nDisallow: \/\n\nUser-agent: Google-Extended\nDisallow: \/\n\nUser-agent: OAI-SearchBot\nAllow: \/\n\nUser-agent: *\nAllow: \/\n\nSitemap: https:\/\/example.com\/sitemap.xml<\/code><\/pre>\n<p class=\"wp-block-paragraph\">Crawler stosuje si\u0119 do grupy, kt\u00f3ra wymienia jego w\u0142asny token, i pomija grup\u0119 og\u00f3ln\u0105. Proste. Niekt\u00f3re crawlery Google maj\u0105 jednak wi\u0119cej ni\u017c jeden token, a Google podaje, \u017ce regu\u0142a obowi\u0105zuje, gdy pasuje kt\u00f3rykolwiek z nich. Grupa dla OAI-SearchBot jest opcjonalna. Po co j\u0105 zostawia\u0107? Jasno pokazuje twoj\u0105 intencj\u0119, je\u015bli chcesz by\u0107 widoczny w wynikach wyszukiwania ChatGPT, a jednocze\u015bnie rezygnujesz z trenowania. Z kolei wpis <strong>Google-Extended w robots.txt<\/strong> jest oddzielony od Googlebota, wi\u0119c indeksowanie dzia\u0142a jak dot\u0105d.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Dlaczego robots.txt to pro\u015bba, a nie zamek<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">robots.txt m\u00f3wi dobrze wychowanym crawlerom, czego sobie \u017cyczysz. Nie zatrzyma bota, kt\u00f3ry postanowi go zignorowa\u0107. Google deklaruje, \u017ce jego popularne crawlery zawsze przestrzegaj\u0105 robots.txt przy automatycznym indeksowaniu. Inni operatorzy maj\u0105 w\u0142asne zasady, a niekt\u00f3rzy w og\u00f3le pomijaj\u0105 ten plik. Kusi ci\u0119, \u017ceby obej\u015b\u0107 to, podaj\u0105c botom inn\u0105 tre\u015b\u0107 ni\u017c odwiedzaj\u0105cym? Nie r\u00f3b tego. To cloaking, a nasz poradnik o <a href=\"https:\/\/jalvo.eu\/ip-cloaking-and-seo-what-you-need-to-know-to-stay-compliant\/\">zasadach cloakingu wobec bot\u00f3w<\/a> wyja\u015bnia, dlaczego wyszukiwarki za to karz\u0105. Tutaj trzymam si\u0119 robots.txt, bo kontrola dost\u0119pu to zupe\u0142nie osobny temat.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Jak sprawdzi\u0107, kt\u00f3re boty AI nadal odwiedzaj\u0105 twoj\u0105 stron\u0119<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Logi serwera poka\u017c\u0105, kt\u00f3re crawlery faktycznie pobieraj\u0105 strony po zmianie. Filtrowanie opisujemy w poradniku o <a href=\"https:\/\/jalvo.eu\/reading-server-logs-crawl-problems\/\">rozpoznawaniu bot\u00f3w w logach<\/a>. Ci\u0105g user agent mo\u017ce jednak podrobi\u0107 ka\u017cdy, wi\u0119c zanim zaufasz botowi, sprawd\u017a, czy jest tym, za kogo si\u0119 podaje. S\u0142u\u017cy do tego odwrotne zapytanie DNS, a jak to zrobi\u0107, pokazuje poradnik o <a href=\"https:\/\/jalvo.eu\/reverse-dns-ptr-records-footprint-signal\/\">sprawdzaniu PTR dla IP bot\u00f3w<\/a>. W logach szukaj:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>\u017c\u0105da\u0144 stron od zablokowanych token\u00f3w po wdro\u017ceniu zmiany,<\/li>\n<li>tego, czy te boty pobra\u0142y sam plik robots.txt,<\/li>\n<li>Googlebota indeksuj\u0105cego w swoim zwyk\u0142ym tempie.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">Przy widoczno\u015bci w wyszukiwarce uzbr\u00f3j si\u0119 w cierpliwo\u015b\u0107, bo zmiany mog\u0105 przyj\u015b\u0107 z op\u00f3\u017anieniem. Wed\u0142ug informacji OpenAI o jego botach dostosowanie wynik\u00f3w wyszukiwania po aktualizacji robots.txt mo\u017ce zaj\u0105\u0107 jego systemom ~24 godziny.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">B\u0142\u0119dy, kt\u00f3re kosztuj\u0105 widoczno\u015b\u0107 w wyszukiwarce przy rezygnacji z trenowania AI<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Utrata ruchu z wyszukiwarki zwykle wynika z dw\u00f3ch rzeczy: zablokowania niew\u0142a\u015bciwego tokenu albo zbyt szerokiej regu\u0142y. Przypadkiem zablokujesz Googlebot-Image albo Googlebot-Video, a twoje obrazy lub filmy wypadn\u0105 z Google Grafika, Discover i innych funkcji wyszukiwarki, kt\u00f3re pokazuj\u0105 multimedia. Zablokujesz OAI-SearchBot, cho\u0107 chodzi\u0142o ci tylko o GPTBot, i znikasz z wynik\u00f3w wyszukiwania ChatGPT. Zdarza si\u0119 te\u017c odwrotna sytuacja. Cz\u0119\u015b\u0107 w\u0142a\u015bcicieli zak\u0142ada, \u017ce Google-Extended wp\u0142ywa na pozycje, i na wszelki wypadek nie rezygnuje z trenowania, cho\u0107 Google podaje, \u017ce tak nie jest.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Tak, boty AI da si\u0119 zablokowa\u0107 kilkoma precyzyjnymi grupami i nie rusza\u0107 przy tym wyszukiwarki, pod warunkiem \u017ce co jaki\u015b czas sprawdzasz listy token\u00f3w u dostawc\u00f3w. Zasady si\u0119 nie zmieniaj\u0105, je\u015bli twoje serwery \u017ar\u00f3d\u0142owe stoj\u0105 za <a href=\"https:\/\/jalvo.eu\/services\/\">proxy NGINX dla twoich stron<\/a>, bo plik i tak jest serwowany z domeny g\u0142\u00f3wnej. Wi\u0119cej poradnik\u00f3w o indeksowaniu znajdziesz w <a href=\"https:\/\/jalvo.eu\/blog\/\">archiwum bloga Jalvo<\/a>.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">FAQ<\/h2>\n\n\n<div id=\"rank-math-faq\" class=\"rank-math-block\">\n<div class=\"rank-math-list \">\n<div id=\"faq-question-1790304113107-0\" class=\"rank-math-list-item\">\n<h3 class=\"rank-math-question \">Czy zablokowanie Google-Extended usunie moj\u0105 stron\u0119 z wyszukiwarki Google?<\/h3>\n<div class=\"rank-math-answer \">\n\n<p>Nie. Google podaje, \u017ce Google-Extended nie wp\u0142ywa na obecno\u015b\u0107 strony w wyszukiwarce Google i nie jest sygna\u0142em rankingowym. Googlebot dalej indeksuje twoje strony tak jak wcze\u015bniej. Ten token decyduje tylko o tym, czy twoje tre\u015bci trafi\u0105 do trenowania AI w Google.<\/p>\n\n<\/div>\n<\/div>\n<div id=\"faq-question-1790304113107-1\" class=\"rank-math-list-item\">\n<h3 class=\"rank-math-question \">Czym r\u00f3\u017cni si\u0119 GPTBot od OAI-SearchBot?<\/h3>\n<div class=\"rank-math-answer \">\n\n<p>GPTBot dotyczy trenowania: jego zablokowanie m\u00f3wi OpenAI, \u017ceby nie u\u017cywa\u0142o twoich tre\u015bci do modeli bazowych. OAI-SearchBot decyduje o tym, czy twoje strony pojawiaj\u0105 si\u0119 w wynikach wyszukiwania ChatGPT. Ka\u017cdy ustawiasz osobno, wi\u0119c zablokowanie pierwszego i dopuszczenie drugiego jest jak najbardziej w porz\u0105dku.<\/p>\n\n<\/div>\n<\/div>\n<div id=\"faq-question-1790304113107-2\" class=\"rank-math-list-item\">\n<h3 class=\"rank-math-question \">Czy robots.txt zatrzyma ka\u017cdego crawlera AI?<\/h3>\n<div class=\"rank-math-answer \">\n\n<p>Nie. robots.txt to dobrowolny standard i stosuj\u0105 si\u0119 do niego tylko uczciwe boty. Sprawd\u017a w logach serwera, kt\u00f3re crawlery nadal pobieraj\u0105 strony, i potwierd\u017a ich to\u017csamo\u015b\u0107 odwrotnym zapytaniem DNS, zanim uznasz je za prawdziwe.<\/p>\n\n<\/div>\n<\/div>\n<\/div>\n<\/div>","protected":false},"excerpt":{"rendered":"<p>Chcesz zablokowa\u0107 boty AI i nie straci\u0107 widoczno\u015bci w wyszukiwarce? Ka\u017cdy token s\u0142u\u017c\u0105cy do trenowania AI, na przyk\u0142ad GPTBot i Google-Extended, dostaje w robots.txt w\u0142asn\u0105 grup\u0119 z Disallow: \/, a roboty wyszukiwarek, takie jak Googlebot i OAI-SearchBot, zostaj\u0105 dopuszczone. Tyle w skr\u00f3cie. Jedno zastrze\u017cenie na start: robots.txt to pro\u015bba, kt\u00f3r\u0105 uczciwe boty respektuj\u0105. Niczego nie [&hellip;]<\/p>\n","protected":false},"author":25,"featured_media":2215,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"_acf_changed":false,"footnotes":""},"categories":[182],"tags":[],"class_list":["post-2227","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-seo-pl"],"acf":[],"_links":{"self":[{"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/posts\/2227","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/users\/25"}],"replies":[{"embeddable":true,"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/comments?post=2227"}],"version-history":[{"count":1,"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/posts\/2227\/revisions"}],"predecessor-version":[{"id":2237,"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/posts\/2227\/revisions\/2237"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/media\/2215"}],"wp:attachment":[{"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/media?parent=2227"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/categories?post=2227"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/tags?post=2227"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}