{"id":2334,"date":"2025-02-26T10:29:00","date_gmt":"2025-02-26T09:29:00","guid":{"rendered":"https:\/\/jalvo.eu\/noindex-vs-disallow-jak-usunac-strone-z-google\/"},"modified":"2025-02-26T10:29:00","modified_gmt":"2025-02-26T09:29:00","slug":"noindex-vs-disallow-jak-usunac-strone-z-google","status":"publish","type":"post","link":"https:\/\/jalvo.eu\/pl\/noindex-vs-disallow-jak-usunac-strone-z-google\/","title":{"rendered":"Noindex vs Disallow: jak poprawnie usun\u0105\u0107 strony z Google"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\">Noindex czy disallow? Je\u015bli chcesz, \u017ceby strona znikn\u0119\u0142a z Google, u\u017cyj noindex. Regu\u0142a disallow w robots.txt blokuje tylko crawlowanie adresu przez Googlebota, a sama strona nadal mo\u017ce trafi\u0107 do indeksu. Za\u0142\u00f3\u017cmy, \u017ce prowadzisz kilka ma\u0142ych serwis\u00f3w i chcesz usun\u0105\u0107 z wynik\u00f3w s\u0142abe, testowe albo zduplikowane podstrony. Zrobi to tag noindex na stronie, kt\u00f3r\u0105 Googlebot mo\u017ce crawlowa\u0107. Regu\u0142a w robots.txt tego nie zrobi.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Noindex vs Disallow: za co naprawd\u0119 odpowiada ka\u017cda z regu\u0142<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Disallow steruje crawlowaniem. Noindex steruje indeksowaniem. Ludzie ci\u0105gle to myl\u0105. Zgodnie z <a href=\"https:\/\/developers.google.com\/search\/docs\/crawling-indexing\/robots\/intro\" rel=\"nofollow noopener\" target=\"_blank\">wprowadzeniem Google do robots.txt<\/a> ten plik m\u00f3wi robotom, do kt\u00f3rych adres\u00f3w URL maj\u0105 dost\u0119p. S\u0142u\u017cy g\u0142\u00f3wnie do tego, \u017ceby boty nie przeci\u0105\u017ca\u0142y serwera, a Google wprost pisze, \u017ce nie jest to spos\u00f3b na ukrycie strony w wynikach wyszukiwania. Noindex dzia\u0142a inaczej. Gdy Googlebot pobierze stron\u0119 i odczyta regu\u0142\u0119, Google usuwa j\u0105 z wyszukiwarki, nawet je\u015bli linkuj\u0105 do niej inne serwisy.<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Disallow<\/strong> blokuje pobieranie, pozwala zarz\u0105dza\u0107 ruchem robot\u00f3w i trzyma pliki graficzne, wideo i audio z dala od wynik\u00f3w.<\/li>\n<li><strong>Noindex<\/strong> usuwa stron\u0119 z wynik\u00f3w, ale dzia\u0142a tylko wtedy, gdy strona mo\u017ce by\u0107 crawlowana.<\/li>\n<\/ul>\n\n\n\n<h2 class=\"wp-block-heading\">Dlaczego strona zablokowana w robots.txt wci\u0105\u017c pojawia si\u0119 w Google?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Bo Google wie o istnieniu adresu z link\u00f3w, kt\u00f3re do niego prowadz\u0105, chocia\u017c nie mo\u017ce pobra\u0107 tre\u015bci. Strona pojawia si\u0119 wi\u0119c w wynikach bez opisu. To w\u0142a\u015bnie oznacza komunikat &#8222;Zaindeksowana, chocia\u017c zablokowana przez plik robots.txt&#8221; w Search Console: Google zna adres, ale nigdy nie przeczyta\u0142 strony. Zalecenia Google dziel\u0105 si\u0119 tu na dwa przypadki. Je\u015bli chcesz naprawi\u0107 taki wynik, usu\u0144 wpis w robots.txt, kt\u00f3ry blokuje stron\u0119. Je\u015bli chcesz ca\u0142kowicie ukry\u0107 stron\u0119 w wyszukiwarce, u\u017cyj innej metody, na przyk\u0142ad noindex.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Pu\u0142apka: noindex za regu\u0142\u0105 disallow nigdy nie zostanie odczytany<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Na tym potyka si\u0119 wiele os\u00f3b. Je\u015bli robots.txt blokuje adres URL, Googlebot nigdy go nie pobiera, wi\u0119c nigdy nie odczyta metatagu noindex ani nag\u0142\u00f3wka na tej stronie. Google musi crawlowa\u0107 stron\u0119, \u017ceby zobaczy\u0107 jej metatagi i nag\u0142\u00f3wki HTTP. Logiczne, prawda? Gdy wi\u0119c na tym samym adresie s\u0105 jednocze\u015bnie disallow i noindex, wygrywa disallow, a noindex nie robi zupe\u0142nie nic. Wpisanie noindex do robots.txt te\u017c nie pomo\u017ce, bo Google nie obs\u0142uguje tam takiej regu\u0142y. Kolejno\u015b\u0107, kt\u00f3ra dzia\u0142a, jest prosta. Najpierw zezw\u00f3l na crawlowanie. Potem dodaj noindex.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Jak doda\u0107 metatag robots z noindex albo nag\u0142\u00f3wek X-Robots-Tag<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Masz dwie mo\u017cliwo\u015bci: tag <code>&lt;meta name=\"robots\" content=\"noindex\"&gt;<\/code> w sekcji head kodu HTML albo nag\u0142\u00f3wek odpowiedzi HTTP X-Robots-Tag. Dzia\u0142aj\u0105 tak samo. Metatag wystarczy dla zwyk\u0142ych stron HTML. Nag\u0142\u00f3wek przyda si\u0119 przy plikach PDF i innych plikach innych ni\u017c HTML, a do tego jednym ruchem obejmie ca\u0142\u0105 \u015bcie\u017ck\u0119 (wygodne, gdy katalog testowy ma kilkadziesi\u0105t adres\u00f3w). Na w\u0142asnym serwerze origin z NGINX blok location dla katalogu testowego wygl\u0105da tak:<\/p>\n\n\n\n<pre><code>location \/test\/ {\n    add_header X-Robots-Tag \"noindex\" always;\n}\n\nlocation ~* .pdf$ {\n    add_header X-Robots-Tag \"noindex\" always;\n}<\/code><\/pre>\n<p class=\"wp-block-paragraph\">Po edycji konfiguracji prze\u0142aduj NGINX, a potem sprawd\u017a, czy nag\u0142\u00f3wek naprawd\u0119 wraca w odpowiedzi serwera. Nie zak\u0142adaj po prostu, \u017ce tak jest.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Co wybra\u0107 dla s\u0142abych, testowych i zduplikowanych stron?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Strony, kt\u00f3re maj\u0105 znikn\u0105\u0107 z wynik\u00f3w, dostaj\u0105 noindex. Disallow w robots.txt jest tylko dla adres\u00f3w, kt\u00f3rych po prostu nie chcesz crawlowa\u0107. Tak podszed\u0142bym do typowego zestawu na ma\u0142ym serwisie:<\/p>\n\n\n\n<ol class=\"wp-block-list\">\n<li><strong>S\u0142abe strony:<\/strong> noindex. Google usunie je po najbli\u017cszym crawlowaniu.<\/li>\n<li><strong>Strony testowe:<\/strong> noindex albo ochrona has\u0142em, kt\u00f3r\u0105 Google sam wymienia jako drug\u0105 opcj\u0119.<\/li>\n<li><strong>Zduplikowane lub podobne adresy o niskiej warto\u015bci, kt\u00f3re nigdy nie trafi\u0142y do indeksu:<\/strong> disallow pozwala oszcz\u0119dzi\u0107 crawlowanie, co ma znaczenie, je\u015bli zale\u017cy ci na <a href=\"https:\/\/jalvo.eu\/pl\/crawl-budget-male-sieci-stron-kiedy-ma-znaczenie\/\">bud\u017cecie crawlowania ma\u0142ych serwis\u00f3w<\/a>.<\/li>\n<\/ol>\n\n\n\n<p class=\"wp-block-paragraph\">Serwery stagingowe i origin to osobny problem i maj\u0105 w\u0142asny poradnik o <a href=\"https:\/\/jalvo.eu\/pl\/serwer-origin-poza-indeksem-google\/\">serwerach origin widocznych w wyszukiwarce<\/a>. Jeszcze jedno: nie blokuj plik\u00f3w CSS, JavaScript ani obraz\u00f3w, kt\u00f3rych strona potrzebuje do wyrenderowania. Bez nich Google nie przeanalizuje strony prawid\u0142owo.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Jak sprawdzi\u0107, czy Google zobaczy\u0142 tw\u00f3j noindex<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Otw\u00f3rz narz\u0119dzie Sprawdzanie adresu URL, zajrzyj do kodu HTML, kt\u00f3ry otrzyma\u0142 Googlebot, i sprawd\u017a, czy noindex naprawd\u0119 w nim jest. Zgodnie z <a href=\"https:\/\/developers.google.com\/search\/docs\/crawling-indexing\/block-indexing\" rel=\"nofollow noopener\" target=\"_blank\">przewodnikiem Google o blokowaniu indeksowania<\/a>, je\u015bli strona wci\u0105\u017c si\u0119 wy\u015bwietla, zwykle chodzi o to, \u017ce Google nie crawlowa\u0142 jej ponownie od dodania regu\u0142y. Nic nie jest zepsute, strona po prostu czeka na ponowne crawlowanie. Mo\u017cesz o nie poprosi\u0107 w tym samym narz\u0119dziu. Widok ca\u0142ego serwisu daje raport Indeksowanie stron w Search Console, kt\u00f3ry pokazuje ka\u017cd\u0105 stron\u0119, na kt\u00f3rej Googlebot znalaz\u0142 regu\u0142\u0119 noindex.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Kiedy disallow w robots.txt nadal jest dobrym narz\u0119dziem<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Disallow wci\u0105\u017c ma swoje miejsce. U\u017cywaj go do zarz\u0105dzania ruchem robot\u00f3w, do trzymania plik\u00f3w graficznych, wideo i audio z dala od Google oraz do pomijania nieistotnych lub niemal identycznych adres\u00f3w. Nie powstrzyma jednak innych stron ani u\u017cytkownik\u00f3w przed linkowaniem do zablokowanych plik\u00f3w multimedialnych. Innym zastosowaniem jest blokowanie wybranych robot\u00f3w, ale <a href=\"https:\/\/jalvo.eu\/pl\/jak-zablokowac-boty-ai-w-robots-txt\/\">blokowanie trenowania modeli AI<\/a> to osobny temat z w\u0142asnymi tokenami. Noindex vs disallow w jednym zdaniu: \u017ceby usun\u0105\u0107 stron\u0119, zezw\u00f3l na crawlowanie i dodaj noindex. \u017beby oszcz\u0119dzi\u0107 crawlowanie na niewa\u017cnych adresach, zablokuj je przez disallow.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">FAQ<\/h2>\n\n\n<div id=\"rank-math-faq\" class=\"rank-math-block\">\n<div class=\"rank-math-list \">\n<div id=\"faq-question-1790771525906-0\" class=\"rank-math-list-item\">\n<h3 class=\"rank-math-question \">Czy mog\u0119 wpisa\u0107 noindex do robots.txt?<\/h3>\n<div class=\"rank-math-answer \">\n\n<p>Nie. Google nie obs\u0142uguje regu\u0142y noindex w robots.txt. Umie\u015b\u0107 j\u0105 w metatagu robots w sekcji head strony albo wy\u015blij jako nag\u0142\u00f3wek X-Robots-Tag.<\/p>\n\n<\/div>\n<\/div>\n<div id=\"faq-question-1790771525906-1\" class=\"rank-math-list-item\">\n<h3 class=\"rank-math-question \">Czy u\u017cywa\u0107 jednocze\u015bnie disallow i noindex na tej samej stronie?<\/h3>\n<div class=\"rank-math-answer \">\n\n<p>Nie. Regu\u0142a disallow blokuje Googlebotowi pobranie strony, wi\u0119c nigdy nie zobaczy on noindex. Zostaw stron\u0119 dost\u0119pn\u0105 do crawlowania, dop\u00f3ki nie zniknie z wynik\u00f3w.<\/p>\n\n<\/div>\n<\/div>\n<div id=\"faq-question-1790771525906-2\" class=\"rank-math-list-item\">\n<h3 class=\"rank-math-question \">Jak usun\u0105\u0107 z Google stron\u0119 zablokowan\u0105 w robots.txt?<\/h3>\n<div class=\"rank-math-answer \">\n\n<p>Usu\u0144 wpis w robots.txt, kt\u00f3ry blokuje stron\u0119, a potem dodaj metatag noindex albo nag\u0142\u00f3wek. Nast\u0119pnie popro\u015b o ponowne crawlowanie w narz\u0119dziu Sprawdzanie adresu URL, \u017ceby Google m\u00f3g\u0142 odczyta\u0107 now\u0105 regu\u0142\u0119.<\/p>\n\n<\/div>\n<\/div>\n<\/div>\n<\/div>","protected":false},"excerpt":{"rendered":"<p>Noindex czy disallow? Je\u015bli chcesz, \u017ceby strona znikn\u0119\u0142a z Google, u\u017cyj noindex. Regu\u0142a disallow w robots.txt blokuje tylko crawlowanie adresu przez Googlebota, a sama strona nadal mo\u017ce trafi\u0107 do indeksu. Za\u0142\u00f3\u017cmy, \u017ce prowadzisz kilka ma\u0142ych serwis\u00f3w i chcesz usun\u0105\u0107 z wynik\u00f3w s\u0142abe, testowe albo zduplikowane podstrony. Zrobi to tag noindex na stronie, kt\u00f3r\u0105 Googlebot mo\u017ce [&hellip;]<\/p>\n","protected":false},"author":25,"featured_media":2304,"comment_status":"","ping_status":"","sticky":false,"template":"","format":"standard","meta":{"_acf_changed":false,"footnotes":""},"categories":[182],"tags":[290,224,408,411,348,28],"class_list":["post-2334","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-seo-pl","tag-google-x","tag-indeksowanie","tag-indeksowanie-x","tag-noindex-x","tag-robots-txt-x","tag-seo-pl"],"acf":[],"_links":{"self":[{"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/posts\/2334","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/users\/25"}],"replies":[{"embeddable":true,"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/comments?post=2334"}],"version-history":[{"count":0,"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/posts\/2334\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/media\/2304"}],"wp:attachment":[{"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/media?parent=2334"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/categories?post=2334"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/tags?post=2334"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}