Przejdź do treści
SEO

Noindex vs Disallow: jak poprawnie usunąć strony z Google

Noindex vs Disallow: Keeping Pages Out of Google Correctly
W tym artykule
  1. Noindex vs Disallow: za co naprawdę odpowiada każda z reguł
  2. Dlaczego strona zablokowana w robots.txt wciąż pojawia się w Google?
  3. Pułapka: noindex za regułą disallow nigdy nie zostanie odczytany
  4. Jak dodać metatag robots z noindex albo nagłówek X-Robots-Tag
  5. Co wybrać dla słabych, testowych i zduplikowanych stron?
  6. Jak sprawdzić, czy Google zobaczył twój noindex
  7. Kiedy disallow w robots.txt nadal jest dobrym narzędziem
  8. FAQ

Noindex czy disallow? Jeśli chcesz, żeby strona zniknęła z Google, użyj noindex. Reguła disallow w robots.txt blokuje tylko crawlowanie adresu przez Googlebota, a sama strona nadal może trafić do indeksu. Załóżmy, że prowadzisz kilka małych serwisów i chcesz usunąć z wyników słabe, testowe albo zduplikowane podstrony. Zrobi to tag noindex na stronie, którą Googlebot może crawlować. Reguła w robots.txt tego nie zrobi.

Noindex vs Disallow: za co naprawdę odpowiada każda z reguł

Disallow steruje crawlowaniem. Noindex steruje indeksowaniem. Ludzie ciągle to mylą. Zgodnie z wprowadzeniem Google do robots.txt ten plik mówi robotom, do których adresów URL mają dostęp. Służy głównie do tego, żeby boty nie przeciążały serwera, a Google wprost pisze, że nie jest to sposób na ukrycie strony w wynikach wyszukiwania. Noindex działa inaczej. Gdy Googlebot pobierze stronę i odczyta regułę, Google usuwa ją z wyszukiwarki, nawet jeśli linkują do niej inne serwisy.

  • Disallow blokuje pobieranie, pozwala zarządzać ruchem robotów i trzyma pliki graficzne, wideo i audio z dala od wyników.
  • Noindex usuwa stronę z wyników, ale działa tylko wtedy, gdy strona może być crawlowana.

Dlaczego strona zablokowana w robots.txt wciąż pojawia się w Google?

Bo Google wie o istnieniu adresu z linków, które do niego prowadzą, chociaż nie może pobrać treści. Strona pojawia się więc w wynikach bez opisu. To właśnie oznacza komunikat „Zaindeksowana, chociaż zablokowana przez plik robots.txt” w Search Console: Google zna adres, ale nigdy nie przeczytał strony. Zalecenia Google dzielą się tu na dwa przypadki. Jeśli chcesz naprawić taki wynik, usuń wpis w robots.txt, który blokuje stronę. Jeśli chcesz całkowicie ukryć stronę w wyszukiwarce, użyj innej metody, na przykład noindex.

Pułapka: noindex za regułą disallow nigdy nie zostanie odczytany

Na tym potyka się wiele osób. Jeśli robots.txt blokuje adres URL, Googlebot nigdy go nie pobiera, więc nigdy nie odczyta metatagu noindex ani nagłówka na tej stronie. Google musi crawlować stronę, żeby zobaczyć jej metatagi i nagłówki HTTP. Logiczne, prawda? Gdy więc na tym samym adresie są jednocześnie disallow i noindex, wygrywa disallow, a noindex nie robi zupełnie nic. Wpisanie noindex do robots.txt też nie pomoże, bo Google nie obsługuje tam takiej reguły. Kolejność, która działa, jest prosta. Najpierw zezwól na crawlowanie. Potem dodaj noindex.

Jak dodać metatag robots z noindex albo nagłówek X-Robots-Tag

Masz dwie możliwości: tag <meta name="robots" content="noindex"> w sekcji head kodu HTML albo nagłówek odpowiedzi HTTP X-Robots-Tag. Działają tak samo. Metatag wystarczy dla zwykłych stron HTML. Nagłówek przyda się przy plikach PDF i innych plikach innych niż HTML, a do tego jednym ruchem obejmie całą ścieżkę (wygodne, gdy katalog testowy ma kilkadziesiąt adresów). Na własnym serwerze origin z NGINX blok location dla katalogu testowego wygląda tak:

location /test/ {
    add_header X-Robots-Tag "noindex" always;
}

location ~* .pdf$ {
    add_header X-Robots-Tag "noindex" always;
}

Po edycji konfiguracji przeładuj NGINX, a potem sprawdź, czy nagłówek naprawdę wraca w odpowiedzi serwera. Nie zakładaj po prostu, że tak jest.

Co wybrać dla słabych, testowych i zduplikowanych stron?

Strony, które mają zniknąć z wyników, dostają noindex. Disallow w robots.txt jest tylko dla adresów, których po prostu nie chcesz crawlować. Tak podszedłbym do typowego zestawu na małym serwisie:

  1. Słabe strony: noindex. Google usunie je po najbliższym crawlowaniu.
  2. Strony testowe: noindex albo ochrona hasłem, którą Google sam wymienia jako drugą opcję.
  3. Zduplikowane lub podobne adresy o niskiej wartości, które nigdy nie trafiły do indeksu: disallow pozwala oszczędzić crawlowanie, co ma znaczenie, jeśli zależy ci na budżecie crawlowania małych serwisów.

Serwery stagingowe i origin to osobny problem i mają własny poradnik o serwerach origin widocznych w wyszukiwarce. Jeszcze jedno: nie blokuj plików CSS, JavaScript ani obrazów, których strona potrzebuje do wyrenderowania. Bez nich Google nie przeanalizuje strony prawidłowo.

Jak sprawdzić, czy Google zobaczył twój noindex

Otwórz narzędzie Sprawdzanie adresu URL, zajrzyj do kodu HTML, który otrzymał Googlebot, i sprawdź, czy noindex naprawdę w nim jest. Zgodnie z przewodnikiem Google o blokowaniu indeksowania, jeśli strona wciąż się wyświetla, zwykle chodzi o to, że Google nie crawlował jej ponownie od dodania reguły. Nic nie jest zepsute, strona po prostu czeka na ponowne crawlowanie. Możesz o nie poprosić w tym samym narzędziu. Widok całego serwisu daje raport Indeksowanie stron w Search Console, który pokazuje każdą stronę, na której Googlebot znalazł regułę noindex.

Kiedy disallow w robots.txt nadal jest dobrym narzędziem

Disallow wciąż ma swoje miejsce. Używaj go do zarządzania ruchem robotów, do trzymania plików graficznych, wideo i audio z dala od Google oraz do pomijania nieistotnych lub niemal identycznych adresów. Nie powstrzyma jednak innych stron ani użytkowników przed linkowaniem do zablokowanych plików multimedialnych. Innym zastosowaniem jest blokowanie wybranych robotów, ale blokowanie trenowania modeli AI to osobny temat z własnymi tokenami. Noindex vs disallow w jednym zdaniu: żeby usunąć stronę, zezwól na crawlowanie i dodaj noindex. Żeby oszczędzić crawlowanie na nieważnych adresach, zablokuj je przez disallow.

FAQ

Czy mogę wpisać noindex do robots.txt?

Nie. Google nie obsługuje reguły noindex w robots.txt. Umieść ją w metatagu robots w sekcji head strony albo wyślij jako nagłówek X-Robots-Tag.

Czy używać jednocześnie disallow i noindex na tej samej stronie?

Nie. Reguła disallow blokuje Googlebotowi pobranie strony, więc nigdy nie zobaczy on noindex. Zostaw stronę dostępną do crawlowania, dopóki nie zniknie z wyników.

Jak usunąć z Google stronę zablokowaną w robots.txt?

Usuń wpis w robots.txt, który blokuje stronę, a potem dodaj metatag noindex albo nagłówek. Następnie poproś o ponowne crawlowanie w narzędziu Sprawdzanie adresu URL, żeby Google mógł odczytać nową regułę.

UdostępnijLinkedInX
Zespół Web Systems

Zespół, który tworzy i utrzymuje Jalvo.

Daj każdej stronie własne IP.

Pierwszą domenę dodasz w kilka minut.

Zacznij teraz

Wybierz, na które pliki cookie się zgadzasz. Niezbędne pliki cookie utrzymują działanie strony i logowania, nie można ich wyłączyć.