Crawl budget w małych sieciach stron: kiedy naprawdę ma znaczenie


W tym artykule
- Czym jest crawl budget według Google?
- Czy crawl budget wpływa na małe strony w sieci?
- Kiedy crawl budget staje się realnym problemem na małej stronie
- Jak skupić crawling na stronach, które się liczą
- Dlaczego kondycja witryny liczy się bardziej niż wielkość budżetu
- Szybka kontrola crawl budget w małej sieci stron
- FAQ
W większości małych serwisów to nie crawl budget hamuje indeksowanie. Naprawdę. Zaczyna mieć znaczenie dopiero wtedy, gdy strona generuje znacznie więcej adresów URL do crawlowania, niż ma prawdziwych podstron, a winne są zwykle filtry, sortowanie albo niedbała obsługa błędów. Jeśli więc prowadzisz kilka małych stron i ciągle czytasz, że crawl budget ogranicza indeksowanie, pewnie zastanawiasz się: czy to mnie dotyczy? Poniżej opisuję, jak Google definiuje ten budżet, dla kogo naprawdę są pisane jego wytyczne, jakie pułapki marnują crawling na małych stronach i co poprawić zamiast tego.
Czym jest crawl budget według Google?
Crawl budget to zbiór adresów URL, które Google może i chce crawlować w danej witrynie. Według dokumentacji Google o crawl budget infrastruktura crawlująca traktuje witrynę jako unikalną nazwę hosta, więc www.example.com i code.example.com mają osobne budżety. Budżet składa się z dwóch części:
- Limit wydajności crawlowania: ile crawlowania wytrzyma twój serwer bez problemów.
- Zapotrzebowanie na crawling: ile Google faktycznie chce crawlować.
Każda witryna zaczyna z tym samym domyślnym limitem wydajności i jest to limit ostrożny. Google podnosi go z czasem, jeśli jest zapotrzebowanie, a witryna działa sprawnie. Jest jednak haczyk. Nawet gdy limit nigdy nie zostaje osiągnięty, niskie zapotrzebowanie i tak oznacza, że Google crawluje witrynę rzadziej.
Czy crawl budget wpływa na małe strony w sieci?
Rzadko. W typowej małej witrynie ze skromnym, stabilnym zestawem podstron crawl budget prawie nigdy nie jest powodem, dla którego strony nie trafiają do indeksu. Wytyczne dotyczące zarządzania crawl budget są skierowane do dużych witryn i takich, których treść zmienia się bardzo często (a nie do bloga czy strony wizytówki z kilkudziesięcioma adresami URL, które prawie się nie zmieniają). W sieci każda domena lub subdomena to osobna nazwa hosta z własnym budżetem. Małe strony nie dzielą jednej wspólnej puli. Dodaj kolejną stronę do sieci, a pozostałe nie stracą ani trochę crawlingu.
Kiedy crawl budget staje się realnym problemem na małej stronie
Mała witryna nadal może marnować crawling, gdy generuje mnóstwo adresów URL powielających tę samą treść. Typowi winowajcy:
- nawigacja fasetowa i kombinacje filtrów
- różnie posortowane wersje tej samej strony
- strony z nieskończonym przewijaniem, które powtarzają treść dostępną już na podlinkowanych stronach
- strony soft 404, które dla brakującej treści zwracają zwykłą odpowiedź
- długie łańcuchy przekierowań
Nawigacja fasetowa to podręcznikowy przykład. Każda kombinacja filtrów koloru, rozmiaru czy ceny tworzy nowy URL z niemal identyczną treścią, a to szybko się sumuje. Jeśli Google spędza za dużo czasu na adresach, których nie powinien crawlować, może nie dotrzeć do reszty witryny albo w ogóle nie podnieść budżetu. Zdarzenia obejmujące całą witrynę, na przykład przeniesienie serwisu, działają odwrotnie: na krótko zwiększają zapotrzebowanie na crawling, żeby Google mógł ponownie przetworzyć treść pod nowymi adresami.
Jak skupić crawling na stronach, które się liczą
Zarządzaj zasobem adresów URL tak, żeby Google wydawał crawling na unikalną treść, a nie na unikalne adresy. Duża różnica. Te kroki dotyczą twojego serwera źródłowego, CMS-a albo konfiguracji NGINX:
- Połącz zduplikowaną treść w jedną stronę kanoniczną.
- Blokuj w robots.txt nieistotne adresy, takie jak warianty sortowane i filtrowane, jeśli nie możesz ich skonsolidować.
- Dla trwale usuniętych stron zwracaj kod 404 lub 410, zgodnie z zaleceniami Google dotyczącymi usuniętych adresów.
- Popraw błędy soft 404 wymienione w raporcie Indeksowanie stron w Search Console.
- Aktualizuj mapy witryny i dodawaj tag
<lastmod>przy zaktualizowanej treści. - Skracaj łańcuchy przekierowań, żeby każdy stary URL wskazywał bezpośrednio na adres docelowy.
Między usunięciem a blokowaniem wybieraj z rozwagą. Ludzie ciągle to mylą. Usunięta strona, która zwraca status błędu, to mocny sygnał, żeby jej ponownie nie crawlować. Adresy zablokowane w robots.txt natomiast siedzą w kolejce do crawlowania znacznie dłużej i są crawlowane ponownie, gdy tylko blokada zniknie.
Dlaczego kondycja witryny liczy się bardziej niż wielkość budżetu
Google podnosi limit wydajności crawlowania tylko witrynom, które działają sprawnie, więc dostępność w trakcie crawlowania jest ważniejsza niż jakiekolwiek ustawienie do podkręcenia. Przy diagnozowaniu najpierw sprawdź, czy witryna miała problemy z dostępnością podczas wizyt Googlebota. Dopiero potem zajmij się zwiększaniem wydajności crawlowania. A niskie zapotrzebowanie na crawling? Moim zdaniem to zwykle problem treści i sygnałów, a nie limitu budżetu. Ubogie, zduplikowane albo rzadko aktualizowane strony dają Google mało powodów, żeby wracać. Logi to właściwe narzędzie, żeby zobaczyć, gdzie crawlery spędzają czas na twoim serwerze, a pozostałe wpisy o crawlingu i serwerach omawiają powiązane kwestie konfiguracji.
Szybka kontrola crawl budget w małej sieci stron
Dla każdej witryny porównaj strony, które chcesz mieć w indeksie, z adresami URL, które Google ciągle znajduje. Winą obarczaj crawl budget tylko wtedy, gdy różnica wynika z nadmiaru adresów. Przejdź tę listę dla każdej domeny:
- parametry filtrów lub sortowania, które tworzą adresy dostępne do crawlowania
- błędy soft 404 w raporcie Indeksowanie stron
- pokrycie mapy witryny i poprawny
<lastmod> - łańcuchy przekierowań dłuższe niż jeden skok
- problemy z dostępnością podczas crawlowania
Nic nie wyszło? W takim razie brakujące strony zwykle wskazują na jakość treści albo słabe linkowanie wewnętrzne, a nie na to, że crawlerowi zabrakło czasu. Moja rada: najpierw popraw duplikaty i kondycję witryny, a crawl budgetem zajmij się dopiero potem.
FAQ
Czy każda domena w mojej sieci ma własny crawl budget?
u003cpu003eTak. Google traktuje witrynę jako unikalną nazwę hosta, więc każda domena i każda subdomena dostaje własny budżet. u003ca href=u0022https://jalvo.eu/subnet-diversity-small-site-network/u0022u003eJedna obciążona strona w sieciu003c/au003e nie ogranicza crawlowania pozostałych.u003c/pu003e
Czy mogę poprosić Google o zwiększenie crawl budget?
u003cpu003eNie, nie ma do tego formularza. Limit wydajności rośnie sam, gdy jest zapotrzebowanie, a witryna działa sprawnie. Na co masz wpływ: niezawodny serwer, mniej zduplikowanej treści i mapy witryny, które odzwierciedlają to, co naprawdę się zmieniło.u003c/pu003e
Czy blokować adresy URL nawigacji fasetowej w robots.txt?
u003cpu003eNajpierw konsoliduj, na przykład kierując warianty filtrów na jedną stronę kanoniczną. Jeśli to niemożliwe, zablokuj nieistotne warianty sortowane lub filtrowane w robots.txt. Pamiętaj tylko, że zablokowane adresy dłużej zostają w kolejce do crawlowania i są crawlowane ponownie po zdjęciu blokady.u003c/pu003e
Daj każdej stronie własne IP.
Pierwszą domenę dodasz w kilka minut.


