{"id":2425,"date":"2026-02-05T09:48:00","date_gmt":"2026-02-05T08:48:00","guid":{"rendered":"https:\/\/jalvo.eu\/limit-2mb-googlebota-duze-strony-html\/"},"modified":"2026-02-05T09:48:00","modified_gmt":"2026-02-05T08:48:00","slug":"limit-2mb-googlebota-duze-strony-html","status":"publish","type":"post","link":"https:\/\/jalvo.eu\/pl\/limit-2mb-googlebota-duze-strony-html\/","title":{"rendered":"Limit 2 MB Googlebota: co trac\u0105 du\u017ce strony HTML przy crawlowaniu"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\">Googlebot pobiera tylko pierwsze 2 MB pliku obs\u0142ugiwanego typu i pierwsze 64 MB pliku PDF. To, co le\u017cy za tym progiem, nigdy nie trafia do rozpatrzenia pod k\u0105tem indeksowania, jak podaje <a href=\"https:\/\/developers.google.com\/search\/docs\/crawling-indexing\/googlebot\" rel=\"nofollow noopener\" target=\"_blank\">dokumentacja Googlebota od Google<\/a>. Kogo to powinno obchodzi\u0107? G\u0142\u00f3wnie serwisy na WordPressie i page builderach, kt\u00f3rych szablony wypluwaj\u0105 bardzo ci\u0119\u017cki HTML. To w\u0142a\u015bnie tam limit 2 MB Googlebota daje si\u0119 we znaki. Wi\u0119kszo\u015b\u0107 stron jest znacznie mniejsza, wi\u0119c bez paniki: najpierw zmierz w\u0142asne dokumenty i popraw tylko te, kt\u00f3re zbli\u017caj\u0105 si\u0119 do progu.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Co dok\u0142adnie m\u00f3wi limit 2 MB Googlebota?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Googlebot przestaje pobiera\u0107 plik, gdy dojdzie do progu, i przekazuje dalej tylko t\u0119 cz\u0119\u015b\u0107, kt\u00f3r\u0105 ju\u017c ma. 3 lutego 2026 roku Google przenios\u0142o domy\u015blne limity rozmiaru plik\u00f3w swoich robot\u00f3w do dokumentacji crawler\u00f3w i doprecyzowa\u0142o warto\u015bci dla samego Googlebota. Pr\u00f3g dotyczy danych nieskompresowanych, wi\u0119c rozmiar transferu, kt\u00f3ry widzisz przy gzip albo Brotli, nie jest liczb\u0105, kt\u00f3ra si\u0119 liczy. I nie, nic w dokumentacji nie opisuje tego limitu jako sygna\u0142u rankingowego. Okre\u015bla on tylko, jaka cz\u0119\u015b\u0107 pliku trafia do indeksowania.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">2 MB a limit crawlowania 15 MB: kt\u00f3ra warto\u015b\u0107 dotyczy Twoich stron?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">W przypadku wyszukiwarki Google obowi\u0105zuje mniejszy limit rozmiaru pliku Googlebota, a nie og\u00f3lna warto\u015b\u0107 domy\u015blna. Limit crawlowania 15 MB to poziom bazowy dla wszystkich robot\u00f3w i fetcher\u00f3w Google, a tre\u015b\u0107 powy\u017cej niego jest ignorowana, jak wynika z <a href=\"https:\/\/developers.google.com\/crawling\/docs\/crawlers-fetchers\/overview-google-crawlers\" rel=\"nofollow noopener\" target=\"_blank\">przegl\u0105du robot\u00f3w Google<\/a>. Ta sama strona wyja\u015bnia, \u017ce poszczeg\u00f3lne projekty mog\u0105 ustawia\u0107 inne progi dla danego robota i typu pliku, a jako przyk\u0142ad podaje Googlebota.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Co du\u017ce strony HTML trac\u0105 za progiem?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Wszystko, co jest za progiem. W d\u0142ugim dokumencie mo\u017ce to oznacza\u0107 ko\u0144cowe partie tekstu, nawigacj\u0119 w stopce, linki wewn\u0119trzne i dane strukturalne umieszczone na ko\u0144cu \u017ar\u00f3d\u0142a. A poniewa\u017c Googlebot znajduje nowe adresy URL g\u0142\u00f3wnie przez linki na crawlowanych stronach, uci\u0119ta stopka mo\u017ce sprawi\u0107, \u017ce zaczniesz <a href=\"https:\/\/jalvo.eu\/pl\/strony-osierocone-jak-je-znalezc-i-podlinkowac\/\">szuka\u0107 osieroconych stron<\/a>, kt\u00f3re w przegl\u0105darce wygl\u0105da\u0142y na dobrze podlinkowane.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Pliki CSS i JavaScript wskazane w HTML s\u0105 pobierane osobno, a ka\u017cde z tych pobra\u0144 podlega temu samemu limitowi. Zbyt du\u017cy bundle te\u017c mo\u017ce zosta\u0107 uci\u0119ty, co wp\u0142ywa na to, jak strona renderuje si\u0119 dla Google. Moim zdaniem SEO du\u017cych stron HTML sprowadza si\u0119 do kompletno\u015bci: czy ca\u0142y dokument i ka\u017cdy plik, od kt\u00f3rego on zale\u017cy, faktycznie trafia do procesu indeksowania?<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Jak zmierzy\u0107 rozmiar nieskompresowanego HTML za pomoc\u0105 curl<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Pobierz surowy dokument bez kompresji i odczytaj liczb\u0119 bajt\u00f3w. Oto jak sprawdzi\u0107 rozmiar strony HTML w spos\u00f3b zgodny z tym, co liczy limit:<\/p>\n\n\n\n<ol class=\"wp-block-list\">\n<li>Pobierz stron\u0119 przez curl i nie pro\u015b o kompresj\u0119 (pomi\u0144 flag\u0119 <em>-compressed<\/em>).<\/li>\n<li>Zapisz wynik i wypisz rozmiar: <code>curl -s -o page.html -w '%{size_download}' https:\/\/example.com\/page\/<\/code><\/li>\n<li>Powt\u00f3rz test dla najwi\u0119kszych plik\u00f3w CSS i JavaScript, bo ka\u017cdy z nich ma w\u0142asny limit.<\/li>\n<\/ol>\n\n\n\n<p class=\"wp-block-paragraph\">Patrz na sam dokument HTML, a nie na \u0142\u0105czn\u0105 wag\u0119 strony podawan\u0105 przez narz\u0119dzia w przegl\u0105darce. Zacznij od najci\u0119\u017cszych szablon\u00f3w: d\u0142ugich landing page&#8217;y z\u0142o\u017conych w page builderze, archiw\u00f3w kategorii, stron z osadzonymi danymi.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Sk\u0105d bierze si\u0119 nadmiar: inline CSS, JavaScript i obrazy base64<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Rzadko z tekstu. Wi\u0119kszo\u015b\u0107 przero\u015bni\u0119tych dokument\u00f3w puchnie od kodu i danych osadzonych bezpo\u015brednio w znacznikach. Typowi winowajcy nadmiaru inline CSS i JavaScript w WordPressie i page builderach to bloki styl\u00f3w dla ka\u017cdego wid\u017cetu, skrypty wstawione inline, zserializowany stan w JSON, inline SVG i obrazy zakodowane w base64. Poprawki wprowadza si\u0119 w CMS, motywie albo na serwerze \u017ar\u00f3d\u0142owym:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Przenie\u015b inline CSS i JS do <strong>plik\u00f3w zewn\u0119trznych<\/strong>.<\/li>\n<li>Zast\u0105p obrazy base64 zwyk\u0142ymi plikami graficznymi.<\/li>\n<li>Usu\u0144 nieu\u017cywane modu\u0142y buildera i zduplikowane sekcje.<\/li>\n<li>Podziel bardzo d\u0142ugie strony na kilka kr\u00f3tszych.<\/li>\n<\/ul>\n\n\n\n<h2 class=\"wp-block-heading\">Umie\u015b\u0107 wa\u017cn\u0105 tre\u015b\u0107 i linki na pocz\u0105tku HTML<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Kolejno\u015b\u0107 w \u017ar\u00f3dle wygrywa z kolejno\u015bci\u0105 wizualn\u0105. G\u0142\u00f3wna tre\u015b\u0107 i linki wewn\u0119trzne, na kt\u00f3rych Ci zale\u017cy, powinny pojawia\u0107 si\u0119 przed ci\u0119\u017ckimi skryptami i blokami dekoracyjnymi. Utrzymuj sekcj\u0119 head w ryzach, \u017ceby body zaczyna\u0142o si\u0119 wcze\u015bnie, a du\u017ce skrypty inline i bloki danych przesu\u0144 na koniec dokumentu albo do plik\u00f3w. Je\u015bli strona i tak zostanie uci\u0119ta, ocaleje wtedy ta cz\u0119\u015b\u0107, kt\u00f3ra ma znaczenie.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Sprawd\u017a te\u017c, czy roboty mog\u0105 pobra\u0107 CSS, JavaScript i obrazy, na kt\u00f3rych opiera si\u0119 strona, na przyk\u0142ad pisz\u0105c na serwerze \u017ar\u00f3d\u0142owym <a href=\"https:\/\/jalvo.eu\/pl\/ochrona-przed-hotlinkingiem-nginx-grafika-google\/\">regu\u0142y hotlinkowania przepuszczaj\u0105ce roboty<\/a>. Reverse proxy NGINX takie jak Jalvo, z adresami IP z UE i USA przed istniej\u0105cym hostingiem, niczego tu nie zmienia: o rozmiarze HTML nadal decyduj\u0105 serwer \u017ar\u00f3d\u0142owy i CMS. W przypadku ci\u0119\u017ckich stron, kt\u00f3re w og\u00f3le nie maj\u0105 powodu pojawia\u0107 si\u0119 w wyszukiwarce, najpierw ustal, <a href=\"https:\/\/jalvo.eu\/pl\/noindex-vs-disallow-jak-usunac-strone-z-google\/\">kiedy noindex wygrywa z disallow<\/a>.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Zmierz nieskompresowany HTML najci\u0119\u017cszych szablon\u00f3w, przenie\u015b kod inline i obrazy base64 do plik\u00f3w, a potem umie\u015b\u0107 g\u0142\u00f3wn\u0105 tre\u015b\u0107 i linki na pocz\u0105tku \u017ar\u00f3d\u0142a. Przy takim podej\u015bciu limit 2 MB Googlebota staje si\u0119 rutynow\u0105 kontrol\u0105 szablon\u00f3w. A nie ukrytym powodem, dla kt\u00f3rego cz\u0119\u015b\u0107 strony nigdy nie trafia do indeksu.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">FAQ<\/h2>\n\n\n<div id=\"rank-math-faq\" class=\"rank-math-block\">\n<div class=\"rank-math-list \">\n<div id=\"faq-question-1790979891753-0\" class=\"rank-math-list-item\">\n<h3 class=\"rank-math-question \">Czy limit rozmiaru pliku Googlebota dotyczy rozmiaru skompresowanego czy nieskompresowanego?<\/h3>\n<div class=\"rank-math-answer \">\n\n<p>Nieskompresowanego, jak podaje dokumentacja Google. Rozmiar transferu pokazywany dla odpowiedzi z gzip albo Brotli jest mniejszy ni\u017c liczba, kt\u00f3ra si\u0119 liczy.<\/p>\n\n<\/div>\n<\/div>\n<div id=\"faq-question-1790979891753-1\" class=\"rank-math-list-item\">\n<h3 class=\"rank-math-question \">Czy pliki CSS i JavaScript wliczaj\u0105 si\u0119 do limitu strony HTML?<\/h3>\n<div class=\"rank-math-answer \">\n\n<p>Nie. Ka\u017cdy zas\u00f3b wskazany w HTML jest pobierany osobno i sam podlega temu samemu limitowi. Przeniesienie kodu inline do plik\u00f3w zewn\u0119trznych odchudza dokument, ale bardzo du\u017cy bundle nadal mo\u017ce zosta\u0107 uci\u0119ty sam w sobie.<\/p>\n\n<\/div>\n<\/div>\n<div id=\"faq-question-1790979891753-2\" class=\"rank-math-list-item\">\n<h3 class=\"rank-math-question \">Czy limit crawlowania PDF jest taki sam jak dla HTML?<\/h3>\n<div class=\"rank-math-answer \">\n\n<p>Nie, limit crawlowania PDF jest wy\u017cszy ni\u017c limit dla innych obs\u0142ugiwanych typ\u00f3w plik\u00f3w, gdy Googlebot crawluje na potrzeby wyszukiwarki. Zasoby wskazane w HTML podlegaj\u0105 zwyk\u0142emu progowi, a nie temu dla PDF.<\/p>\n\n<\/div>\n<\/div>\n<\/div>\n<\/div>","protected":false},"excerpt":{"rendered":"<p>Googlebot pobiera tylko pierwsze 2 MB pliku obs\u0142ugiwanego typu i pierwsze 64 MB pliku PDF. To, co le\u017cy za tym progiem, nigdy nie trafia do rozpatrzenia pod k\u0105tem indeksowania, jak podaje dokumentacja Googlebota od Google. Kogo to powinno obchodzi\u0107? G\u0142\u00f3wnie serwisy na WordPressie i page builderach, kt\u00f3rych szablony wypluwaj\u0105 bardzo ci\u0119\u017cki HTML. To w\u0142a\u015bnie tam [&hellip;]<\/p>\n","protected":false},"author":25,"featured_media":2397,"comment_status":"","ping_status":"","sticky":false,"template":"","format":"standard","meta":{"_acf_changed":false,"footnotes":""},"categories":[182],"tags":[292,512,224,408,35,356],"class_list":["post-2425","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-seo-pl","tag-googlebot-x","tag-html-x","tag-indeksowanie","tag-indeksowanie-x","tag-techniczne-seo-pl","tag-wordpress-x"],"acf":[],"_links":{"self":[{"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/posts\/2425","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/users\/25"}],"replies":[{"embeddable":true,"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/comments?post=2425"}],"version-history":[{"count":0,"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/posts\/2425\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/media\/2397"}],"wp:attachment":[{"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/media?parent=2425"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/categories?post=2425"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/jalvo.eu\/pl\/wp-json\/wp\/v2\/tags?post=2425"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}