logo w

Pozycjonowanie Poznań - Positioning Site
TL;DR Google nie przeszukuje Internetu na żywo za każdym razem, gdy wpisujesz zapytanie. Odpowiada z Indeksu Google, czyli bazy stron wcześniej przeskanowanych i ocenionych. Crawl budget to ograniczony czas i zasób danych, jakie Google poświęca Twojej stronie. Jeśli ułatwisz botom pracę przez sitemapę, meta tagi, porządek techniczny i Google Search Console, strona może być indeksowana szybciej, częściej i dokładniej.

Indeks Google — jak działa?

W dużym uproszczeniu Google przetwarza zasoby Internetu jak ktoś, kto jest w nowym supermarkecie. Przetwarza wszystko, co wleci „w oko" w określonym „oknie czasowym". Jeśli masz dużą stronę, to Google nie przejrzy jej od razu w całości. Przeskanuje ją dość pobieżnie i zapisze sobie co ważniejsze informacje o Twojej stronie WWW.

Zapisze sobie… gdzie? Ano właśnie w Indeksie Google. Kiedy pytasz Google o cokolwiek, odpowiedź dostajesz nie z Internetu, a z Indeksu Google. Jaka to różnica? Trochę jak między encyklopedią a biblioteką. Biblioteka może mieć wszystko, ale encyklopedia pokazuje to, co zostało wcześniej wybrane, opisane i uporządkowane.

Google w swoim indeksie trzyma jedynie informacje o stronach, które uznał za warte zapisania, bezpieczne albo przydatne. Ciężko w Google znaleźć nie tylko porno, ale też popularne jeszcze kiedyś torrenty, strony-duplikaty czy witryny zawierające informacje niebezpieczne. Indeks Google to wieloletni twór i na tyle dobrze dopracowany, rozwijany, że działa tak dobrze, iż wielu osobom łatwo postawić znak równości między Internetem a Indeksem Google.

Warto rozróżnić dwie rzeczy: crawlowanie i indeksowanie. Crawlowanie to skanowanie strony przez robota Google. Indeksowanie to decyzja, że dana treść zostanie zapisana w indeksie i może pojawić się w wynikach wyszukiwania. Strona może zostać przeskanowana, ale niekoniecznie musi zostać zaindeksowana. I tu zaczynają się schody.

Skanowanie stron

Wspomniałem o „oknie czasowym", w którym Google skanuje Twoją stronę WWW. Duże, prowadzone prawidłowo strony mają takie okno większe, młode strony w fazie rozwoju mają mniejsze. Cały ten mechanizm można wyjaśnić ekonomicznie. W chwili pisania tego tekstu mamy online 1 810 713 308 stron WWW i ciągle przybywają nowe strony.

Jak działa Google — wykres liczby stron WWW
Wykres liczby stron WWW w kolejnych latach. Źródło: internetlivestats.com/total-number-of-websites/

Skanowanie ich to obciążenie dla serwera, koszt, choćby energii elektrycznej. Google więc pobiera sobie najpierw najważniejsze elementy strony, później znów skanuje stronę, pobiera nowe, i znów, i znów. Bardzo upraszczając sprawę, wyobraź sobie, że podejmujesz gościa, który ma dla Ciebie kwadrans. Oczywiste, że skupisz się na rozmowie tak, aby omówić najważniejsze tematy.

Kiedy Google ma dla Twojej strony 0,05 s dziennie, oczywiste jest, że nie pobierze wszystkiego od razu. Tę chwilkę można przedstawić w bardziej informatycznej wartości — Google będzie pobierał 500 KB danych Twojej strony. Teraz już wiesz, dlaczego warto kompresować grafiki i dbać o prawidłowy kod HTML? To nie wszystko.

Ten ograniczony czas i zasób nazywa się potocznie crawl budgetem. Nie chodzi o to, że Google ma do Ciebie osobisty żal i dlatego skanuje mniej. Po prostu musi rozsądnie gospodarować zasobami. Jeśli strona jest szybka, logiczna, dobrze połączona linkami wewnętrznymi i nie produkuje tysięcy bezsensownych adresów URL, robot ma łatwiejszą pracę. Jeśli strona jest śmietnikiem, część budżetu pójdzie w błoto.

Strona WWW ma kilka elementów stałych: tytuł, opis, nagłówki, opisy grafik, opisy linków. Wypełnianie tych elementów, czyli tagów, powoduje, że Google lepiej i szybciej rozpoznaje treść Twojej strony WWW.

W związku ze znacznym rozwojem ilości treści na stronie popularne staje się oznaczanie stron znacznikami Schema.org. Znaczniki takie podają Google informacje o rodzaju treści. Sprawa jest bardzo przydatna w e-commerce oraz w firmach usługowych. Z pewnością napiszę o tym osobny tekst. Na ten moment wystarczy, że wyraźnie zaznaczę tu konieczność prawidłowego i czytelnego oznaczania rodzaju treści na stronie WWW.

Jak Google skanuje stronę?

Kilkanaście lat temu proces wyglądał jak wizyta wścibskiej sąsiadki: był Google, nie ma Google. Teraz aktualizacje indeksu Google opierają się o wiele wyspecjalizowanych robotów i algorytmów, które bardzo dokładnie analizują wybrany aspekt strony. Są takie, które oceniają szybkość strony, linki, treść. Twoja strona im dłużej jest w sieci, tym częściej i dokładniej jest analizowana.

Te mechanizmy działają równolegle. Jeden robot może sprawdzać, czy strona działa na telefonie, inny analizuje linki, kolejny treść, a jeszcze inny dane strukturalne, szybkość albo problemy z indeksacją. Dlatego SEO nie polega na naprawieniu jednej rzeczy. Google patrzy na stronę wieloma oczami naraz, a każde z nich widzi inny kawałek układanki.

Ułatwiamy Google pracę

Nie ma nic za nic. Możesz ułatwić Google pracę nad swoją stroną WWW i w zamian uzyskać liczne wskazówki oraz udogodnienia dotyczące analizy stanu strony WWW w Indeksie Google.

Mapa witryny

O mapie witryny już powstał wpis. Tutaj w skrócie napiszę tylko, że jest to pewnego rodzaju lista podstron w Twojej domenie. Google analizuje tę listę i jeśli pojawi się zmiana, np. nowa podstrona lub świeża data aktualizacji podstrony, skanuje wyłącznie adres, którego dotyczy zmiana.

Sitemapy — mapy witryny
Wpis o sitemapach

Meta tagi

Do niedawna także plik robots.txt. Grupa wskazówek dla Google, aby indeksować lub nie indeksować pewne strony. Tu chodzi o coś na kształt higieny, porządku w Internecie. Przykładowo, kiedy prowadzisz sklep online, oczywiste jest, że chcesz pozyskiwać ruch na stronę. Nie ma sensu więc wpuszczać do indeksu strony typu informacje o cookies.

Google Search Console

GSC to narzędzie mające bardzo, bardzo wiele zastosowań. W tym miejscu należy zaznaczyć, że w konsoli możemy zgłosić stronę do zaindeksowania, mapę witryny, można też przejrzeć statystyki indeksowania oraz stan strony WWW w Indeksie Google.

Google Search Console pozwala sprawdzić, czy Google widzi Twoją stronę, które podstrony są zaindeksowane, które mają problemy i jakie zapytania realnie prowadzą użytkowników do serwisu. To jedno z tych narzędzi, które właściciel strony powinien mieć podpięte od pierwszego dnia, a nie dopiero wtedy, kiedy „coś się zepsuło".

Podsumowanie

Już wiesz, jak działa Google: jak możesz ułatwić pracę botów oraz co dostaniesz w zamian. Jeśli prowadzisz prawidłowo stronę, a Google nie marnuje energii, kiedy ją skanuje, trafia na same prawidłowe strony i skanuje je dokładniej, pobiera więcej danych. Przez to Twoja strona jest szybciej, częściej i dokładniej indeksowana.

Dla właściciela strony to nie jest techniczna ciekawostka. To praktyczna wiedza o tym, dlaczego warto dbać o porządek w adresach URL, szybkość, strukturę, sitemapę, nagłówki, meta tagi i Google Search Console. Im mniej przeszkadzasz robotom, tym więcej mogą zrozumieć.

Jeśli chcesz sprawdzić, czy Google poprawnie skanuje i indeksuje Twoją stronę, zacznij od audytu SEO. Czasem problemem nie jest brak treści, tylko to, że Google nie dochodzi tam, gdzie powinien.

Więcej o tym, jak prowadzę pozycjonowanie stron w Poznaniu, znajdziesz w opisie procesu i case studies.

Najczęściej zadawane pytania

Czym różni się Internet od Indeksu Google?

Internet to całość dostępnych zasobów online. Indeks Google to baza stron, które Google wcześniej przeskanował, ocenił i zapisał. Kiedy wpisujesz zapytanie, Google nie przeszukuje całego Internetu na żywo, tylko odpowiada na podstawie własnego indeksu.

Co to jest crawl budget i dlaczego ma znaczenie?

Crawl budget to ograniczony zasób czasu i danych, jaki Google przeznacza na skanowanie strony. Jeśli strona jest szybka, uporządkowana i logiczna, robot może efektywniej przejrzeć ważne podstrony. Jeśli strona generuje bałagan, część budżetu idzie w śmieci.

Jak pomóc Google szybciej zaindeksować moją stronę?

Warto zadbać o mapę witryny, poprawne linkowanie wewnętrzne, logiczną strukturę URL, meta tagi, szybkość strony i Google Search Console. Dobrze jest też zgłaszać mapę witryny w GSC oraz pilnować, żeby ważne podstrony nie były zablokowane przez robots.txt lub tag noindex.

Czy Google indeksuje całą moją stronę od razu?

Nie zawsze. Przy małych stronach może to pójść szybko, ale większe serwisy, nowe domeny albo strony z problemami technicznymi mogą być skanowane i indeksowane stopniowo. Google najpierw pobiera najważniejsze elementy, a później wraca po kolejne dane.