Crawl Budget
Was versteht man unter dem Crawl Budget?
Unter dem Crawl Budget versteht man die Anzahl der URLs einer Webseite, die Google crawlen kann und crawlen möchte. Es ergibt sich aus dem Crawling-Kapazitätslimit, also wie viel Googlebot abrufen kann, ohne den Server zu überlasten, und dem Crawling-Bedarf, also wie gefragt und aktuell die Inhalte sind. Nicht jede gecrawlte Seite wird anschließend auch indexiert.
Das Crawl Budget wird nach Angaben von Google vor allem durch folgende Faktoren beeinflusst: wie schnell und zuverlässig der Server antwortet (häufen sich Serverfehler, drosselt Google das Crawling), wie beliebt die Inhalte sind, wie oft sie sich ändern und wie viele doppelte oder unwichtige URLs eine Webseite enthält.
Warum sollte ich mein Crawl Budget erhöhen bzw. optimieren?
Das Interesse jedes Webmasters sollte es sein, möglichst viele, der auf seiner Webseite bereitgestellten URLs im Google-Index wiederzufinden. Betragen die von Google erfassten URLs nur ein Zehntel der verfügbaren URLs deiner Webseite so sind auch nur ein Zehnter der Informationen der Webseite über die Suchmaschine auffindbar. Die anderen 90 % der Informationen, welche eine Webseite bereitstellt, werden somit von Google nicht erfasst und stehen ebenfalls nicht für die Generierung von organischem Trafik (Trafik, der aufgrund von Suchanfragen des Benutzers bei Google entsteht) zur Verfügung.
Das Resultat hieraus ist eine geringere (bzw. geringe) Anzahl von Besuchern auf deiner Webseite.
Wie lasst sich herausfinden, ob das Crawl Budget ein problematisches Thema für eine Webseite ist?
Laut Google ist das Crawl Budget vor allem für große Webseiten ein Thema — etwa ab einer Million Seiten mit wöchentlichen Änderungen oder ab 10.000 Seiten mit täglichen Änderungen — sowie für Webseiten, bei denen viele URLs im Status „Gefunden – zurzeit nicht indexiert" stehen.
Generell gibt es eine einfache Methode, um herauszufinden, ob das Crawl Budget bei deinem Projekt (deiner Webseite) ein Thema ist, mit dem du dich beschäftigten solltest.
Hierzu musst du vorerst herausfinden, wie viele Seiten deiner Homepage bereits von Google indiziert sind. Diese Information erhältst du ganzen einfach aus der Google Search Console (früher Google Webmaster-Tools). Um die Anzahl der indizierten Seiten zu ermitteln, meldet man sich in der Search Console an und liest im „Bericht zur Seitenindexierung" die Anzahl der Seiten ab, die sich bereits im Index befinden. Wie oft Googlebot die Webseite tatsächlich abruft, zeigt der Bericht „Crawling-Statistik" unter den Einstellungen der Property.
Nachdem du die Anzahl der Seiten herausgefunden hast, die Google bereits indiziert hat, ist eine weitere Information die Gesamtanzahl der Seiten, die dein Webprojekt insgesamt bereitstellt. Um zu ermitteln, wie hoch die Anzahl dieser Seite (bzw. dieser URLs) ist, kannst du z.B. die Informationen aus der XML-Sitemap deiner Seite heranziehen. Weiterhin bietet das CMS (Content Management System), welches dein Webprojekt verwendet (z.B. WordPress) eine gute Informationsquelle, um die Anzahl der Webseiten deines Webprojektes zu ermitteln.
Hast du die Menge der Webseiten deines Webprojektes und die davon von Google indizierten Webseiten ermitteln, teilst du die Gesamtanzahl der Webseiten durch die indizierten Seiten. Sollte dieser Wert größer als 10 sein (Google hat somit nur ein Zehntel der URLs deiner Webseite indiziert), besteht akuter Handlungsbedarf. Ein Wert kleiner oder gleich drei, ist sehr gut und du musst dir keine weiteren Gedanken, um das Crawl-Budget machen. Diese Faustregel stammt allerdings nicht von Google — und da nicht jede gecrawlte Seite indexiert wird, deutet ein schlechter Wert oft eher auf Indexierungs- als auf reine Crawling-Probleme hin.
Wie erhöhe ich / Wie optimiere ich mein Crawl Budget?
Es sollte im Interesse jedes Webmasters sein, das Crawl Budget, welches Google für deine Webseite zur Verfügung stellt zu optimieren, bzw. zu maximieren, damit möglichst viele Webseiten von Google durchsucht (gecrawlt) und im Index erfasst werden.
Im Folgenden werden einige grundlegende Methoden vorgestellt, um dies zu erreichen:
Fehler auf der Webseite ermitteln und beheben
Generell werden in den Google-Index nur Webseiten aufgenommen, die einen Status-Code aus dem Bereich 2xx („OK“) liefern — eine Garantie für die Indexierung ist das aber nicht. Bei einer Weiterleitung mit dem Status-Code 301 (Moved Permanently) wertet Google das Weiterleitungsziel als die zu verarbeitende Seite.
Alle anderen Statuscodes (insbesondere Statuscodes aus dem Bereich 4xx, sowie 5xx) führen dazu, dass die entsprechenden Webseiten, bzw. URLs von Google nicht indiziert werden.
Weist ein Webprojekt, somit viele fehlerhafte URLs auf, führt dies dazu, dass die entsprechenden URLs von Google nicht indiziert werden (bzw. gar nicht indiziert werden können, da z.B. auf Grund von Fehlern, gar kein Inhalt gecrawlt werden kann). Auf das Crawl Budget wirken sich die Fehler unterschiedlich aus: Serverfehler (5xx) und der Status-Code 429 veranlassen Google, das Crawling vorübergehend zu verlangsamen; 4xx-Fehler (außer 429) haben laut Google dagegen keinen Einfluss auf die Crawling-Geschwindigkeit. Für entfernte Seiten empfiehlt Google daher 404 oder 410. Soft-404-Fehler und lange Weiterleitungsketten verbrauchen dagegen unnötig Crawl Budget. Das Crawling selbst ist kein Rankingfaktor.
Weniger relevante Bereich der Webseite von der Indizierung ausschließen
Um Google dabei zu helfen, herauszufinden, welche URLs deines Webprojektes wichtig sind und welche eher irrelevante Informationen beinhalten, kannst du mit Hilfe von verschiedenen Methoden, den Google-Crawler steuern und die Verwendung deines Crawl-Budget in einer gewissen Weise steuern.
Hierzu lassen sich z.B. bestimmte URLs (oder ganze URL-Pfade) global in der Robots.txt vom Crawling ausschließen — laut Google der geeignete Weg, um unwichtige URLs dauerhaft vom Crawl Budget fernzuhalten. Mit Hilfe des Robots-Meta-Tags (noindex) lässt sich dagegen auf jeder HTML-Seite festlegen, ob diese Seite indiziert werden soll, oder nicht. Crawl Budget spart das kaum, denn Google muss die Seite weiterhin abrufen, um die Anweisung überhaupt zu lesen.