Cloudfare blockiert versehentlich KI-Crawler, externe Einbindungen belasten das Google-Crawl-Kontingent nicht und Meta arbeitet an eigenem Web-Index.
KI-Bot-Filter blockiert versehentlich Googlebot und Bingbot
Ein neues Schutz-Feature von Cloudflare zur Blockade von KI-Crawlern sorgt offenbar für unerwünschte Nebeneffekte bei Suchmaschinen. Wie ein Administrator auf Reddit berichtet, verweigert der Sicherheitsdienst bei aktivierter KI-Sperre auch legitimierten Suchmaschinen-Bots wie dem Googlebot und Bingbot den Zugriff auf Sitemaps. Statt der angeforderten Inhalte erhielten die Crawler entsprechende HTTP-403-Fehlercodes, was sich nachträglich auch in der Google Search Console bestätigte.
Ursache für dieses Verhalten dürfte eine Regelung von Cloudflare sein, wonach vielseitig genutzte Web-Crawler standardmäßig nach den restriktivsten Kriterien eingestuft werden. Da manche Bots sowohl für Indizierungen als auch für KI-Trainingsdaten eingesetzt werden, führt dies zur unbeabsichtigten Aussperrung. Eine offizielle Stellungnahme seitens Cloudflare zu dieser Problematik steht bislang noch aus.
Externe Einbindungen belasten das Google-Crawl-Kontingent nicht
Für umfangreiche Webauftritte ist die gezielte Steuerung der Suchmaschinen-Indexierung entscheidend, damit relevante Seiten schnell erfasst werden. Werden auf einer Homepage Medien oder Elemente fremder Server genutzt – etwa Bilder, Widgets oder iFrames –, wirkt sich deren Aufruf nicht negativ auf das Crawl-Kontingent der eigenen Domain aus. Wie John Müller von Google klarstellte, ordnet der Crawler Anfragen stets direkt dem Ursprungsserver des jeweiligen Inhalts zu. Auf diese Weise soll eine Serverüberlastung vermieden werden. Webmaster müssen externe Ressourcen somit bei der Optimierung der Zugriffsfrequenzen nicht berücksichtigen und können sich rein auf selbst gehostete Dateien konzentrieren.
Mehr Unabhängigkeit: Meta arbeitet offenbar an eigenem Web-Index
Auffällige Aktivitäten des Anbieters Meta deuten darauf hin, dass das Unternehmen einen eigenen Suchindex aufbaut. Anlass zu diesen Vermutungen geben verzeichnete Zugriffe des Crawlers „meta-externalagent“, die von verschiedenen Website-Betreibern registriert wurden. Ziel dieser Entwicklung ist vermutlich, den internen KI-Assistenten bei Rechercheaufgaben vom Suchmaschinen-Marktführer Google zu emanzipieren. Ähnliche Strategien verfolgen auch Konkurrenten wie Anthropic und OpenAI, indem sie auf alternative Partner wie Brave oder Bing setzen.
Dennoch bleibt das Unterfangen herausfordernd: Die gigantische Datenbasis und langjährige Expertise von Google lassen sich keineswegs kurzfristig einholen. Ob Metas Bestrebungen genügen, um eine gleichwertige Datenbasis für künstliche Intelligenzen bereitzustellen, muss sich daher erst noch erweisen.
https://www.seo-suedwest.de/10901-meta-baut-eigenen-web-index-anzeichen-sprechen-dafuer.html
Bild: Vitaly Gariev / Pexels
