Beobachtetes Signal · 8. Aug. 2026 · Technical Release · Quelle: DEV Community · Relevanz: 3/5 · Sentiment: Neutral
Firewalls steuern AI-Crawler-Zugriff: Ergebnisse einer Audit-Studie mit 18 Websites
Ein Autor hat das Open-Source-Tool geo-crawl-audit entwickelt, um zu untersuchen, wie wichtige Websites mit User-Agents von AI-Crawlern umgehen und wie viel lesbarer Content im rohen HTML vor der JavaScript-Ausführung vorhanden ist. Der Test an 18 Websites ergab, dass vor allem Firewalls und Bot-Management-Regeln – und nicht allein die robots.txt – den Zugriff steuern. Viele prominente AI-Crawler wie GPTBot, ClaudeBot oder PerplexityBot führen kein JavaScript aus, während Googlebot und Applebot Inhalte rendern. Einige bekannte Plattformen liefern zudem nahezu leere HTML-Seiten an AI-Crawler aus. Fünf Websites blockierten die Basisabfragen vollständig, was die Komplexität der Messung verdeutlicht. Das Tool und ein öffentlicher Scanner wurden veröffentlicht, um Betreibern die Prüfung ihrer Domain-Sichtbarkeit zu erleichtern.
Das Audit verdeutlicht die operativen Hürden durch WAF-, Bot-Management- und Server-Rendering-Konfigurationen für die AI-Sichtbarkeit von Web-Inhalten. Dies ist für Publisher und SEO/GEO-Verantwortliche zur präzisen Steuerung von LLM-Zugriffen hochrelevant.
Marktsignale zu The Guardian in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Der Autor veröffentlichte das Open-Source-Tool geo-crawl-audit, welches Websites mit User-Agents großer AI-Crawler testet und die Wortanzahl im rohen HTML misst.
- Der Testlauf vom 7. August 2026 an 18 großen Websites lieferte eine Status-Matrix pro Crawler sowie Laufzeitdaten.
- Zahlreiche AI-Crawler (u. a. GPTBot, ClaudeBot, PerplexityBot) führen kein JavaScript aus; nur wenige wie Googlebot und Applebot rendern JS.
- Beobachtete HTTP-Statusmuster korrelierten oft mit bekannten Geschäftsbeziehungen, während einige Sites spezifische Crawler blockierten oder durchließen.
- Fünf Websites (darunter Quora, OpenAI, Perplexity, Bloomberg und GitHub) blockierten oder filterten die Basisabfragen des Tools.
Verknüpfte Unternehmen
18 verknüpfte Unternehmen“The Guardian — which has a content deal with OpenAI — serves my simulated GPTBot, OAI-SearchBot, and ChatGPT-User a clean 200....”
“The Guardian — which has a content deal with OpenAI — serves my simulated GPTBot, OAI-SearchBot, and ChatGPT-User a clean 200....”
“The New York Times — in litigation with OpenAI — 403s nearly everyone: GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Common Crawl, meta-e...”
“Reddit's robots.txt blocks every AI bot in my list — fourteen tokens, no exceptions....”
“Figma runs the inverse configuration: serves a 200 to every bot UA in the list, but robots-disallows GPTBot, OAI-SearchBot, ChatGPT-User, Cl...”
“Airbnb returns 403 to nine of the twelve AI user-agents I probe — every OpenAI, Perplexity, Microsoft, Amazon, Meta, and Common Crawl token ...”
“Airbnb returns 403 to nine of the twelve AI user-agents I probe ... while, curiously, all three Anthropic user-agents get a 200....”
“LinkedIn served my probe a 23-word bot-check interstitial — whatever a verified crawler negotiates, the raw HTML a stranger gets is effectiv...”
“Quora, OpenAI, Perplexity, Bloomberg, and GitHub challenged even my baseline browser request from my network....”
“Stripe (1,957 raw-HTML words, a 200 to every UA in my list) ... — full server-rendered HTML, fast, no bot differentials against my probe....”
“OAI-SearchBot, Claude-SearchBot, PerplexityBot, Amazonbot, and meta-externalagent all received a 200 from the same IP, seconds apart....”
“OAI-SearchBot, Claude-SearchBot, PerplexityBot, Amazonbot, and meta-externalagent all received a 200 from the same IP, seconds apart....”
“Quora, OpenAI, Perplexity, Bloomberg, and GitHub challenged even my baseline browser request from my network....”
“Stripe (1,957 raw-HTML words, a 200 to every UA in my list), Anthropic (fastest warm response in the test at 0.102s), Vercel, MDN, Shopify —...”
“Stripe (1,957 raw-HTML words, a 200 to every UA in my list), Anthropic (fastest warm response in the test at 0.102s), Vercel, MDN, Shopify —...”
“Quora, OpenAI, Perplexity, Bloomberg, and GitHub challenged even my baseline browser request from my network....”
“Quora, OpenAI, Perplexity, Bloomberg, and GitHub challenged even my baseline browser request from my network....”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Study: Nearly Half of Top German Sites Block AI Crawlers
A Hotwire study titled "The AI Coverage Gap" found that 48% of the 100 highest-reach German online media are not or only partially accessible to AI crawlers. The research evaluated access by ten AI crawlers (from providers such as OpenAI, Anthropic and Perplexity) to the domains of those top-100 publishers in June 2026. Major publishers (e.g., Bild, Der Spiegel, stern, Focus Online) largely block crawlers, while national newspapers like Frankfurter Allgemeine, Süddeutsche Zeitung and Die Zeit generally allow access. The study highlights strategic dilemmas for publishers and communications teams about visibility in LLM-generated answers, commercial implications for traffic and subscriptions, and technical mitigation options (robots.txt, CDN/server rules, paywalls). Hotwire recommends companies consider AI accessibility when selecting target media and measure AI visibility as part of communications KPIs.
Let AI Crawlers In: AEO Not SEO in 2026
The article argues that 'AEO' (Answer Engine Optimization) is a distinct discipline from classic SEO and that publishers who want to be cited by AI assistants should allow AI crawlers to index their pages. It explains that AI crawlers are vendor- and task-specific (training, search-indexing, live fetch) and lists explicit user-agent names for OpenAI, Anthropic, Perplexity and Google. The piece reminds readers that robots.txt (RFC 9309, 2022) is a voluntary request, not an enforcement mechanism, and that hard blocks require server/CDN/WAF rules. Recommended practical steps include per-bot robots.txt entries, server-rendered HTML, structured data (schema.org), adopting the emerging llms.txt convention, and ensuring CDN bot‑management aligns with robots.txt.
API-Tool prüft Website-Sichtbarkeit in KI-Suchmaschinen per Einmal-Aufruf
Ein Entwickler hat ein kompaktes Audit-Tool und Web-Interface veröffentlicht, mit dem Publisher und Website-Betreiber bewerten können, ob ihre Inhalte von KI-Suchassistenten wie ChatGPT Search, Perplexity oder Google AI Overviews gecrawlt, geparst und zitiert werden können. Die Analyse prüft unter anderem den robots.txt-Zugriff für spezifische KI-Crawler wie GPTBot, OAI-SearchBot, PerplexityBot und ClaudeBot, das Vorhandensein von llms.txt, JSON-LD-Strukturdaten sowie die Passage-Zitierbarkeit. Das Ergebnis ist ein Score von 0 bis 100 mit detaillierten Kategoriewertungen und konkreten Handlungsempfehlungen. Die API ist schlüssellos per POST-Request unter https://citeready-api.sprytools.com/v1/audit ansprechbar, während die Web-Oberfläche unter citeready.sprytools.com ein kostenloses Kontingent von drei Audits pro Tag ohne Registrierung bereitstellt. Damit erhalten SEO- und GEO-Workflows ein pragmatisches Instrument zur Optimierung der eigenen KI-Sichtbarkeit.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
