Beobachtetes Signal · 8. Aug. 2026 · Technical Release · Quelle: DEV Community · Relevanz: 3/5 · Sentiment: Neutral

Firewalls steuern AI-Crawler-Zugriff: Ergebnisse einer Audit-Studie mit 18 Websites

Zusammenfassung des Signals

Ein Autor hat das Open-Source-Tool geo-crawl-audit entwickelt, um zu untersuchen, wie wichtige Websites mit User-Agents von AI-Crawlern umgehen und wie viel lesbarer Content im rohen HTML vor der JavaScript-Ausführung vorhanden ist. Der Test an 18 Websites ergab, dass vor allem Firewalls und Bot-Management-Regeln – und nicht allein die robots.txt – den Zugriff steuern. Viele prominente AI-Crawler wie GPTBot, ClaudeBot oder PerplexityBot führen kein JavaScript aus, während Googlebot und Applebot Inhalte rendern. Einige bekannte Plattformen liefern zudem nahezu leere HTML-Seiten an AI-Crawler aus. Fünf Websites blockierten die Basisabfragen vollständig, was die Komplexität der Messung verdeutlicht. Das Tool und ein öffentlicher Scanner wurden veröffentlicht, um Betreibern die Prüfung ihrer Domain-Sichtbarkeit zu erleichtern.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Das Audit verdeutlicht die operativen Hürden durch WAF-, Bot-Management- und Server-Rendering-Konfigurationen für die AI-Sichtbarkeit von Web-Inhalten. Dies ist für Publisher und SEO/GEO-Verantwortliche zur präzisen Steuerung von LLM-Zugriffen hochrelevant.

SIGNAL RADAR

Marktsignale zu The Guardian in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • Der Autor veröffentlichte das Open-Source-Tool geo-crawl-audit, welches Websites mit User-Agents großer AI-Crawler testet und die Wortanzahl im rohen HTML misst.
  • Der Testlauf vom 7. August 2026 an 18 großen Websites lieferte eine Status-Matrix pro Crawler sowie Laufzeitdaten.
  • Zahlreiche AI-Crawler (u. a. GPTBot, ClaudeBot, PerplexityBot) führen kein JavaScript aus; nur wenige wie Googlebot und Applebot rendern JS.
  • Beobachtete HTTP-Statusmuster korrelierten oft mit bekannten Geschäftsbeziehungen, während einige Sites spezifische Crawler blockierten oder durchließen.
  • Fünf Websites (darunter Quora, OpenAI, Perplexity, Bloomberg und GitHub) blockierten oder filterten die Basisabfragen des Tools.

Verknüpfte Unternehmen

18 verknüpfte Unternehmen

“The Guardian — which has a content deal with OpenAI — serves my simulated GPTBot, OAI-SearchBot, and ChatGPT-User a clean 200....”

“The Guardian — which has a content deal with OpenAI — serves my simulated GPTBot, OAI-SearchBot, and ChatGPT-User a clean 200....”

“The New York Times — in litigation with OpenAI — 403s nearly everyone: GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Common Crawl, meta-e...”

“Reddit's robots.txt blocks every AI bot in my list — fourteen tokens, no exceptions....”

“Figma runs the inverse configuration: serves a 200 to every bot UA in the list, but robots-disallows GPTBot, OAI-SearchBot, ChatGPT-User, Cl...”

“Airbnb returns 403 to nine of the twelve AI user-agents I probe — every OpenAI, Perplexity, Microsoft, Amazon, Meta, and Common Crawl token ...”

“Airbnb returns 403 to nine of the twelve AI user-agents I probe ... while, curiously, all three Anthropic user-agents get a 200....”

“LinkedIn served my probe a 23-word bot-check interstitial — whatever a verified crawler negotiates, the raw HTML a stranger gets is effectiv...”

“Quora, OpenAI, Perplexity, Bloomberg, and GitHub challenged even my baseline browser request from my network....”

“Stripe (1,957 raw-HTML words, a 200 to every UA in my list) ... — full server-rendered HTML, fast, no bot differentials against my probe....”

“OAI-SearchBot, Claude-SearchBot, PerplexityBot, Amazonbot, and meta-externalagent all received a 200 from the same IP, seconds apart....”

“OAI-SearchBot, Claude-SearchBot, PerplexityBot, Amazonbot, and meta-externalagent all received a 200 from the same IP, seconds apart....”

“Stripe (1,957 raw-HTML words, a 200 to every UA in my list), Anthropic (fastest warm response in the test at 0.102s), Vercel, MDN, Shopify —...”

“Stripe (1,957 raw-HTML words, a 200 to every UA in my list), Anthropic (fastest warm response in the test at 0.102s), Vercel, MDN, Shopify —...”

“Quora, OpenAI, Perplexity, Bloomberg, and GitHub challenged even my baseline browser request from my network....”

Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: DEV Community•Veröffentlicht: 8. Aug. 2026
Ursprünglicher Berichttitel: “Your firewall is your AI policy — I probed 18 major sites to read it”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Privacy16. Juli 2026

Study: Nearly Half of Top German Sites Block AI Crawlers

A Hotwire study titled "The AI Coverage Gap" found that 48% of the 100 highest-reach German online media are not or only partially accessible to AI crawlers. The research evaluated access by ten AI crawlers (from providers such as OpenAI, Anthropic and Perplexity) to the domains of those top-100 publishers in June 2026. Major publishers (e.g., Bild, Der Spiegel, stern, Focus Online) largely block crawlers, while national newspapers like Frankfurter Allgemeine, Süddeutsche Zeitung and Die Zeit generally allow access. The study highlights strategic dilemmas for publishers and communications teams about visibility in LLM-generated answers, commercial implications for traffic and subscriptions, and technical mitigation options (robots.txt, CDN/server rules, paywalls). Hotwire recommends companies consider AI accessibility when selecting target media and measure AI visibility as part of communications KPIs.

Signal analysieren
SEO, GEO & SEM Platform10. Juli 2026

Let AI Crawlers In: AEO Not SEO in 2026

The article argues that 'AEO' (Answer Engine Optimization) is a distinct discipline from classic SEO and that publishers who want to be cited by AI assistants should allow AI crawlers to index their pages. It explains that AI crawlers are vendor- and task-specific (training, search-indexing, live fetch) and lists explicit user-agent names for OpenAI, Anthropic, Perplexity and Google. The piece reminds readers that robots.txt (RFC 9309, 2022) is a voluntary request, not an enforcement mechanism, and that hard blocks require server/CDN/WAF rules. Recommended practical steps include per-bot robots.txt entries, server-rendered HTML, structured data (schema.org), adopting the emerging llms.txt convention, and ensuring CDN bot‑management aligns with robots.txt.

Signal analysieren
SEO, GEO & SEM Platform15. Juni 2026

API-Tool prüft Website-Sichtbarkeit in KI-Suchmaschinen per Einmal-Aufruf

Ein Entwickler hat ein kompaktes Audit-Tool und Web-Interface veröffentlicht, mit dem Publisher und Website-Betreiber bewerten können, ob ihre Inhalte von KI-Suchassistenten wie ChatGPT Search, Perplexity oder Google AI Overviews gecrawlt, geparst und zitiert werden können. Die Analyse prüft unter anderem den robots.txt-Zugriff für spezifische KI-Crawler wie GPTBot, OAI-SearchBot, PerplexityBot und ClaudeBot, das Vorhandensein von llms.txt, JSON-LD-Strukturdaten sowie die Passage-Zitierbarkeit. Das Ergebnis ist ein Score von 0 bis 100 mit detaillierten Kategoriewertungen und konkreten Handlungsempfehlungen. Die API ist schlüssellos per POST-Request unter https://citeready-api.sprytools.com/v1/audit ansprechbar, während die Web-Oberfläche unter citeready.sprytools.com ein kostenloses Kontingent von drei Audits pro Tag ohne Registrierung bereitstellt. Damit erhalten SEO- und GEO-Workflows ein pragmatisches Instrument zur Optimierung der eigenen KI-Sichtbarkeit.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.