Beobachtetes Signal · 24. Juli 2026 · Technical Release · Quelle: Meedia · Relevanz: 2/5 · Sentiment: Neutral
Havas-Benchmark zeigt Schwächen von LLMs in der Mediaplanung
Die Havas AI Media Quality Index (HAI-Q) Studie von Havas Media Germany offenbart erhebliche Leistungsschwächen gängiger Large Language Models bei konkreten Aufgaben der Mediaplanung. Anhand von 35 marktspezifischen Testfragen zeigte sich, dass universelle KI-Modelle zwar oft überzeugend klingen, jedoch bei datengestützten Entscheidungen und numerischen Berechnungen unzuverlässig agieren. Während Havas' intern entwickelte Agentic Media Machine 33 von 35 Aufgaben (94,3 %) korrekt löste, schnitten Drittanbieter-Modelle deutlich schlechter ab (GPT-5 mit 16/35; Claude Sonnet 4.5 mit 6/35; GPT-4o mit 4/35). Havas wertet die Ergebnisse nicht als Absage an KI, sondern plädiert für spezialisierte Systeme, proprietäre Daten und tiefe Domänenexpertise. Das Unternehmen plant, den Benchmark fortzuführen und international auszurollen, um die Qualitätsstandards in der automatisierten Mediaplanung branchenweit voranzutreiben.
Der agenturveröffentlichte Benchmark verdeutlicht die Grenzen universeller LLMs bei konkreten Aufgaben der Mediaplanung und unterstreicht die wachsende Nachfrage nach spezialisierten KI-Systemen in der Werbe- und MarTech-Branche.
Marktsignale zu MEEDIA in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Havas Media Germany hat den Havas AI Media Quality Index (HAI-Q) als Benchmark für KI in der Mediaplanung entwickelt.
- HAI-Q nutzte ein Testset aus 35 auf den deutschen Markt zugeschnittenen Aufgaben zur Evaluierung der Planungsleistung.
- Havas' Agentic Media Machine erreichte im HAI-Q 33 von 35 Punkten (94,3 %).
- GPT-5 erzielte 16/35 (45,7 %), Claude Sonnet 4.5 erreichte 6/35 (17,1 %) und GPT-4o kam auf 4/35 (11,4 %).
- Allgemeine LLMs beantworten typische Mediaplanungsfragen oft nur zur Hälfte richtig und zeigen Schwächen bei Datenentscheidungen und Berechnungen.
Verknüpfte Unternehmen
10 verknüpfte Unternehmen“The article was published on MEEDIA and references prior MEEDIA reporting about AI in media planning....”
“Google appears in the cookie/statistics section as the creator of analytics cookies (_ga) used on the site....”
“LinkedIn appears in the cookie/marketing table (e.g., cookie 'bcookie' listed with LinkedIn as creator)....”
“DataReporter GmbH is listed in the cookie table as the creator of consent-related cookies (e.g., _webcare_consentid)....”
“CloudFlare is listed in the cookie table as the creator of the '__cf_bm' cookie....”
“WordPress is listed in the cookie table (e.g., 'wordpress_test_cookie') as a creator of session cookies for site functionality....”
“YouTube is listed as the creator of an embedded-content consent cookie ('susc_social_embed_consent')....”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
KI erkennt keine KI-Ads, kann aber menschliche Kreativität bewerten
Andrew Tindall von System1 untersucht, ob Künstliche Intelligenz menschliche Werbung effektiv bewerten kann, während Verbraucher KI-Ads kaum identifizieren. Er stützt sich auf vier Studien, darunter die NYU-Stern-Untersuchung zum „AI Advertising Paradox“, wonach undisclosed KI-Ads menschliche Werbung um bis zu 19 Prozent übertrafen, bei Offenlegung jedoch um 31,5 Prozent einbrachen. Eine Taboola-Studie mit über 500 Millionen Impressions bestätigte dies für kurzfristige Metriken wie die CTR. In einem eigenen Test ließ Tindall zehn bekannte menschliche Werbespots von System1 analysieren. Die KI prognostizierte das Fluency Rating zehnmal und das Star Rating neunmal korrekt. Sie brillierte bei Extremwerten, zeigte Schwächen im Mittelfeld und betonte die Notwendigkeit von Unsicherheitsanalysen. Tindall folgert, dass KI als probabilistische Vorhersagemaschine menschliches Urteilsvermögen im Creative Testing ergänzen, aber nicht ersetzen sollte.
Werbetreibende forcieren Messung der Markenpräsenz in generativer KI
Marketer richten ihre Werbestrategien verstärkt darauf aus, wie KI-Chatbots und Large Language Models (LLMs) ihre Marken in Antworten zitieren. Das Interactive Advertising Bureau (IAB) entwickelt derzeit ein Framework, um die Messung dieser KI-Sichtbarkeit zu standardisieren. Daten belegen, dass die Zitationsanteile je nach Plattform – wie Microsoft Copilot, ChatGPT oder Google Gemini – stark variieren und LLMs unterschiedliche Quellentypen bevorzugen. Gleichzeitig wächst das Vertrauen in KI-gestützte Suchen: 95 % der US-Nutzer stufen KI-Antworten als ebenso vertrauenswürdig ein wie traditionelle Suchmaschinen. Die größte Herausforderung bleibt jedoch die Messbarkeit, da KI-Modelle nicht-deterministisch agieren. Infolgedessen entstehen neue Positionen wie der 'Head of AI Search', während Werbebudgets gezielt umverteilt werden, um KI-Empfehlungen direkt zu beeinflussen.
KI im Mediaeinkauf: Hohe Erwartungen übertreffen die reale Implementierung
Laut einer aktuellen Studie des IAB Europe erwarten 58 % der Branchenexperten, dass agentischer Mediaeinkauf innerhalb eines Jahres zum Standard wird, doch die reale Adaption hinkt hinterher. Von 47 Befragten setzen 36 bisher keine agentischen Systeme ein oder nutzen Modelle, bei denen Planung und Ausführung weiterhin menschlich gesteuert werden. Der „Impact of AI on Digital Advertising Report 2026“ zeigt, dass KI zwar breit für Reporting und Kampagnenanalysen genutzt wird (insgesamt 86 %), aber nur 11 von 29 detailliert befragten Akteuren sie für das agentische Buying und Selling einsetzen. Eine ergänzende Umfrage von StackAdapt unter 500 Marketing-Experten bestätigt diesen Trend: Fragmentierte Daten-Pipelines gelten als zentrale Hürde. Die Branche agiert vorsichtig und bevorzugt Human-in-the-Loop-Ansätze, während die Zufriedenheit mit der operativen KI-Performance bei lediglich 2,76 von 5 Punkten liegt. Vor einer vollständigen Skalierung müssen Governance-, Integrations- und Schulungsprozesse etabliert werden.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
