Beobachtetes Signal · 4. Feb. 2025 · Technical Release · Quelle: Trending Topics · Relevanz: 3/5 · Sentiment: Positiv
Anthropic stellt Constitutional Classifiers zur Abwehr von KI-Jailbreaks vor
Anthropic hat mit den sogenannten Constitutional Classifiers einen neuen Sicherheitsmechanismus eingeführt, der gefährliche Ausgaben und Jailbreaks in Sprachmodellen verhindern soll. Das zweistufige Filtersystem überprüft sowohl Nutzereingaben als auch Modelleingaben anhand definierter Regeln. In Tests mit über 10.000 synthetischen Jailbreak-Versuchen blockierte das System mehr als 95 Prozent der Angriffe, verglichen mit 14 Prozent ohne den zusätzlichen Schutz. Die Ablehnungsrate für legitime Anfragen stieg dabei nur minimal um 0,38 Prozent, während der Rechenaufwand um rund 24 Prozent zunahm. Ergänzend führte das Unternehmen Red-Teaming-Tests im Rahmen eines Bug-Bounty-Programms durch, bei denen in über 3.000 Teststunden kein universeller Jailbreak gefunden wurde. Ähnliche Schutzmechanismen wie Prompt Shields und Prompt Guard werden derzeit auch von Microsoft und Meta entwickelt. Anthropic warnt jedoch, dass die Technologie keine vollständige Alllösung darstellt, und empfiehlt einen mehrschichtigen Sicherheitsansatz. Derzeit wird das System in einer Demoversion getestet, bevor der produktive Einsatz erfolgt.
Anthropics Constitutional Classifiers verbessern die Sicherheit von Sprachmodellen und die Jailbreak-Prävention erheblich, was den verlässlichen Einsatz von KI in Geschäfts- und Werbeanwendungen unterstützt, auch wenn es sich dabei nicht um eine direkte Branchenverschiebung im Bereich AdTech handelt.
Marktsignale zu Anthropic in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Anthropic hat Constitutional Classifiers als zweistufiges Filtersystem zur Blockierung gefährlicher KI-Ausgaben und Jailbreaks eingeführt.
- In Tests mit 10.000 synthetischen Jailbreak-Versuchen wurden über 95 Prozent der Angriffe blockiert, verglichen mit 14 Prozent beim Basismodell.
- Die Ablehnungsrate für legitime Anfragen stieg durch die neuen Filter lediglich um 0,38 Prozent.
- Der zusätzliche Rechenaufwand für das Filtersystem erhöhte sich um etwa 24 Prozent.
- Mit Prompt Shields und Prompt Guard entwickeln Microsoft und Meta vergleichbare Schutzmechanismen.
Verknüpfte Unternehmen
3 verknüpfte Unternehmen“Das AI-Startup Anthropic hat eine neue Methode vorgestellt, um unerwünschte und potenziell gefährliche Ausgaben von Sprachmodellen zu verhin...”
“Auch Microsoft (“Prompt Shields”) und Meta (“Prompt Guard”) arbeiten an ähnlichen Schutzmechanismen....”
“Auch Microsoft (“Prompt Shields”) und Meta (“Prompt Guard”) arbeiten an ähnlichen Schutzmechanismen....”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
AWNY & Jupiter Fest: Agentic Ads und Open Web im Fokus
Die Advertising Week New York und das erste Jupiter Festival Miami zeigten die Branchenentwicklung hin zu agentischer Werbung und die Besorgnis über die Zukunft des Open Web. Zu den wichtigsten Ankündigungen gehörten Tiktoks Off-Platform-Werbeexpansion und ein neuer KI-Einkaufsagent, Metas Test eines KI-Kampagnenassistenten und die Einführung visueller Anzeigen durch OpenAI. Die Übernahme von Warner Bros. Discovery durch Paramount im Wert von 110 Milliarden Dollar wurde abgeschlossen und bildet nun Skydance. Zentrale Themen waren die Bedrohung des Publisher-Traffics durch KI, der Aufstieg von KI-Sichtbarkeitstools, das frühe Stadium des agentischen Medienkaufens, ungelöste Cross-Platform-Messung und der boomende Sport- und Retail-Media-Sektor. Zu den Deals gehörten PubXs Übernahme von Compliant und eine 5-Millionen-Dollar-Series-A sowie OpenAIs gemeldete 30-Milliarden-Dollar-Runde mit BlackRock und Investoren aus den VAE.
ICANN erhält 1.615 Anträge für neue Top-Level-Domains
Die Internet Corporation for Assigned Names and Numbers (ICANN) hat erstmals seit 2012 wieder Anträge für neue generische Top-Level-Domains (gTLDs) angenommen. Insgesamt wurden 1.615 Anträge von 481 Antragstellern eingereicht, mit einem starken Fokus auf KI-bezogene Domains. Zehn Unternehmen, darunter Meta und OpenAI, bewarben sich um .agent, sieben um .agi und sechs um .asi. Meta reichte 21 Anträge ein, darunter .instagram und .threads, während OpenAI 15 Anträge stellte, darunter .chatgpt und .codex. Auch deutsche Unternehmen wie Adidas, Biontech und Allianz bewarben sich um markenbezogene Domains. Die Antragsgebühr kann bis zu 227.000 US-Dollar pro Domain betragen. Der Artikel hebt auch den finanziellen Erfolg von Ländercode-Domains wie .ai hervor, die Anguilla bis November 2025 rund 59 Millionen Euro einbrachte.
Nvidia RTX Spark Notebooks starten ab 3.300 Euro
Microsoft, Asus, Dell, HP, Lenovo und MSI haben Windows-Notebooks mit Nvidias neuem RTX-Spark-ARM-Chip (N1X) angekündigt. Die Geräte sind ab sofort vorbestellbar, die Auslieferung startet am 16. Oktober. Der RTX Spark ist eng mit dem GB10-Prozessor im DGX Spark verwandt, gibt es jedoch in zwei Varianten mit unterschiedlichen CPU- und GPU-Kernzahlen. Die Preise reichen von 2.900 Euro für das Basis-Modell des Microsoft Surface Laptop Ultra bis zu 6.700 Euro für das Top-Modell des Asus ProArt 16. Die Notebooks sind für KI-Workloads positioniert und markieren den ersten Einsatz des schnellen KI-Chips in Windows-Geräten. Nvidia plant außerdem, Windows auf seinen stationären DGX-Spark-Systemen anzubieten.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
