Beobachtetes Signal · 2. Juni 2026 · Technical Release · Quelle: techcrunch · Relevanz: 4/5 · Sentiment: Positiv
Microsoft veröffentlicht ASSERT für KI-Verhaltenstests
Microsoft hat ASSERT (Adaptive Spec-driven Scoring for Evaluation and Regression Testing) vorgestellt, ein Open-Source-Framework, das natürlichsprachliche Beschreibungen gewünschter Verhaltensweisen und Richtlinien in strukturierte, bewertete Tests für anwendungsspezifische KI-Evaluierungen umwandelt. Das Framework generiert Spezifikationen für akzeptables und inakzeptables Verhalten, erstellt Testszenarien, führt diese gegen Zielsysteme aus und protokolliert Ausführungspfade einschließlich Zwischendefinitionen und Tool-Aufrufen zur Analyse. Entwickler können Systemkontexte, Tools und Einschränkungen definieren, um Evaluationen individuell anzupassen. Microsoft positioniert das Framework als Schließung einer Lücke, die durch breitere Benchmarks wie Stanford HELM oder MLCommons AILuminate entsteht, und empfiehlt den Einsatz in der Entwicklung, nach dem Deployment sowie für das kontinuierliche Monitoring von KI-Systemen.
Die Bereitstellung eines Open-Source-Frameworks zur anwendungsspezifischen KI-Verhaltenstestung durch Microsoft verändert die Validierungs- und Governance-Praktiken von Unternehmen grundlegend, was Vertrauen, Compliance und operative Sicherheit beim Deployment von KI-Systemen erhöht.
Marktsignale zu Microsoft in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Microsoft hat ASSERT (Adaptive Spec-driven Scoring for Evaluation and Regression Testing) als Open-Source-Framework veröffentlicht.
- ASSERT transformiert Klartextbeschreibungen des erwarteten KI-Verhaltens in strukturierte Sets akzeptabler und inakzeptabler Verhaltensweisen und generiert Testfälle.
- Das Framework führt Tests gegen Zielsysteme aus, bewertet Ergebnisse und zeichnet Ausführungspfade sowie Tool-Aufrufe für das Debugging auf.
- ASSERT ist auf GitHub verfügbar und für den Einsatz in der Entwicklung, bei Post-Deployment-Prüfungen sowie für das kontinuierliche Monitoring konzipiert.
Verknüpfte Unternehmen
2 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Microsoft veröffentlicht Agent Control Specification zur Steuerung von KI-Agenten
Microsoft hat mit der Agent Control Specification (ACS) einen Open-Source-Standard vorgestellt, der Entwicklern, Sicherheits- und Compliance-Teams eine konsistente sowie granulare Steuerung von KI-Agenten ermöglicht. Über deklarative Richtliniendateien definiert ACS erlaubte und untersagte Aktionen, Bedingungen für menschliche Freigaben sowie Protokollanforderungen. Die Richtlinien greifen an zentralen Interzeptionspunkten im Agenten-Workflow, darunter vor Eingaben und Tool-Aufrufen, nach Tool-Antworten sowie vor der finalen Ausgabe. Der Standard unterstützt Klassifizierer, LLM-basierte Policy-Judges und Tool-Call-Logik. ACS wird als SDK mit Plug-ins für führende Frameworks wie LangChain, OpenAI Agents SDK, Anthropic Agents SDK, AutoGen, CrewAI, Semantic Kernel, Microsoft.Extensions.AI und MCP-Tools ausgeliefert. Durch die Portabilität der Richtliniendateien bleibt die Governance bei Framework-Wechseln und Umgebungsänderungen durchgehend gewährleistet, was insbesondere für den Einsatz agentischer Workflows im Enterprise-Umfeld von Relevanz ist.
Microsoft veröffentlicht neuen KI-Kodex zur Beschränkung von Cyberangriffen und Täuschung
Microsoft hat einen neuen KI-Verhaltenskodex veröffentlicht, der sich auf Sicherheits- und Ausrichtungsprinzipien für seine KI-Modelle konzentriert. Das Dokument definiert grundlegende Werte und rote Linien für das Modelltraining, einschließlich absoluter Beschränkungen für Cyberangriffe, Nuklearwaffen und die Produktion von Deepfakes. Zudem wird betont, dass KI-Modelle den Menschen unterstützen statt ersetzen müssen und keine trägen oder selbstreplizierenden Mechanismen zur Umgehung menschlicher Aufsicht einsetzen dürfen. Die Veröffentlichung erfolgt vor dem Hintergrund wachsender Sicherheitsbedenken und branchenweiter Diskussionen über das Tempo der technologischen Entwicklung an der technologischen Front. Microsoft-CEO Satya Nadella unterstützte dabei Konzepte wie integrierte Evaluatoren zur Sicherstellung der Modellausrichtung. Diese Richtlinie markiert einen wichtigen Schritt zur Regulierung generativer KI-Technologien und betrifft indirekt auch datengetriebene Ökosysteme im Bereich Advertising und MarTech, wo KI-Automatisierung zunehmend zum Standard wird.
Most Developers Test Code — Why Not Test AI?
The article argues that AI features need the same rigorous testing workflows as traditional software. Developers commonly rely on informal manual checks for AI outputs (e.g., "I tried it three times and it seems pretty good"), but AI components (retrieval, prompts, LLMs, validation) can fail in many ways and are probabilistic. The author recommends building small evaluation datasets (20–50 representative test cases), testing prompts, context, and end-to-end workflows, and integrating evaluation into CI/GitHub workflows to measure whether changes (prompts, models, retrieval) actually improve performance. The piece presents a three-layer evaluation rule—produce an answer, produce correct answers consistently, and be able to measure improvement—and calls for treating evaluation as a first-class engineering concern.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
