Beobachtetes Signal · 7. Mai 2026 · Technical Release · Quelle: DEV Community · Relevanz: 3/5 · Sentiment: Positiv
IBM Granite Guardian: LLM-Sicherheits- und Evaluierungsmodelle für Unternehmen
Der Artikel stellt Granite Guardian vor, eine neue Modellfamilie von IBM, die als Schutz- und Evaluierungsschicht für LLM-basierte Systeme dient. Die Modelle basieren auf feinabgestimmten Granite-Sprachmodellen und wurden mit menschlich annotierten sowie synthetischen Red-Teaming-Daten trainiert. Sie sind darauf ausgelegt, Risiken wie Jailbreak-Versuche, Obszönitäten und Halluzinationen in Retrieval-Augmented Generation (RAG) sowie Tool-Calling-Workflows zu erkennen. Zudem unterstützen sie benutzerdefinierte, sprachbasierte Regeln (Bring Your Own Criteria, BYOC) und bieten Hybridmodi: eine latenzarme <no-think>-Entscheidung sowie detaillierte <think>-Begründungspfade für Audits. Die Veröffentlichung umfasst Links zu GitHub und Hugging Face und zielt auf Use Cases wie Groundedness-Prüfungen, Funktionshalluzinationserkennung und verbesserte Modell-Observability für den sicheren Enterprise-Einsatz von Generative AI.
Das Framework bietet offene, auf Unternehmen ausgerichtete Sicherheits- und Observability-Modelle für LLM-Deployments, welche die Zuverlässigkeit und Governance beim Einsatz von Generative AI maßgeblich verbessern können.
Marktsignale zu IBM in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- IBM hat die Modellfamilie Granite Guardian zur Bewertung von LLM-Prompts und -Antworten veröffentlicht.
- Die Modelle integrieren vordefinierte Kriterien zur Erkennung von Jailbreaks, Obszönitäten und Halluzinationen in RAG- und Tool-Calling-Workflows.
- Sie unterstützen BYOC (Bring Your Own Criteria), womit Benutzer eigene natürlichsprachliche Evaluierungsregeln definieren können.
- Es werden Hybridmodi angeboten: <no-think> für latenzarme Ja/Nein-Entscheidungen und <think> für detaillierte Audit-Nachvollziehbarkeit.
- Das Training basiert auf feingetunten Granite-Modellen mit Red-Teaming-Daten; Code und Modelle sind auf GitHub und Hugging Face verfügbar.
Verknüpfte Unternehmen
1 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Deterministische Guardrails als essenzieller Sicherheitslayer für autonome KI-Agenten
LLM-gestützte Agenten mit Zugriff auf reale Tools bergen erhebliche Risiken, darunter halluzinierte Package-Installationen, Prompt Injections, unsichere Code-Commits oder irreversible Transaktionen. Ein zweites LLM als Kontrollinstanz (LLM-as-a-Judge) reicht oft nicht aus, da es anfällig für Manipulationen ist sowie Latenz und Kosten erhöht. Die Lösung liegt in deterministischen Guardrails: regel- und datenbasierte Prüfungen, die stabile JSON-Urteile (allow, review, block) liefern. Anhand von kostenfreien Guard-APIs (z. B. für Packages, Content, Code und Payments) auf Basis öffentlicher Datenquellen wie OSV.dev, OFAC-Listen, HaveIBeenPwned und DNS wird die Funktionsweise demonstriert. Diese Sicherheitsprüfungen stehen zudem als Model Context Protocol (MCP) Server bereit, sodass MCP-fähige Agenten sie direkt als Tools integrieren können. Empfohlen wird ein Muster, bei dem Guardrails obligatorische Vorstufen bilden, Blocks als harter Stopp wirken und Reviews einen Human-in-the-Loop-Prozess auslösen.
Open-Source-Echtzeit-Guardrail gegen LLM-Halluzinationen veröffentlicht
Ein Entwickler hat mit Director-Class AI (director-ai) eine Open-Source-Python-Bibliothek veröffentlicht, die Streaming-LLM-Token überwacht und die Generierung bei erkannten Halluzinationen abbricht. Das Tool kombiniert NLI-Scoring (DeBERTa/FactCG) mit optionalem RAG-Grounding, um Aussagen gegen Quelldokumente zu prüfen. Es bietet Zwei-Zeilen-Integrationen für OpenAI- und Anthropic-Clients sowie Anbindungen an Frameworks wie LangChain und LlamaIndex. Benchmarks belegen eine ausgewogene Genauigkeit von 75,8 % bei FactCG und eine hybride End-to-End-Erkennungsrate von 90,7 %, während die GPU-Latenzen je nach Hardware zwischen 14,6 ms und 0,5 ms pro Paar variieren. Das Repository umfasst umfassende Tests, Provenance-Artefakte und eine AGPL-3.0-Lizenz mit Optionen für kommerzielle Nutzung. Der Autor benennt zudem transparente Einschränkungen bezüglich Wissensbasen, ONNX-CPU und VRAM-Bedarf und sucht den Austausch mit Praktikern im Bereich LLM-Reliability und RAG-Pipelines.
Absicherung von LLM-gestützter Softwareentwicklung bei Guardsquare
Ein neuer Blogbeitrag von Guardsquare beleuchtet den strategischen Ansatz des Unternehmens beim Einsatz von Large Language Models in der Softwareentwicklung. Als auf Cybersecurity spezialisiertes Unternehmen legt Guardsquare besonderen Wert auf strenge Sicherheitsvorkehrungen, um den Schutz sensiblen geistigen Eigentums und proprietärer Quellcodes während des gesamten Entwicklungsprozesses zu gewährleisten. Der Beitrag analysiert potenzielle Risiken bei der Integration von KI-Werkzeugen und zeigt Best Practices auf, wie Entwicklerteams generative Technologien produktiv und gleichzeitig sicher einsetzen können, ohne Kompromisse bei der Datensicherheit oder der Integrität der geschützten IP einzugehen.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
