Beobachtetes Signal · 19. Aug. 2026 · Technical Release · Quelle: DEV Community · Relevanz: 3/5 · Sentiment: Positiv
Open-Source-Sicherheitsarchitektur schützt autonome KI-Agenten vor Prompt-Injection-Angriffen
Ein neues Open-Source-Framework bietet ein vierstufiges Defense-in-Depth-Sicherheitsmodell, um autonome KI-Agenten und LLM-Deployments vor Prompt Injections, Tool-Poisoning und unkontrollierter Fugitivität zu schützen. Die Architektur gliedert Schutzmechanismen in vier Schichten: 1. Input-Sanitization für Text- und Bilddaten, 2. Gateway- und Sandboxing-Kontrollen mit strikter Richtliniendurchsetzung, 3. Runtime-Monitoring bei jedem Tool-Aufruf sowie 4. Supply-Chain-Schutz für MCP-Server und Datenquellen. Das System integriert spezialisierte Module wie hermes-shield, ai-guard-gateway, agent-shield-runtime und mcp-schema-sentinel sowie Post-hoc-Validierungen via Conformal Prediction. Die gesamte Codebasis ist für CPU-basierte lokale Deployments optimiert und unter permissiven Lizenzen auf GitHub verfügbar. Sie adressiert damit zentrale Schwachstellen beim produktiven Einsatz agentischer KI-Workflows.
Das quelloffene Framework adressiert kritische Angriffsvektoren wie Prompt Injection und Tool-Poisoning direkt und bietet Unternehmen eine praxisnahe Sicherheitsarchitektur für den produktiven Rollout autonomer KI-Agenten.
Marktsignale zu GitHub in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Das Framework definiert eine vierstufige Defense-in-Depth-Architektur gegen Prompt Injections, Tool-Poisoning und unkontrolliertes Agentenverhalten.
- Schicht 1 (Ingress) nutzt Module wie hermes-shield, vision-injection-guard und corpus-scrub zur Input-Bereinigung und PII-Redaktion.
- Schicht 2 (Gateway & Sandbox) umfasst ai-guard-gateway, seblight (Sovereign Execution Broker) und einen Misdirection Proxy zur Validierung externer Aufrufe.
- Schicht 3 (Runtime-Sensoren) überwacht Tool-Aufrufe über agent-shield-runtime mittels Sensoren wie scope-lib, adi-shield, wallet-guard und trajectory-sentinel.
- Schicht 4 (MCP & Supply Chain) erkennt mit mcp-schema-sentinel und skill-auditor Tool-Schema-Manipulationen; der Code ist via GitHub (amurlaniakea) verfügbar.
Verknüpfte Unternehmen
1 verknüpfte Unternehmen“👉 Revisa la arquitectura completa en: https://github.com/amurlaniakea...”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Agent Security: Schutz vor Prompt Injection, Tool-Missbrauch und Datenlecks
Dieser Fachartikel analysiert die erweiterte Angriffsfläche agentischer LLM-Architekturen und definiert praxisnahe Schutzmechanismen gegen Prompt Injection, Tool-Parameter-Injection sowie unbefugten Datenabfluss. Im direkten Vergleich zwischen ungesicherten und gehärteten Agenten wird gezeigt, wie strikt rollenbasierte System-Prompts die Systemintegrität wahren. Für Tool-Schnittstellen – demonstriert anhand eines Rechners – werden zeichenbasierte Allowlists und isolierte Sandboxed Evals vorgestellt, um Code-Injections effektiv zu unterbinden. Als Kernarchitektur empfiehlt der Beitrag eine dreistufige Defense-in-Depth-Pipeline: Input-Validierung, eine gehärtete Agentenebene mit Role Locking und automatisierte Output-Filterung via Regex-Redacting. Ergänzt durch Codebeispiele und eine Design-Checkliste für Entwickler verweist der Leitfaden auf die OWASP Top 10 for LLM Applications sowie LangGraph-Implementierungen, um robuste agentische Workflows produktionsreif abzusichern.
Leitfaden zur Abwehr von Prompt Injections in Agentic-AI-Systemen
Dieser technische Leitfaden analysiert Prompt Injection als fundamentale architektonische Sicherheitsherausforderung für Large Language Models (LLMs) und KI-Agenten. Da Steuerungs- und Datenkanäle nicht strikt getrennt sind, lässt sich das Risiko prinzipbedingt schwer vollständig eliminieren. Der Bericht kategorisiert vier zentrale Angriffsmuster: Rollenspiele/emotionale Manipulation, Multi-Turn-Induktion, Instruction Splitting sowie Cross-Language Escapes. Zudem werden reale Sicherheitsvorfälle dokumentiert – darunter EchoLeak (CVE-2025-32711) bei Microsoft 365 Copilot und das unbefugte Löschen einer Replit-AI-Produktionsdatenbank. Basierend auf operativer Praxiserfahrung stellt der Autor ein fünfstufiges Verteidigungskonzept vor. Dazu gehören die Bereinigung externer Instruktionen, die strikte Einstufung von Websuchen und MCP-Ergebnissen als potenziell feindlicher Input sowie die Minimierung von Auto-Approve-Berechtigungen. Ziel ist die effektive Risikominimierung durch eine signifikante Erhöhung der Angriffskosten.
Google ADK: Fünf Sicherheitsebenen schützen KI-Agenten vor Prompt-Injection
Ein aktueller Fachbeitrag beleuchtet die Sicherheitsarchitektur des Google Agent Development Kit (ADK), die gezielt KI-Agenten vor indirekter Prompt-Injection – einem der kritischsten OWASP-Risiken für Large Language Models – abschirmt. Das ADK-Framework definiert hierfür fünf zentrale Verteidigungsebenen: Identitäts- und Autorisierungsmanagement, Ein- und Ausgabeschutz, sandkastenbasierte Codeausführung, Evaluierung und Tracing sowie Netzwerkkontrollen. Ein besonderer Schwerpunkt liegt auf Runner-basierten Plugins, die globale Callbacks für Agenten, Tools und LLM-Aufrufe ermöglichen. Insbesondere der after_tool_callback-Hook erlaubt es, manipulierte Werkzeugantworten frühzeitig abzufangen und zu bereinigen, bevor der Agent darauf reagiert. Die ADK-SDKs stehen für Python, TypeScript, Go, Java und Kotlin zur Verfügung, während umfassende Dokumentationen und Codebeispiele auf adk.dev bereitstehen.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
