Beobachtetes Signal · 23. Mai 2026 · Technical Release · Quelle: DEV Community · Relevanz: 3/5 · Sentiment: Positiv
Ejentum Harness erzwingt Verifizierung bei KI-Agenten
Der Artikel beschreibt die Harness-Bibliothek von Ejentum – ein Set aus agentenbasierten Tools und Gerüsten, die die Verifizierung erzwingen und Täuschung beim Reasoning von KI-Agenten minimieren. Zu den Hauptkomponenten gehören ein Integritätsverfahren (Anti-Täuschungs-Checkliste), ein Erkennungstopologie-Graph, Praxisbeispiele sowie ein freier Fehler-Exit zur Entwurfsnachbesserung. Ejentum stellt vier Agenten-Tools (harness_reasoning, harness_code, harness_anti_deception, harness_memory), einen Laufzeit-MCP-Server unter api.ejentum.com/mcp sowie frameworknative Pakete auf PyPI und npm bereit. Integrationen und Client-Beispiele werden unter anderem für CrewAI, Vercel AI SDK, Agno, PydanticAI, smolagents, Mastra, LangGraph.js und Genkit gezeigt. Die Bibliothek umfasst 679 Operationen gegen benannte Fehler-Modi und wird mit öffentlichen Benchmarks sowie GitHub-Repositories für den MCP-Server und die Benchmark-Suite ausgeliefert.
Ein technisches Release von Sicherheits- und Verifizierungstools für Agenten, das die Entwicklung und Auditierung von KI-Agenten verändern kann. Es integriert sich in gängige Agenten-Frameworks und bietet öffentliche Benchmarks, stellt jedoch keine Plattformrichtlinie oder branchenweite Norm dar.
Marktsignale zu CrewAI in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Ejentum stellt vier Agenten-Tools bereit: harness_reasoning, harness_code, harness_anti_deception und harness_memory.
- Die Ejentum-Harness-Bibliothek enthält 679 Operationen, organisiert nach der jeweiligen Fehlerangriffsfläche.
- Ejentum betreibt einen verwalteten MCP-Server unter api.ejentum.com/mcp und veröffentlicht native Pakete auf PyPI und npm.
- Framework-Integrationen oder Beispiele existieren für CrewAI, Agno, PydanticAI, smolagents, Vercel AI SDK, Mastra, LangGraph.js und Genkit.
- Öffentliche Benchmarks und der MCP-Server-Code sind auf GitHub verfügbar; ein No-Code-Node ist als n8n-nodes-ejentum vorhanden.
Verknüpfte Unternehmen
6 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Harness Engineering für KI-Agenten hat keinen festen Standort
Ein technischer Beitrag argumentiert, dass Harness Engineering für KI-Agenten eine Eigenschaft von Code und Praxis ist und keine feste Schicht oder ein Wrapper um ein Modell darstellt. Der Autor präzisiert die Formel Agent = Modell × Harness und warnt, dass verbesserte Modelle Teile des Harness auflösen, während ein externer, langlebiger Kern aus Spezifikation und Verifikation bestehen bleibt. Die Arbeit kann sowohl auf der modell zugewandten Seite als auch auf der Dienst- und Tool-Seite stattfinden. Der Beitrag veranschaulicht dies anhand eines Rückerstattungs-Handlers mit model.decide, einer übergeordneten Envelope, evals.verify und einer idempotent refund_api.execute. Zudem werden zuverlässige Verweigerungen sowie zwei geschachtelte Eval-Schleifen beschrieben: ein innerer Laufzeit-Verifier und eine äußere Offline-Evaluierungssuite zur Systemverbesserung.
Agent Harness: Sichere Anwendungsschicht für LLMs
Ein Agent Harness fungiert als Anwendungsschicht, die ein Large Language Model (LLM) sicher umschließt, um Speicher, Tools und Ausführungsgrenzen zu steuern sowie deterministische Richtlinien durchzusetzen. Der Autor argumentiert, dass LLMs reine Reasoning-Engines sind und autonome Agenten für den Produktionseinsatz externe Kontrollen wie IAM, Data Governance, Auditing und Sandboxing erfordern. Der Beitrag skizziert architektonische Überlegungen für Unternehmensorchestrierungen und kündigt eine mehrteilige Serie an, die zwölf zentrale Designmuster – darunter Tool Privilege Broker, HITL Approval Gate und Memory Isolation – mit praktischen Implementierungen und Referenzen zu Branchenstandards von OWASP, Google, Anthropic, Microsoft und OpenAI vorstellt. Veröffentlicht am 27.07.2026.
AHE Deep Dive: Automatic Evolution of Agent Harnesses
This technical deep dive reviews the AHE (Agentic Harness Engineering) paper and open-source repository, which propose an evidence-driven framework to automatically evolve the engineering "harness" around coding agents (prompts, tools, middleware, memory, execution environment). Authored by researchers from Fudan University, Peking University and Shanghai Qiji Zhifeng Co., Ltd., and published with code at github.com/china-qijizhifeng/agentic-harness-engineering, AHE emphasizes observability, file-based modifications, change manifests, verification and rollback. Experiments on Terminal‑Bench 2 report pass@1 increasing from 69.7% to 77.0 after 10 iterations, with ablations showing larger gains from structural harness changes (tools, middleware, memory) than prompt-only tweaks. The repo includes an evolve.py orchestrator, an Evolve Agent, and an Agent Debugger. The article outlines how to run smaller experiments, practical engineering trade-offs, and limitations (cost, replication, weaker regression prediction).
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
