Beobachtetes Signal · 11. Apr. 2026 · Technical Release · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Positiv
Evaluierungs-Stack für LangGraph-Agenten: LangFuse im Vergleich zu AWS AgentCore
Der Artikel beschreibt einen zweiwöchigen Evaluierungssprint zum Aufbau eines LLM-Agenten-Evaluierungs-Stacks für einen LangGraph-basierten Agenten. Das Team implementierte eine mehrschichtige Evaluierungs-Pipeline aus Konversation, Orchestrierung und Retrieval, wobei LangFuse für das Tracing, Ragas für RAG-spezifische Metriken, DeepEval für benutzerdefinierte Metriken und Testläufe sowie ein FastMCP-Server für Tool-Aufrufe eingesetzt wurden. Test-Fixtures wurden im Format .eval.yaml formalisiert, um deterministische Prüfungen von LLM-Judge-Metriken zu trennen. Zudem evaluierte das Team die native AWS Bedrock AgentCore-Infrastruktur für Tracing und integrierte Metriken, wobei semantische Abweichungen festgestellt wurden (z. B. Ragas-Faithfulness vs. AgentCore Builtin.Faithfulness). Ein kompaktes PoC-Entscheidungsrahmenwerk mit einer Toleranzschwelle von 15 Prozent diente der Migration und hybriden Nutzung. Der Beitrag liefert lokale Docker- und Ollama-Beispiele sowie operative Erkenntnisse zu Metrikdefinitionen, Judge-Model-Bias und tool-unabhängigen Fixtures.
Praxisnaher Leitfaden zum Aufbau und Vergleich von LLM-Agenten-Eval-Stacks; verdeutlicht semantische Metrikunterschiede zwischen Cloud-Native-Tooling und spezialisierten RAG-Metriken zur Minimierung operativer Migrationsrisiken.
Marktsignale zu Langfuse in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Die Autoren bauten einen mehrschichtigen Eval-Stack für einen LangGraph-Agenten unter Verwendung von LangFuse, Ragas, DeepEval und einem FastMCP-Server für Tool-Calls.
- Sie definierten ein .eval.yaml-Fixture-Format mit test_input und success_criteria zur Trennung deterministischer Prüfungen von LLM-Judge-Metriken.
- Ein Vergleich von Ragas-Metriken mit nativen AWS Bedrock AgentCore-Metriken offenbarte semantische Unterschiede wie bei der Faithfulness-Definition.
- Für den PoC wurde ein dreistufiges Entscheidungsmodell (Adopt, Hybrid, Build Custom) mit zehn Test-Fixtures und einer Divergenzschwelle von 15 Prozent festgelegt.
- Der Beitrag enthält lokale Beispiele unter Nutzung von Ollama als LLM-Judge sowie Docker Compose für LangFuse und Postgres.
Verknüpfte Unternehmen
2 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Lokales RAG-System entwickelt sich mit LangGraph zu Agentic AI weiter
Ein Entwickler beschreibt die Umstellung eines lokal gehosteten RAG-Assistenten auf eine Agentic-AI-Architektur unter Verwendung von LangGraph. Der ursprüngliche Tech-Stack basiert auf Ollama, ChromaDB, LangChain und Docker. Das System nutzt einen gemeinsamen AgentState-Vertrag und implementiert drei spezialisierte Agenten: einen RAG-Agenten für die Dokumentationsrecherche, einen Diagnose-Agenten für die Fehlersuche mit LLM-Fallback sowie einen Eskalations-Agenten zur automatisierten Generierung strukturierter Support-Tickets bei Bedarf. Ein zentraler Orchestrator steuert Anfragen mithilfe eines Klassifizifiers über einen Zustandsgraphen. Der Artikel beleuchtet zentrale Design-Erkenntnisse wie die Fragilität von Klassifizierern, den Overhead bei der Embedding-Initialisierung sowie fest codierte Eskalationsschwellenwerte und empfiehlt, evolutionär mit RAG zu starten und Agenten bedarfsbasiert zu ergänzen.
LLM-Agenten im Produktiveinsatz: Architektur, Memory und Skalierungsmuster
Diese kuratierte Newsletter-Ausgabe analysiert aktuelle Entwicklungen beim Übergang von LLM-Agenten von der Demo-Phase in den Produktiveinsatz. Praxisbeispiele umfassen einen Galileo-Field-Engineer, der Kundenanfragen über 15 Repositories hinweg mittels Claude Code beantwortet, sowie OpenAIs internes Dogfooding des Codex-Toolings. Databricks warnt vor Skalierungsrisiken und plädiert für Orchestrierungs- und Choreographie-Muster aus verteilten Systemen. Zudem werden neue Benchmarks und Frameworks beleuchtet, darunter Video-MME-v2, Claw-Eval und DataFlex. Branchenexperten wie Sebastian Raschka betonen die Relevanz robuster Agent-Harnesses und Runtimes. Ergänzt wird die Übersicht durch Tools wie mem0 für optimiertes Agent Memory, die Rust-basierte Runtime goose sowie Recursive Language Models (RLMs), die als skalierbare Alternative zu herkömmlichen RAG-Pipelines positioniert werden.
Layered Stack for Reliable LLM Tool Selection
A developer guide describes a production architecture to avoid tool-selection hallucinations in LLM-driven agents. Instead of loading hundreds of tools into context or using pure semantic search, the author recommends a five-step layered filtering stack: intent classification, deterministic metadata filtering, semantic search within the filtered subset, confidence scoring, and a final LLM pick among top candidates. The post cites using lightweight local models—gemma4:e4b via Ollama for intent routing and nomic-embed-text via Ollama for embeddings—reports end-to-end latency under 2 seconds, improved tool-selection accuracy versus pure RAG, and fully local/private model infrastructure. The article also emphasizes writing user-facing tool descriptions and notes concurrent-scaling is the next challenge.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
