Beobachtetes Signal · 23. Jan. 2026 · Technical Release · Quelle: Machine Learning Pills · Relevanz: 2/5 · Sentiment: Positiv
Erklärung des Evaluator-Optimiser-LLM-Workflow-Musters
Dieser technische Artikel definiert das Evaluator-Optimiser-LLM-Workflow-Muster: eine Feedback-Schleife, bei der ein LLM (Generator) Ausgaben erzeugt und ein zweites LLM (Evaluator) diese strikt bewertet und strukturiertes Feedback zurückgibt. Es kontrastiert dieses auf Tiefe ausgerichtete Muster mit Orchestrator-Worker-Designs, erläutert Vorteile wie Selbstkorrektur, Trennung von Belangen, höhere Qualitätsgrenzen und durchsetzbare Einschränkungen, und demonstriert eine LangChain-basierte Implementierung unter Verwendung von ChatOpenAI, Pydantic und LangChain-Ausgabeparsern. Ein lauffähiges Python-Beispiel verfeinert iterativ einen Anagramm-Prüfer, um O(n)-Komplexität und Groß-/Kleinschreibung-Unempfindlichkeit zu erfüllen, wobei Generator- und Evaluator-LLMs mit unterschiedlichen Temperaturen und einer max_attempts-Sicherheitsbegrenzung eingesetzt werden. Der Beitrag richtet sich an Ingenieure, die hochverbindliche LLM-Agenten entwickeln, bei denen Korrektheit wichtiger ist als Latenz.
Praktisches technisches Muster und Referenzimplementierung, die die Qualität und Zuverlässigkeit von LLM-Ausgaben für Engineering-Teams verbessern; nützlich für AdTech- und MarTech-Teams, die agentische oder generative Tools entwickeln, aber nicht branchenverändernd.
Marktsignale zu LangChain in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Definiert das 'Evaluator-Optimiser'-Muster: Getrennte Generator- und Evaluator-LLM-Rollen mit iterativen Feedback-Schleifen.
- Bietet eine LangChain-basierte Implementierung mit ChatOpenAI (generator_llm und evaluator_llm), Pydantic Evaluation-Modell und JsonOutputParser.
- Das Generator-LLM ist mit temperature=0.7 (kreativ) konfiguriert; das Evaluator-LLM verwendet temperature=0.0 (deterministisch, strikt).
- Der Beispiel-Workflow läuft bis zu einem max_attempts-Wert (Standard: 3), um Python-Code zu verfeinern, bis der Evaluator die Entscheidung 'PASS' zurückgibt.
- Enthält ein konkretes Beispiel: iterative Erstellung einer is_anagram(s1, s2)-Funktion mit O(n)-Zeitkomplexität und Unempfindlichkeit gegenüber Groß- und Kleinschreibung.
Verknüpfte Unternehmen
2 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Produktionsreife LLM-Evaluierungs-Pipelines ersetzen informelle Vibe Checks
Ein neuer Praxisleitfaden beschreibt den Aufbau einer produktionsreifen Evaluierungs-Pipeline für Large Language Models (LLMs), die subjektive manuelle Überprüfungen („Vibe Checks“) durch automatisierte CI/CD-Tests ersetzt. Dabei durchläuft ein versionierter Golden Dataset das Ziel-LLM und wird von einem Ensemble aus Evaluierungsmodellen anhand von Kriterien wie Faithfulness, Instruction-Following, JSON-Schema-Validierung und Safety bewertet. Die Ergebnisse steuern automatisierte Pull-Request-Kommentare und blockieren Regressionen via GitHub Actions. Nach sechsmonatigem Produktiveinsatz stieg die Erkennungsrate von Halluzinationen von rund 67 % auf 92 %, während Produktionsvorfälle von 3 auf 0,2 pro Monat sanken. Gleichzeitig verkürzte sich der Prompt-Iterationszyklus von zwei Stunden auf rund 15 Minuten. Die zugrundeliegenden Tools (llm-eval-harness, prompt-registry, eval-dashboard) wurden unter MIT-Lizenz als Open Source veröffentlicht.
Automatisierte LLM-as-a-Judge-Evaluation für Spring-Boot-KI-Agenten in Produktion
Ein Senior Engineer stellt ein LLM-as-a-Judge-Evaluierungsframework für einen produktiven E-Commerce-Agenten auf Basis von Spring Boot vor. Das System evaluiert nächtlich 40 anonymisierte Produktivkonversationen anhand von fünf definierten Metriken: Antwortkorrektheit, Kontextfaktizität, Tool-Disziplin, Formatkonformität und unbedenkliche Verweigerung. Deterministische Prüfungen werden wo immer möglich eingesetzt, während subjektive Kriterien über Spring-AI-Evaluatoren bewertet werden. Für die Faktizitätsprüfung nutzt der Autor ein spezialisiertes Modell (Bespoke Minicheck via Ollama) und für die Korrektheit ein separates Richtermodell mit einer Temperature von 0.0. Neben dem nächtlichen Vollaufruf existiert ein CI-Smoke-Test mit zehn Fällen. Erste Durchläufe deckten reale Fehler wie falsche Lieferzeitangaben, veraltete Bestandsdaten und Formatierungsfehler auf. Der Autor betont die fortlaufende Datensatzpflege und rät dazu, Richter-Scores als Richtwerte statt als absolute Wahrheiten zu betrachten.
Strukturierte LLM-Outputs mit Pydantic und LangChain
Dieser technische Newsletter erläutert, wie sich durch die Kombination von Pydantic-Schemata mit dem PydanticOutputParser von LangChain und der LangChain Expression Language (LCEL) strukturierte und validierte Ausgaben von Large Language Models erzeugen lassen. Der Artikel demonstriert die Definition strikter Pydantic-Modelle, einschliesslich Enums, eingeschränkter Werte, geschachtelter Modelle sowie Post-Validatoren, die in Formatierungsanweisungen für Prompts umgewandelt werden. Mithilfe der Pipe-Komposition von LCEL zeigt der Autor eine einzeilige Pipeline, die typisierte Pydantic-Instanzen zurückgibt oder bei Validierungsfehlern eine Exception auslöst. Der Beitrag enthält ein detailliertes Beispiel für ein InterviewEvaluation-Schema, praktische Hinweise zu Einschränkungen und Validatoren sowie kurze Verweise auf verwandte Multi-Agenten-Konzepte in einer angrenzenden Ressourcenempfehlung.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
