Beobachtetes Signal · 3. Juli 2026 · Technical Publication · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Positiv
ReWOO: Tool-Aufrufe im Voraus planen und Modellaufrufe auf zwei reduzieren
Der Artikel stellt ReWOO (Reasoning WithOut Observation) vor, eine Agenten-Architektur, bei der ein LLM sämtliche Tool-Aufrufe im Voraus plant. Diese Aufrufe werden anschließend in reinem Code ohne weitere Modellaufrufe ausgeführt, bevor das LLM ein letztes Mal zur Generierung der finalen Antwort herangezogen wird. Durch die Aufteilung in Planner (ein LLM-Aufruf), Worker (keine LLM-Aufrufe) und Solver (ein LLM-Aufruf) hält ReWOO die Anzahl der Modellaufrufe unabhängig von der Kettenlänge konstant bei zwei. Dies reduziert Token-Wiederholungen, Inferenzkosten und Latenzen bei mehrstufigen Abfragen drastisch. Der Beitrag beleuchtet den zentralen Kompromiss: ReWOO arbeitet bei vorhersehbaren Abläufen äußerst effizient, ist jedoch bei unerwarteten Tool-Ergebnissen weniger flexibel, weshalb hybride Ansätze mit Re-Planning vorgeschlagen werden. Veröffentlicht auf dev.to am 03.07.2026.
Präsentiert eine praxisnahe Agenten-Architektur, die LLM-Aufrufe, Token-Mengen und Latenzen bei mehrstufigen Workflows signifikant reduziert, was insbesondere für Teams bei der Implementierung kostensensitiver RAG- und Agenten-Systeme von Relevanz ist.
Marktsignale zu DEV Community in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- ReWOO (Reasoning WithOut Observation) lässt ein LLM im Voraus einen vollständigen Plan aller Tool-Aufrufe erstellen, führt diese programmatisch aus und nutzt das LLM erst am Ende erneut.
- Das Agenten-Design unterteilt sich in drei Rollen: Planner (1 LLM-Aufruf), Worker (0 LLM-Aufrufe) und Solver (1 LLM-Aufruf).
- Die Anzahl der Modellaufrufe bleibt bei ReWOO konstant bei zwei, während herkömmliche Ansätze bei k Schritten oft k+1 Aufrufe erfordern.
- ReWOO minimiert wiederkehrende Token-Transfers, senkt Latenzen sowie Inferenzkosten, opfert jedoch die dynamische Anpassungsfähigkeit bei unvorhergesehenen Tool-Ergebnissen.
- Der Artikel wurde auf dev.to mit dem Metadatendatum 03.07.2026 veröffentlicht.
Verknüpfte Unternehmen
1 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Plan-and-Solve-Agentenarchitektur: Erst planen, dann sequenziell ausführen
Dieser technische Artikel erläutert das Plan-and-Solve-Agentenparadigma, bei dem ein LLM zunächst einen vollständigen, geordneten Plan aus drei bis sieben konkreten Schritten erstellt (Plan-Phase) und diese anschließend mithilfe tool-fähiger Sub-Agenten sequenziell ausführt (Solve-Phase). Der Autor implementiert diese Architektur unter Verwendung der StateGraph-Abstraktion von LangGraph und zeigt einen Plan-Knoten, einen Execute-Knoten mit integriertem ReAct-Sub-Agenten für Tool-Aufrufe wie web_search und calculator, einen Replan-Knoten sowie einen Finalize-Knoten. Anhand von Demos werden praxisnahe Fehlerbilder beleuchtet – etwa Informationsverluste bei der Übertragung von Ergebnissen als kurze natürlichsprachliche Zusammenfassungen, eine Übersegmentierung durch den Planer sowie toolspezifische Fehler – und entsprechende Engineering-Lösungen vorgestellt. Der Artikel schließt mit fünf Production-Erkenntnissen und einer Entscheidungshilfe für den Einsatz von ReAct im Vergleich zu Plan-and-Solve.
Open‑Source RightModel Tackles Token Consumption Anxiety
Developer Regnard Raquedan published an article on May 4, 2026 describing RightModel, an open-source tool that recommends the best LLM for a task without making live LLM calls in the default request path. RightModel uses a human-owned, versioned ruleset to classify task types and map them to model tiers; pricing data is refreshed asynchronously (via OpenRouter and a scheduled workflow using Google Cloud Scheduler) to avoid runtime API calls. For ambiguous cases the app exposes a user-triggered "Deep Analysis" escalation that calls an LLM (currently Gemini 2.5 Flash). Raquedan frames the architecture as an instance of a broader pattern he calls "Precomputed AI," which shifts reasoning out of real-time request paths into asynchronous build pipelines with explicit staleness controls and escalation paths.
ARTIST: RL-Powered Tool Use for LLM Agents
ARTIST (Agentic Reasoning and Tool Integration in Self-improving Transformers) is a Microsoft Research training framework that teaches LLMs when and how to call external tools by using outcome-only reinforcement learning. Published (paper/arXiv 2505.01441) and described in the article, ARTIST interleaves tool calls inside the model’s chain-of-thought tokens rather than appending results as separate turns, and trains with GRPO (Group Relative Policy Optimization) using final-answer rewards, format checks, and efficiency signals. At 7B scale, ARTIST reportedly outperforms GPT-4o on multiple math and multi-turn function-calling benchmarks. An independent Effloow Lab proof-of-concept reproduced the interleaving execution loop in a minimal Python sandbox and observed improved accuracy and fault-tolerant recovery. The paper focuses on a training recipe rather than a production SDK; some public implementations (TRL, verl) can approximate parts of the GRPO loop.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
