Beobachtetes Signal · 24. Aug. 2026 · Technical Release · Quelle: SemiAnalysis · Relevanz: 4/5 · Sentiment: Positiv

AgentX 1.0: Open-Source-Benchmark für agentische Inferenz

Zusammenfassung des Signals

SemiAnalysis hat AgentX 1.0 und InferenceXv3 vorgestellt – einen Open-Source-Benchmark für agentische Inferenz und dessen Implementierung, ausgelegt für langkettige, mehrstufige Coding-Workloads mit bis zu 1M Kontext (Apache 2.0). Das Projekt umfasst offene Datensätze, Tools und Dashboards, nachdem über 3 Millionen US-Dollar in Traces und Testläufe auf rund 2MW über 1.000 Chips investiert wurden. AgentX initiierte bereits über 50 Upstream-Pull-Requests und plattformübergreifende Optimierungen für vLLM, SGLang, TensorRT-LLM, ATOM, LMCache, Mooncake und Dynamo. Die Ergebnisse zeigen differenzierte Anbieter-Leistungsdaten: NVIDIA dominiert bei vielen Frontier-Modellen, während AMD mit ATOM in Teilbereichen wettbewerbsfähig ist. Aktuelle Optimierungen haben zudem Preis-Leistungs-Vergleiche verschoben. Der Datensatz ist auf HuggingFace verfügbar, die Ergebnisse sind auf InferenceX einsehbar.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Der neue 1M-Kontext-Benchmark und offene Datensatz treiben maßgebliche Optimierungen in führenden Inferenz-Engines voran und beeinflussen direkt die Hard- und Softwarestrategie für komplexe, agentische Workloads.

SIGNAL RADAR

Marktsignale zu SemiAnalysis in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • SemiAnalysis veröffentlicht AgentX 1.0 als Open-Source-Benchmark für mehrstufige, agentische Coding-Inferenz (1M Kontext) unter der Apache-2.0-Lizenz.
  • InferenceXv3 testete die Benchmark-Matrix auf rund 2MW kontinuierlicher Rechenleistung über 1.000+ Chips (darunter MI355X, GB300 NVL72, GB200 NVL72, B300, B200, MI325, MI300X, H200 und RTX Pro Server).
  • Über 3 Millionen US-Dollar wurden in den AgentX-Datensatz investiert; eine repräsentative Teilmenge von 393 Sessions ist auf HuggingFace verfügbar.
  • Das Projekt trieb bereits 50+ Upstream-Pull-Requests und Optimierungen in wichtigen Inferenz-Engines (vLLM, SGLang, TensorRT-LLM, ATOM, LMCache, Mooncake, Dynamo) voran.
  • NVIDIA führt oft bei Frontier-Modellen, während AMDs ATOM starke Preis-Leistungs-Verhältnisse liefert; jüngste Software-Optimierungen veränderten die relative Performance zwischen MI355X und B200.

Verknüpfte Unternehmen

12 verknüpfte Unternehmen

“At SemiAnalysis, most of the team are AI power users and use agents for a broad variety of tasks including coding, analyst research, excel m...”

“In addition, we are thankful to all who support our open source InferenceX initiative, including Meta, Microsoft, Oracle, OpenAI, MiniMax, M...”

“In addition, we are thankful to all who support our open source InferenceX initiative, including Meta, Microsoft, Oracle, OpenAI, MiniMax, M...”

“In addition, we are thankful to all who support our open source InferenceX initiative, including Meta, Microsoft, Oracle, OpenAI, MiniMax, M...”

“In addition, we are thankful to all who support our open source InferenceX initiative, including Meta, Microsoft, Oracle, OpenAI, MiniMax, M...”

“we collected an initial corpus of [393 internal SemiAnalysis anonymous Claude Code traces](https://huggingface.co/datasets/semianalysisai/cc...”

Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: SemiAnalysis•Veröffentlicht: 24. Aug. 2026
Ursprünglicher Berichttitel: “AgentX - InferenceXv3: Does CUDA Moat Hold up in Agentic Inferencing?”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Large Language Models (LLM) & AI16. Feb. 2026

InferenceX v2 Benchmarks: NVIDIA Blackwell im Vergleich zu AMD und Hopper

SemiAnalysis hat InferenceX v2 (zuvor InferenceMAX) veröffentlicht, einen Open-Source-Benchmark nach Apache 2.0 für kontinuierliche Inference, der die Abdeckung auf rund 1.000 Frontier-GPUs und verteilte Inference-Modi ausweitet. Die Version fügt groß angelegtes disaggregated Prefill mit wide Expert Parallelism (wideEP) für sechs aktuelle NVIDIA GPU-SKUs – darunter GB200/GB300 NVL72, B200, B300 und Blackwell Ultra – sowie aktuelle AMD-SKUs wie die MI355X hinzu. Sie liefert die ersten Pareto-Frontier-Benchmarks von Drittanbietern für Blackwell Ultra GB300 NVL72 und Multi-Node-MI355X-Disagg+wideEP-FP4/FP8. Zentrale Ergebnisse: NVIDIA Blackwell Rack-Scale-Systeme führen bei MoE/disaggregated Inference und Energieeffizienz. Die AMD MI355X zeigt sich bei FP8 und Single-Node-Performance/TCO wettbewerbsfähig, weist jedoch Software-Lücken bei Komposabilität und FP4-Multi-Node auf. Der Bericht hebt zudem Multi-Token/Speculative Decoding zur Kostensenkung hervor und dokumentiert Software-Stacks wie SGLang, vLLM, TensorRT‑LLM, Dynamo, MoRI und Mooncake.

Signal analysieren
Large Language Models (LLM) & AI14. März 2026

KI-News: 1M-Kontext, Speichergrenzen und Agenten-Infrastruktur im Fokus

Diese AI-News-Auswertung beleuchtet wegweisende Produkt- und Forschungsentwicklungen im KI-Ökosystem: Replit steigerte seine Bewertung Berichten zufolge auf 9 Milliarden US-Dollar und stellte Replit Agent 4 vor, eine kollaborative Multi-Agenten-Oberfläche für Apps, Websites und Präsentationen. NVIDIA veröffentlichte Nemotron 3 Super, ein offenes 120B-Modell mit rund 12B aktiven Parametern, 1M-Token-Kontext, hybrider Mamba-Transformer-Architektur sowie optimierter Inferenz. Der Trend verlagert sich 2026 zunehmend von reinen Coding-Agenten hin zu universellen Knowledge-Work-Agenten. Zu den weiteren Highlights zählen Perplexys Personal Computer, Base44 Superagents sowie Updates von LangChain. Zudem gründete Anthropic The Anthropic Institute unter der Leitung von Jack Clark, während ein Ausfall von Claude Code die Entwickler-Workflows kurzzeitig beeinträchtigte. Wichtige Forschungsbeiträge umfassen Google Gemini Embedding 2 und Qwen3.5.

Signal analysieren
Platform20. März 2026

KI-Labore drängen massiv in den Markt für Developer Tools und Agent Runtimes

Der Latent Space AINews-Überblick verzeichnet eine rasante Konsolidierung und intensive Produktaktivität im KI-Entwicklersegment. OpenAI hat Astral übernommen, um das Team hinter uv, ruff und ty in die Codex-Initiativen zu integrieren. Cursor stellte Composer 2 vor, ein Coding-Modell der Spitzenklasse mit starkem Preis-Leistungs-Verhältnis. Anthropic erweiterte Claude Code um Messaging-Kanäle und persistente Entwickler-Workflows, während LangChain LangSmith Fleet für Enterprise-Agentenflotten einführte. Die Entwicklungen markieren den Übergang von einzelnen Agenten zu verwalteten Flotten, Multi-Agenten-Runtimes und kontrollierten Agenten-Control-Planes. Dabei standen Sicherheit, identitätsbasierte Autorisierung und Observability im Fokus. Ergänzend wurden neue Modellversionen wie MiniMax M2.7 und Qwen 3.5 Max Preview, Fortschritte bei OCR- und Dokumenten-Parsing-Tools wie Chandra OCR 2 und LlamaIndex LiteParse sowie Infrastruktur-Forschungstrends präsentiert.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.