Beobachtetes Signal · 20. Mai 2026 · Technical Release · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Neutral
Benchmarking von LLMs als automatisierte Weekly Stock Pickers
Ein Entwickler hat 1rok gelauncht, ein Open-Source-Benchmark zur Evaluierung von sieben Frontier-LLMs als autonome, wöchentliche Stock-Picking-Agenten. Jedes Modell erhält 100.000 US-Dollar Papierkapital sowie identische Tools, Prompts und Daten; jeden Montag erstellen die Modelle Portfolios, die über Alpaca in Demokonten ausgeführt werden. Die Architektur nutzt eine Multi-Agenten-Struktur mit separaten Ausführungsbefehlen für vollständige Auditierbarkeit der Entscheidungen. Das Live-Experiment startete am 20. Januar 2026; ein öffentliches Leaderboard ist verfügbar. Ziel ist es, die nachgelagerte Entscheidungsfindung unter Unsicherheit zu bewerten und vergleichende Verhaltensweisen wie Risikodimensionierung oder Drawdown-Reaktionen über Modelle wie GPT-5.5, Gemini 3.1 Pro Preview, Grok 4.3, DeepSeek V4 Pro, GLM-5.1, Kimi K2.6 und MiniMax M2.7 hinweg zu analysieren.
Öffentlicher Benchmark zur Evaluierung von Multi-Agenten-LLM-Entscheidungen bei realen Aufgaben, der wertvolle Einblicke in den Modellvergleich bietet, jedoch keine branchenverändernde Plattform darstellt.
Marktsignale zu DeepSeek in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Projektname: 1rok mit Live-Leaderboard unter investingbench.vercel.app und Repository auf GitHub.
- Benchmark testet sieben LLMs mit jeweils 100.000 US-Dollar Papierkapital und identischen Tools/Daten; Start war am 20.01.2026.
- Wöchentliche Pipeline-Ausführung (montags) über Multi-Agenten-Workflow: Macro, Screener, sechs Analysts, Orchestrator und Constructor.
- Broker-Interaktionen erfolgen via Alpaca-Demokonten; typisiertes JSON wird von Handlern für Alpaca, Yahoo Finance, FRED und Tavily bereitgestellt.
- Getestete Modelle: GPT-5.5, Gemini 3.1 Pro Preview, Grok 4.3, DeepSeek V4 Pro, GLM-5.1, Kimi K2.6 und MiniMax M2.7.
Verknüpfte Unternehmen
3 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
RealDataAgentBench: Neuer Benchmark deckt statistische Schwachstellen von LLM-Agenten auf
Ein Entwickler hat mit RealDataAgentBench einen Open-Source-Benchmark veröffentlicht, der LLM-Agenten hinsichtlich Korrektheit, Code-Qualität, Effizienz und statistischer Validität bewertet. Das Framework nutzt reproduzierbare Seed-Datensätze sowie ein automatisiertes Scoring. Es umfasst 23 Aufgaben aus den Bereichen EDA, Feature Engineering, Modellierung, statistische Inferenz und ML-Engineering. Auf Basis von über 163 Experimenten mit rund zehn Modellen – darunter GPT-4o, Claude Sonnet, Grok, Gemini 2.5 und Llama via Groq – zeigen sich zentrale Muster: Während GPT-4o und Claude Sonnet im Gesamtergebnis nahezu gleichauf liegen, arbeitet GPT-4o pro Task signifikant kostengünstiger. Llama-Modelle via Groq punkten mit hoher Geschwindigkeit und geringen Kosten, lassen jedoch teils statistische Rigorosität vermissen. Die häufigsten Fehlerquellen betreffen generell die statistische Validität und Code-Qualität. Das auf GitHub gehostete Projekt bietet ein Live-Leaderboard sowie Budget-Steuerungsoptionen.
Top Open-Source-LLMs für Coding: Das Leaderboard im Juni 2026
Eine Marktübersicht vom 8. Juni 2026 analysiert die dynamische Landschaft der Open-Weight-Coding-LLMs und liefert praktische Deployment-Empfehlungen. Zu den wichtigsten Modellen zählen MiniMax M3 mit Spitzenwerten im SWE-bench Pro (Gewichte ausstehend), Z.AIs GLM-5.1 (754B MoE, MIT-Lizenz) für langanhaltende autonome Workflows sowie Moonshot AIs Kimi K2.6 (1T Parameter) für lokale Agentic-Architekturen. Ergänzt wird das Feld durch Alibabas Qwen3.6-35B-A3B für Single-GPU-Setups, DeepSeek V4 (inklusive selbst-hostbarer V4-Flash-Variante) und Codestral 22B, das mit 95,3 % FIM pass@1 führend bei IDE-Autovervollständigungen bleibt. Der Bericht adressiert zudem das Problem der Benchmark-Kontamination (HumanEval-Sättigung), empfiehlt aussagekräftigere Evaluierungsmetriken für agentische Programmierung und definiert konkrete Hardware-Stacks für unterschiedliche Enterprise- und Developer-Anforderungen.
Entwickler testet über 300 LLMs und beendet Benchmark-Projekt
Ein Entwickler hat ein Langzeit-Benchmark für Large Language Models (LLMs) anhand praxisnaher Coding-Tasks für KI-Agenten durchgeführt und dabei über 300 Modelle via OpenRouter sowie auf lokaler Hardware getestet. Das Testverfahren umfasste zehn praxisbezogene Aufgaben mit einem Limit von 400 Token, niedriger Temperature, Pattern-Matching-Scoring sowie Pre-Flight-Prüfungen zur Erkennung instabiler Endpunkte. Das öffentliche Leaderboard, das Daten zu 168 Modellen enthielt, wurde nun eingestellt: Die extrem hohe Frequenz neuer Modell-Releases, Limitationen des Test-Harnesses und eine geringe aktive Nutzung machten die kontinuierliche Pflege unrentabel. Der Autor führt Ad-hoc-Tests zwar fort und stellt die archivierten Daten bereit, argumentiert jedoch grundsätzlich, dass statische LLM-Leaderboards angesichts rasanter Modellverbesserungen extrem schnell veralten und an Relevanz verlieren.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
