Beobachtetes Signal · 20. Mai 2026 · Technical Release · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Neutral

Benchmarking von LLMs als automatisierte Weekly Stock Pickers

Zusammenfassung des Signals

Ein Entwickler hat 1rok gelauncht, ein Open-Source-Benchmark zur Evaluierung von sieben Frontier-LLMs als autonome, wöchentliche Stock-Picking-Agenten. Jedes Modell erhält 100.000 US-Dollar Papierkapital sowie identische Tools, Prompts und Daten; jeden Montag erstellen die Modelle Portfolios, die über Alpaca in Demokonten ausgeführt werden. Die Architektur nutzt eine Multi-Agenten-Struktur mit separaten Ausführungsbefehlen für vollständige Auditierbarkeit der Entscheidungen. Das Live-Experiment startete am 20. Januar 2026; ein öffentliches Leaderboard ist verfügbar. Ziel ist es, die nachgelagerte Entscheidungsfindung unter Unsicherheit zu bewerten und vergleichende Verhaltensweisen wie Risikodimensionierung oder Drawdown-Reaktionen über Modelle wie GPT-5.5, Gemini 3.1 Pro Preview, Grok 4.3, DeepSeek V4 Pro, GLM-5.1, Kimi K2.6 und MiniMax M2.7 hinweg zu analysieren.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Öffentlicher Benchmark zur Evaluierung von Multi-Agenten-LLM-Entscheidungen bei realen Aufgaben, der wertvolle Einblicke in den Modellvergleich bietet, jedoch keine branchenverändernde Plattform darstellt.

SIGNAL RADAR

Marktsignale zu DeepSeek in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • Projektname: 1rok mit Live-Leaderboard unter investingbench.vercel.app und Repository auf GitHub.
  • Benchmark testet sieben LLMs mit jeweils 100.000 US-Dollar Papierkapital und identischen Tools/Daten; Start war am 20.01.2026.
  • Wöchentliche Pipeline-Ausführung (montags) über Multi-Agenten-Workflow: Macro, Screener, sechs Analysts, Orchestrator und Constructor.
  • Broker-Interaktionen erfolgen via Alpaca-Demokonten; typisiertes JSON wird von Handlern für Alpaca, Yahoo Finance, FRED und Tavily bereitgestellt.
  • Getestete Modelle: GPT-5.5, Gemini 3.1 Pro Preview, Grok 4.3, DeepSeek V4 Pro, GLM-5.1, Kimi K2.6 und MiniMax M2.7.
Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: DEV Community•Veröffentlicht: 20. Mai 2026
Ursprünglicher Berichttitel: “Which LLM is the best stock picker? I built a benchmark to find out.”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Large Language Models (LLM) & AI11. Apr. 2026

RealDataAgentBench: Neuer Benchmark deckt statistische Schwachstellen von LLM-Agenten auf

Ein Entwickler hat mit RealDataAgentBench einen Open-Source-Benchmark veröffentlicht, der LLM-Agenten hinsichtlich Korrektheit, Code-Qualität, Effizienz und statistischer Validität bewertet. Das Framework nutzt reproduzierbare Seed-Datensätze sowie ein automatisiertes Scoring. Es umfasst 23 Aufgaben aus den Bereichen EDA, Feature Engineering, Modellierung, statistische Inferenz und ML-Engineering. Auf Basis von über 163 Experimenten mit rund zehn Modellen – darunter GPT-4o, Claude Sonnet, Grok, Gemini 2.5 und Llama via Groq – zeigen sich zentrale Muster: Während GPT-4o und Claude Sonnet im Gesamtergebnis nahezu gleichauf liegen, arbeitet GPT-4o pro Task signifikant kostengünstiger. Llama-Modelle via Groq punkten mit hoher Geschwindigkeit und geringen Kosten, lassen jedoch teils statistische Rigorosität vermissen. Die häufigsten Fehlerquellen betreffen generell die statistische Validität und Code-Qualität. Das auf GitHub gehostete Projekt bietet ein Live-Leaderboard sowie Budget-Steuerungsoptionen.

Signal analysieren
Large Language Models (LLM) & AI8. Juni 2026

Top Open-Source-LLMs für Coding: Das Leaderboard im Juni 2026

Eine Marktübersicht vom 8. Juni 2026 analysiert die dynamische Landschaft der Open-Weight-Coding-LLMs und liefert praktische Deployment-Empfehlungen. Zu den wichtigsten Modellen zählen MiniMax M3 mit Spitzenwerten im SWE-bench Pro (Gewichte ausstehend), Z.AIs GLM-5.1 (754B MoE, MIT-Lizenz) für langanhaltende autonome Workflows sowie Moonshot AIs Kimi K2.6 (1T Parameter) für lokale Agentic-Architekturen. Ergänzt wird das Feld durch Alibabas Qwen3.6-35B-A3B für Single-GPU-Setups, DeepSeek V4 (inklusive selbst-hostbarer V4-Flash-Variante) und Codestral 22B, das mit 95,3 % FIM pass@1 führend bei IDE-Autovervollständigungen bleibt. Der Bericht adressiert zudem das Problem der Benchmark-Kontamination (HumanEval-Sättigung), empfiehlt aussagekräftigere Evaluierungsmetriken für agentische Programmierung und definiert konkrete Hardware-Stacks für unterschiedliche Enterprise- und Developer-Anforderungen.

Signal analysieren
Large Language Models (LLM) & AI14. Juli 2026

Entwickler testet über 300 LLMs und beendet Benchmark-Projekt

Ein Entwickler hat ein Langzeit-Benchmark für Large Language Models (LLMs) anhand praxisnaher Coding-Tasks für KI-Agenten durchgeführt und dabei über 300 Modelle via OpenRouter sowie auf lokaler Hardware getestet. Das Testverfahren umfasste zehn praxisbezogene Aufgaben mit einem Limit von 400 Token, niedriger Temperature, Pattern-Matching-Scoring sowie Pre-Flight-Prüfungen zur Erkennung instabiler Endpunkte. Das öffentliche Leaderboard, das Daten zu 168 Modellen enthielt, wurde nun eingestellt: Die extrem hohe Frequenz neuer Modell-Releases, Limitationen des Test-Harnesses und eine geringe aktive Nutzung machten die kontinuierliche Pflege unrentabel. Der Autor führt Ad-hoc-Tests zwar fort und stellt die archivierten Daten bereit, argumentiert jedoch grundsätzlich, dass statische LLM-Leaderboards angesichts rasanter Modellverbesserungen extrem schnell veralten und an Relevanz verlieren.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.