Beobachtetes Signal · 9. Aug. 2026 · Technical Release · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Positiv

homebench: Ehrliches und präzises Benchmarking-Tool für lokale LLMs

Zusammenfassung des Signals

Ein Ingenieur hat homebench entwickelt, ein Open-Source-Tool zur Leistungsbewertung lokaler Large Language Models hinsichtlich Geschwindigkeit, Speicherauslastung und deterministischer Qualität. Das Tool misst den Durchsatz bei der Textgenerierung exklusive Prompt-Verarbeitung und Modell-Ladezeit, erfasst verschiedene Speichermetriken wie residente Gewichtungen versus Prozess-RSS und evaluiert sowohl Einzelströme als auch gleichzeitige Batch-Verarbeitung. Zudem führt es eine standardmäßige Suite aus 31 deterministischen Aufgaben bei einer Temperatur von 0 als Smoke-Test aus. homebench unterstützt diverse lokale Runner, speichert Testläufe für spätere Vergleiche, bietet einen Befehl zur Hardware-Kompatibilitätsprüfung, ist über pip installierbar und unter der MIT-Lizenz auf GitHub veröffentlicht.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Ein nützliches Open-Source-Tool für Entwickler zur objektiven Evaluierung von lokaler LLM-Inferenzgeschwindigkeit, Speichernutzung und deterministischer Qualität, das die Hardware-Auswahl und Modelloptimierung erleichtert.

SIGNAL RADAR

Marktsignale zu Ollama in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • homebench ist ein Open-Source-Benchmarking-Tool zur Messung von Geschwindigkeit, Speicher und deterministischer Qualität lokaler LLMs.
  • Die Standard-Qualitätssuite umfasst 31 deterministische Aufgaben (Temperatur 0, fester Seed) als gezielten Smoke-Test.
  • Das Tool ermittelt den Durchsatz als Ausgabetoken geteilt durch die Generierungszeit und trennt server- und clientseitiges Timing.
  • Es erfasst granulare Speichermetriken, darunter residente Modellgewichte und Peak-RSS-Stichproben.
  • homebench unterstützt unter anderem Ollama, LM Studio, llama.cpp und vLLM, ist via pip installierbar und auf GitHub verfügbar.
Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: DEV Community•Veröffentlicht: 9. Aug. 2026
Ursprünglicher Berichttitel: “What I learned trying to benchmark local LLMs honestly”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Large Language Models (LLM) & AI14. Juli 2026

Entwickler testet über 300 LLMs und beendet Benchmark-Projekt

Ein Entwickler hat ein Langzeit-Benchmark für Large Language Models (LLMs) anhand praxisnaher Coding-Tasks für KI-Agenten durchgeführt und dabei über 300 Modelle via OpenRouter sowie auf lokaler Hardware getestet. Das Testverfahren umfasste zehn praxisbezogene Aufgaben mit einem Limit von 400 Token, niedriger Temperature, Pattern-Matching-Scoring sowie Pre-Flight-Prüfungen zur Erkennung instabiler Endpunkte. Das öffentliche Leaderboard, das Daten zu 168 Modellen enthielt, wurde nun eingestellt: Die extrem hohe Frequenz neuer Modell-Releases, Limitationen des Test-Harnesses und eine geringe aktive Nutzung machten die kontinuierliche Pflege unrentabel. Der Autor führt Ad-hoc-Tests zwar fort und stellt die archivierten Daten bereit, argumentiert jedoch grundsätzlich, dass statische LLM-Leaderboards angesichts rasanter Modellverbesserungen extrem schnell veralten und an Relevanz verlieren.

Signal analysieren
Large Language Models (LLM) & AI7. Mai 2026

LLM-Performance messen mit AWS Labs' LLMeter

Dieser Artikel bietet eine praxisnahe Anleitung zur Nutzung von AWS Labs' LLMeter, einer Python-basierten Benchmarking-Bibliothek für Large Language Models. Er erläutert zentrale Leistungskennzahlen wie Time to First Token (TTFT), Tokens Per Second (TPS), Time to Last Token (TTL) sowie Cost Per Request und zeigt, wie Experimente, Endpunkte und Kostenmodelle konfiguriert werden. LLMeter setzt auf modernes Python (3.10+), nutzt asyncio für parallele Client-Simulationen und empfiehlt Streaming-Endpunkte für präzise Latenzmessungen. Der Leitfaden behandelt Lasttests mit mehreren Clients, interaktive HTML-Visualisierungen auf Basis von Plotly sowie ein minimalistisches Live-Dashboard für das Echtzeit-Monitoring. Ergänzend verweist der Artikel auf das LLMeter-GitHub-Repository, ein QAInsights-Dashboard-Skript und eine Video-Anleitung.

Signal analysieren
Large Language Models (LLM) & AI11. Aug. 2026

Neun lokale LLM-Schnittstellen im Praxistest auf einer GPU

Eine praxisnahe Untersuchung evaluierte neun Schnittstellen für lokale Large Language Models auf derselben GPU über einen Zeitraum von rund zwei Wochen. Im Fokus standen dabei Zuverlässigkeit, Offload-Verhalten, Datei-I/O und Kontextverarbeitung statt reiner Tokens pro Sekunde. Die Ergebnisse zeigen erhebliche Varianzen, die primär durch die Runtime beziehungsweise das Framework statt durch die Modellgewichte verursacht werden: Ollama erwies sich als zuverlässiger Standard (32,9 Tokens/Sekunde bei einem 30B Mixture-of-Experts-Modell mit 443 Tokens/Sekunde Prefill), während llama.cpp nach gezieltem Tuning noch höhere Geschwindigkeiten erreichte. LM Studio überzeugte bei der strukturierten Datenextraktion, wohingegen andere Tools wie Unsloth deutliche Kontext-Limits aufwiesen oder wie Claude Code mangels System-Prompt-Parsing scheiterten. Der Autor schließt daraus, dass Benchmarks reale Anwendungsfälle abbilden müssen, da das Verhalten der Tools und nicht nur die Modellwahl die Praxistauglichkeit bestimmt.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.