Beobachtetes Signal · 9. Aug. 2026 · Technical Release · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Positiv
homebench: Ehrliches und präzises Benchmarking-Tool für lokale LLMs
Ein Ingenieur hat homebench entwickelt, ein Open-Source-Tool zur Leistungsbewertung lokaler Large Language Models hinsichtlich Geschwindigkeit, Speicherauslastung und deterministischer Qualität. Das Tool misst den Durchsatz bei der Textgenerierung exklusive Prompt-Verarbeitung und Modell-Ladezeit, erfasst verschiedene Speichermetriken wie residente Gewichtungen versus Prozess-RSS und evaluiert sowohl Einzelströme als auch gleichzeitige Batch-Verarbeitung. Zudem führt es eine standardmäßige Suite aus 31 deterministischen Aufgaben bei einer Temperatur von 0 als Smoke-Test aus. homebench unterstützt diverse lokale Runner, speichert Testläufe für spätere Vergleiche, bietet einen Befehl zur Hardware-Kompatibilitätsprüfung, ist über pip installierbar und unter der MIT-Lizenz auf GitHub veröffentlicht.
Ein nützliches Open-Source-Tool für Entwickler zur objektiven Evaluierung von lokaler LLM-Inferenzgeschwindigkeit, Speichernutzung und deterministischer Qualität, das die Hardware-Auswahl und Modelloptimierung erleichtert.
Marktsignale zu Ollama in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- homebench ist ein Open-Source-Benchmarking-Tool zur Messung von Geschwindigkeit, Speicher und deterministischer Qualität lokaler LLMs.
- Die Standard-Qualitätssuite umfasst 31 deterministische Aufgaben (Temperatur 0, fester Seed) als gezielten Smoke-Test.
- Das Tool ermittelt den Durchsatz als Ausgabetoken geteilt durch die Generierungszeit und trennt server- und clientseitiges Timing.
- Es erfasst granulare Speichermetriken, darunter residente Modellgewichte und Peak-RSS-Stichproben.
- homebench unterstützt unter anderem Ollama, LM Studio, llama.cpp und vLLM, ist via pip installierbar und auf GitHub verfügbar.
Verknüpfte Unternehmen
2 verknüpfte Unternehmen“Works with Ollama, LM Studio, llama.cpp, vLLM, or any OpenAI-compatible server....”
“Works with Ollama, LM Studio, llama.cpp, vLLM, or any OpenAI-compatible server....”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Entwickler testet über 300 LLMs und beendet Benchmark-Projekt
Ein Entwickler hat ein Langzeit-Benchmark für Large Language Models (LLMs) anhand praxisnaher Coding-Tasks für KI-Agenten durchgeführt und dabei über 300 Modelle via OpenRouter sowie auf lokaler Hardware getestet. Das Testverfahren umfasste zehn praxisbezogene Aufgaben mit einem Limit von 400 Token, niedriger Temperature, Pattern-Matching-Scoring sowie Pre-Flight-Prüfungen zur Erkennung instabiler Endpunkte. Das öffentliche Leaderboard, das Daten zu 168 Modellen enthielt, wurde nun eingestellt: Die extrem hohe Frequenz neuer Modell-Releases, Limitationen des Test-Harnesses und eine geringe aktive Nutzung machten die kontinuierliche Pflege unrentabel. Der Autor führt Ad-hoc-Tests zwar fort und stellt die archivierten Daten bereit, argumentiert jedoch grundsätzlich, dass statische LLM-Leaderboards angesichts rasanter Modellverbesserungen extrem schnell veralten und an Relevanz verlieren.
LLM-Performance messen mit AWS Labs' LLMeter
Dieser Artikel bietet eine praxisnahe Anleitung zur Nutzung von AWS Labs' LLMeter, einer Python-basierten Benchmarking-Bibliothek für Large Language Models. Er erläutert zentrale Leistungskennzahlen wie Time to First Token (TTFT), Tokens Per Second (TPS), Time to Last Token (TTL) sowie Cost Per Request und zeigt, wie Experimente, Endpunkte und Kostenmodelle konfiguriert werden. LLMeter setzt auf modernes Python (3.10+), nutzt asyncio für parallele Client-Simulationen und empfiehlt Streaming-Endpunkte für präzise Latenzmessungen. Der Leitfaden behandelt Lasttests mit mehreren Clients, interaktive HTML-Visualisierungen auf Basis von Plotly sowie ein minimalistisches Live-Dashboard für das Echtzeit-Monitoring. Ergänzend verweist der Artikel auf das LLMeter-GitHub-Repository, ein QAInsights-Dashboard-Skript und eine Video-Anleitung.
Neun lokale LLM-Schnittstellen im Praxistest auf einer GPU
Eine praxisnahe Untersuchung evaluierte neun Schnittstellen für lokale Large Language Models auf derselben GPU über einen Zeitraum von rund zwei Wochen. Im Fokus standen dabei Zuverlässigkeit, Offload-Verhalten, Datei-I/O und Kontextverarbeitung statt reiner Tokens pro Sekunde. Die Ergebnisse zeigen erhebliche Varianzen, die primär durch die Runtime beziehungsweise das Framework statt durch die Modellgewichte verursacht werden: Ollama erwies sich als zuverlässiger Standard (32,9 Tokens/Sekunde bei einem 30B Mixture-of-Experts-Modell mit 443 Tokens/Sekunde Prefill), während llama.cpp nach gezieltem Tuning noch höhere Geschwindigkeiten erreichte. LM Studio überzeugte bei der strukturierten Datenextraktion, wohingegen andere Tools wie Unsloth deutliche Kontext-Limits aufwiesen oder wie Claude Code mangels System-Prompt-Parsing scheiterten. Der Autor schließt daraus, dass Benchmarks reale Anwendungsfälle abbilden müssen, da das Verhalten der Tools und nicht nur die Modellwahl die Praxistauglichkeit bestimmt.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
