Beobachtetes Signal · 11. Juni 2026 · Benchmark/Performance Test · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Positiv
MTP (Speculative Decoding) ist stark hardwareabhängig
Ein Entwickler-Benchmark zeigt, dass Speculative Decoding (MTP) den Token-Durchsatz bei LLM-Inference auf einer einzelnen RTX 3090 mit Gemma 4 12B QAT fast verdoppeln kann (1,95-fach bei n-max 3). Auf einem M1 Max verlangsamt derselbe MTP-Draft das Modell jedoch (0,87-fach). Hardwareübergreifende Ergebnisse verdeutlichen, dass der Nutzen von MTP vom Verhältnis zwischen Draft- und Verifikationskosten für die jeweilige Architektur abhängt: Leistungsfähige CUDA-GPUs verzeichnen massive Durchsatzsteigerungen, während die Balance aus Speicher und Rechenleistung bei Apple Silicon dazu führen kann, dass MTP einen Netto-Overhead erzeugt. Der Beitrag liefert reproduzierbare Einstellungen, einschließlich llama.cpp-Commit, Modelldateien sowie Befehlen für llama-server und speed_bench, und weist auf eine hohe Stabilität der 3090-Testläufe hin.
Liefert praxisnahe, reproduzierbare Belege dafür, dass Speculative Decoding (MTP) auf leistungsfähigen CUDA-GPUs hohe Geschwindigkeitsvorteile bringt, auf Apple Silicon jedoch die Performance verschlechtern kann – ein wichtiger Befehl für Ingenieure, die LLM-Inference und -Kosten optimieren.
Marktsignale zu Apple in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Gemma 4 12B QAT (UD-Q4_K_XL) mit Q8_0-MTP-Draft erreichte im Schnitt 167,4 tok/s (1,95-facher Speedup) auf einer einzelnen RTX 3090 bei n-max 3.
- MTP n-max 2 lieferte auf derselben 3090 159,4 tok/s (1,86-facher Speedup); die Draft-Akzeptanzraten lagen bei ca. 0,77 (n-max 2) und ca. 0,69 (n-max 3).
- Ein Hardwarevergleich ergab für die RTX 5070 Ti einen Speedup von ca. 1,74-fach, während der M1 Max auf 0,87-fach sank (langsamer mit MTP).
- Der Benchmark passte in rund 8 GB VRAM, und die 3090-Läufe zeigten eine geringe Varianz (CV < 0,5 %).
- Der Autor stellt Reproduktionsdetails zur Verfügung: llama.cpp-Commit e3471b3, Modelldateien von unsloth/gemma-4-12B-it-qat-GGUF sowie Befehle für llama-server und speed_bench.py.
Verknüpfte Unternehmen
3 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Gemma 4 in Pure JAX: Erkenntnisse zur Portierung von TPU auf GPU
Ein Entwickler hat einen Gemma 4 E2B Checkpoint auf eine einheitliche Pure-JAX Codebasis portiert und auf Cloud TPU v5e/v6e sowie einer NVIDIA T4G (AWS Graviton2) ausgeführt. Während die meiste Modellcodebasis, das Caching-Verhalten und statische Formen unverändert blieben, traten zwei hardwareabhängige Probleme auf: Ein in Pallas geschriebener, für TPU-VMEM optimierter, gefuselter W4A16-Kernel lässt sich aufgrund geringerer GPU-Shared-Memory-Limits nicht auf GPUs ausführen, und die Datentyp-Auswahl für Berechnungen (float16 vs. bfloat16) muss zur Laufzeit erfolgen, um versteckte Konvertierungskosten zu vermeiden. Der Artikel dokumentiert vier Modellunregelmäßigkeiten von Gemma 4, einen KV-Ring-Padding-Bug, der zu stillen Token-Schleifen führte, gemessene Dekodierungs-Durchsätze (13,10 Token/s auf T4G) sowie Profiling-Daten, die unerwarteten Konvertierungs-Overhead auf einer Turing-GPU aufzeigen.
TileRT ermöglicht ultrahohe Interaktivität auf NVIDIA GPUs
SemiAnalysis berichtet über TileRT, einen persistenten Engine-Ansatz, der einen vollständigen Decode-Graphen auf NVIDIA GPUs in einen einzigen residenten Kernel kompiliert, um die Latenz pro Token drastisch zu senken. In InferenceX-Benchmarks erreichte TileRT auf einem einzelnen B200 Decode-Server bis zu 500 Tokens/s/user (GLM5 FP8 744B) und lieferte massive Leistungssteigerungen gegenüber traditionellen GPU-Inference-Engines. TileRT wurde für latenzsensitives Decoding entwickelt und bleibt gleichzeitig mit durchsatzoptimierten Prefill-Engines wie vLLM interoperabel. Die Technologie ist bei Xiaomi und Z.ai bereits im Produktiveinsatz, unterstützt aktuell jedoch nur einen kleinen Modellkatalog und ist primär auf Batch-Size-1-Workloads ausgelegt, was den Zielkonflikt zwischen maximaler Interaktivität pro Nutzer und aggregiertem Durchsatz verdeutlicht.
Gemma 4 26B auf alter GTX 1080 mit llama.cpp ausführen
Ein Entwickler-Leitfaden demonstriert die lokale Ausführung von Googles Gemma 4 26B-A4B Mixture-of-Experts-Modell auf einer 8 GiB NVIDIA GeForce GTX 1080 mittels eines erweiterten llama.cpp-Forks (AtomicBot-ai/atomic-llama-cpp-turboquant). Die Anleitung beschreibt die Systemeinrichtung, das Erstellen des Forks mit CUDA, den Download von GGUF sowie MTP Assistant Head und die Optimierung der Offload-Parameter. Wichtige Optimierungen umfassen das Speichern der MoE-Experten-Gewichte im Host-RAM (über PCIe gestreamt), RotorQuant/TurboQuant KV-Cache für 128k Kontext sowie das Erzwingen der Assistant Embedding Table auf der GPU via --override-tensor-draft für effektives MTP Speculative Decoding. Der Autor berichtet von ca. 24,5 Tokens/Sekunde bei 128k Kontext und erläutert Speicher- und PCIe-Kompromisse.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
