Beobachtetes Signal · 11. Juni 2026 · Benchmark/Performance Test · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Positiv

MTP (Speculative Decoding) ist stark hardwareabhängig

Zusammenfassung des Signals

Ein Entwickler-Benchmark zeigt, dass Speculative Decoding (MTP) den Token-Durchsatz bei LLM-Inference auf einer einzelnen RTX 3090 mit Gemma 4 12B QAT fast verdoppeln kann (1,95-fach bei n-max 3). Auf einem M1 Max verlangsamt derselbe MTP-Draft das Modell jedoch (0,87-fach). Hardwareübergreifende Ergebnisse verdeutlichen, dass der Nutzen von MTP vom Verhältnis zwischen Draft- und Verifikationskosten für die jeweilige Architektur abhängt: Leistungsfähige CUDA-GPUs verzeichnen massive Durchsatzsteigerungen, während die Balance aus Speicher und Rechenleistung bei Apple Silicon dazu führen kann, dass MTP einen Netto-Overhead erzeugt. Der Beitrag liefert reproduzierbare Einstellungen, einschließlich llama.cpp-Commit, Modelldateien sowie Befehlen für llama-server und speed_bench, und weist auf eine hohe Stabilität der 3090-Testläufe hin.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Liefert praxisnahe, reproduzierbare Belege dafür, dass Speculative Decoding (MTP) auf leistungsfähigen CUDA-GPUs hohe Geschwindigkeitsvorteile bringt, auf Apple Silicon jedoch die Performance verschlechtern kann – ein wichtiger Befehl für Ingenieure, die LLM-Inference und -Kosten optimieren.

SIGNAL RADAR

Marktsignale zu Apple in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • Gemma 4 12B QAT (UD-Q4_K_XL) mit Q8_0-MTP-Draft erreichte im Schnitt 167,4 tok/s (1,95-facher Speedup) auf einer einzelnen RTX 3090 bei n-max 3.
  • MTP n-max 2 lieferte auf derselben 3090 159,4 tok/s (1,86-facher Speedup); die Draft-Akzeptanzraten lagen bei ca. 0,77 (n-max 2) und ca. 0,69 (n-max 3).
  • Ein Hardwarevergleich ergab für die RTX 5070 Ti einen Speedup von ca. 1,74-fach, während der M1 Max auf 0,87-fach sank (langsamer mit MTP).
  • Der Benchmark passte in rund 8 GB VRAM, und die 3090-Läufe zeigten eine geringe Varianz (CV < 0,5 %).
  • Der Autor stellt Reproduktionsdetails zur Verfügung: llama.cpp-Commit e3471b3, Modelldateien von unsloth/gemma-4-12B-it-qat-GGUF sowie Befehle für llama-server und speed_bench.py.
Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: DEV Community•Veröffentlicht: 11. Juni 2026
Ursprünglicher Berichttitel: “MTP Isn't Always a Win: 1.95x on My 3090, but Speculative Decoding Is Hardware-Dependent”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Large Language Models (LLM) & AI29. Aug. 2026

Gemma 4 in Pure JAX: Erkenntnisse zur Portierung von TPU auf GPU

Ein Entwickler hat einen Gemma 4 E2B Checkpoint auf eine einheitliche Pure-JAX Codebasis portiert und auf Cloud TPU v5e/v6e sowie einer NVIDIA T4G (AWS Graviton2) ausgeführt. Während die meiste Modellcodebasis, das Caching-Verhalten und statische Formen unverändert blieben, traten zwei hardwareabhängige Probleme auf: Ein in Pallas geschriebener, für TPU-VMEM optimierter, gefuselter W4A16-Kernel lässt sich aufgrund geringerer GPU-Shared-Memory-Limits nicht auf GPUs ausführen, und die Datentyp-Auswahl für Berechnungen (float16 vs. bfloat16) muss zur Laufzeit erfolgen, um versteckte Konvertierungskosten zu vermeiden. Der Artikel dokumentiert vier Modellunregelmäßigkeiten von Gemma 4, einen KV-Ring-Padding-Bug, der zu stillen Token-Schleifen führte, gemessene Dekodierungs-Durchsätze (13,10 Token/s auf T4G) sowie Profiling-Daten, die unerwarteten Konvertierungs-Overhead auf einer Turing-GPU aufzeigen.

Signal analysieren
Large Language Models (LLM) & AI10. Aug. 2026

TileRT ermöglicht ultrahohe Interaktivität auf NVIDIA GPUs

SemiAnalysis berichtet über TileRT, einen persistenten Engine-Ansatz, der einen vollständigen Decode-Graphen auf NVIDIA GPUs in einen einzigen residenten Kernel kompiliert, um die Latenz pro Token drastisch zu senken. In InferenceX-Benchmarks erreichte TileRT auf einem einzelnen B200 Decode-Server bis zu 500 Tokens/s/user (GLM5 FP8 744B) und lieferte massive Leistungssteigerungen gegenüber traditionellen GPU-Inference-Engines. TileRT wurde für latenzsensitives Decoding entwickelt und bleibt gleichzeitig mit durchsatzoptimierten Prefill-Engines wie vLLM interoperabel. Die Technologie ist bei Xiaomi und Z.ai bereits im Produktiveinsatz, unterstützt aktuell jedoch nur einen kleinen Modellkatalog und ist primär auf Batch-Size-1-Workloads ausgelegt, was den Zielkonflikt zwischen maximaler Interaktivität pro Nutzer und aggregiertem Durchsatz verdeutlicht.

Signal analysieren
Large Language Models (LLM) & AI24. Mai 2026

Gemma 4 26B auf alter GTX 1080 mit llama.cpp ausführen

Ein Entwickler-Leitfaden demonstriert die lokale Ausführung von Googles Gemma 4 26B-A4B Mixture-of-Experts-Modell auf einer 8 GiB NVIDIA GeForce GTX 1080 mittels eines erweiterten llama.cpp-Forks (AtomicBot-ai/atomic-llama-cpp-turboquant). Die Anleitung beschreibt die Systemeinrichtung, das Erstellen des Forks mit CUDA, den Download von GGUF sowie MTP Assistant Head und die Optimierung der Offload-Parameter. Wichtige Optimierungen umfassen das Speichern der MoE-Experten-Gewichte im Host-RAM (über PCIe gestreamt), RotorQuant/TurboQuant KV-Cache für 128k Kontext sowie das Erzwingen der Assistant Embedding Table auf der GPU via --override-tensor-draft für effektives MTP Speculative Decoding. Der Autor berichtet von ca. 24,5 Tokens/Sekunde bei 128k Kontext und erläutert Speicher- und PCIe-Kompromisse.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.