Beobachtetes Signal · 20. Juni 2026 · Benchmark · Quelle: DEV Community · Relevanz: 3/5 · Sentiment: Positiv

GB10-Benchmark: DiffusionGemma 26B mit 32K-Kontext im Praxistest

Zusammenfassung des Signals

Ein Entwickler hat technische Benchmark-Daten veröffentlicht, die den Betrieb von nvidia/diffusiongemma-26B-A4B-it-NVFP4 mittels vLLM 0.22.1rc1 auf einer NVIDIA GB10 (Grace Blackwell, 128 GB Unified Memory) evaluieren. Auf der GB10 erreichte der maximale Generierungsdurchsatz etwa 155 Tokens pro Sekunde bei 512-Token-Outputs und unterstützte erfolgreich lange Kontexte bis zu rund 32.600 Tokens bei einem Modelllimit von 32.768 und gesetztem --max-model-len=32768. Verglichen mit einem NVIDIA GH200-System fällt der rohe Durchsatz der GB10 geringer aus (etwa ein Achtel des GH200-Spitzenwerts), jedoch bietet sie eine vergleichbare maximale Kontextlänge bei deutlich niedrigeren Kosten und geringerem Energiebedarf. Zudem dokumentiert der Bericht Stolpersteine bei der Podman-Bereitstellung sowie wichtige Tuning-Optimierungen zur Vermeidung von Out-of-Memory-Fehlern.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Liefert umsetzbare Einblicke in die LLM-Inferenzleistung und Bereitstellung der neuen NVIDIA GB10-Plattform mit 32K-Kontextfähigkeit, was für Teams bei der Evaluierung von lokaler Inferenz-Hardware von Bedeutung ist.

SIGNAL RADAR

Marktsignale zu vLLM in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • Plattform: NVIDIA GB10 (Grace Blackwell) mit 128 GB Unified Memory.
  • Framework: vLLM 0.22.1rc1; Modell: nvidia/diffusiongemma-26B-A4B-it-NVFP4.
  • Spitzendurchsatz auf der GB10: ~155 Tokens/s (gemessen bei 512-Token-Ausgaben).
  • GB10 erreichte eine maximale Nutzlänge von ~32.600 Tokens (Modelllimit 32.768) bei --max-model-len=32768.
  • Bereitstellungshinweise: Podman mit --device nvidia.com/gpu=all nutzen; gpu-memory-utilization auf ~0.7 senken und --max-num-seqs limitieren, um CUDA-Graph-OOMs zu verhindern.
Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: DEV Community•Veröffentlicht: 20. Juni 2026
Ursprünglicher Berichttitel: “GB10 實測 DiffusionGemma 26B 挑戰 32K 極限”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Large Language Models (LLM) & AI24. Mai 2026

Gemma 4 26B auf alter GTX 1080 mit llama.cpp ausführen

Ein Entwickler-Leitfaden demonstriert die lokale Ausführung von Googles Gemma 4 26B-A4B Mixture-of-Experts-Modell auf einer 8 GiB NVIDIA GeForce GTX 1080 mittels eines erweiterten llama.cpp-Forks (AtomicBot-ai/atomic-llama-cpp-turboquant). Die Anleitung beschreibt die Systemeinrichtung, das Erstellen des Forks mit CUDA, den Download von GGUF sowie MTP Assistant Head und die Optimierung der Offload-Parameter. Wichtige Optimierungen umfassen das Speichern der MoE-Experten-Gewichte im Host-RAM (über PCIe gestreamt), RotorQuant/TurboQuant KV-Cache für 128k Kontext sowie das Erzwingen der Assistant Embedding Table auf der GPU via --override-tensor-draft für effektives MTP Speculative Decoding. Der Autor berichtet von ca. 24,5 Tokens/Sekunde bei 128k Kontext und erläutert Speicher- und PCIe-Kompromisse.

Signal analysieren
Large Language Models (LLM) & AI4. Aug. 2026

DiffusionGemma beschleunigt LLM-Inferenz durch diskrete Diffusion

Google DeepMind hat DiffusionGemma veröffentlicht, ein Open-Weight-Sprachmodell, das Text per diskreter Diffusion anstelle der klassischen Token-für-Token-Autoregressivität generiert. Dem Bericht zufolge erreicht das Modell auf einer einzelnen H100 im Schnitt rund 20 Token pro Forward-Pass und circa 1.500 Ausgabetoken pro Sekunde, verglichen mit etwa 303 Token pro Sekunde bei einer autoregressiven Gemma-4-Baseline. DiffusionGemma entrauscht eine 256-Token-Canvas in rund zwölf Schritten und tauscht dabei einen höheren Rechenaufwand pro Schritt gegen deutlich weniger Forward-Passes ein. Das Modell arbeitet bei niedriger Concurrency und Latenz-sensitiven Workloads schneller, schneidet jedoch bei Capability-Benchmarks schwächer ab (beispielsweise AIME 2026: 69,1 gegenüber 88,3 bei Gemma 4 MTP). Zu den Einschränkungen zählen kürzere Ausgaben, gelegentliches Token-Stuttering und ein nachlassender Durchsatzvorteil bei größeren Batches. Das Modell ist unter der Apache-Lizenz verfügbar, mit Referenzunterstützung in Hugging Face Transformers und vLLM.

Signal analysieren
Large Language Models (LLM) & AI16. Juli 2026

Gemma 4 26B auf 13 Jahre alter Xeon-CPU ausführen

Ein technisches Tutorial demonstriert, wie Googles LLM Gemma 4 26B mithilfe reiner CPU-Optimierungen auf älterer Server-Hardware betrieben werden kann. Die Anleitung nennt die Voraussetzungen wie einen Xeon-Server mit mindestens 64 GB RAM, Python 3.10+ und rund 200 GB freiem Speicherplatz. Durch den Einsatz von Hugging Face Transformers, PyTorch und einer 4-Bit-Quantisierung (load_in_4bit) sinkt der Speicherbedarf von rund 120 GB auf etwa 40 GB. Ergänzend kommen CPU-Ausführungsoptimierungen wie torch._dynamo.optimize_for_cpu und Intel-MKL-Tuning zum Einsatz. Auf einem Intel Xeon E5 v2 wurden ein RAM-Verbrauch von rund 45 GB, eine Leistung von etwa 12 Token pro Sekunde, eine Kaltstartzeit von drei bis fünf Minuten sowie eine Leistungsaufnahme von rund 150 Watt gemessen. Obwohl GPUs mit 100 bis 300 Token pro Sekunde deutlich schneller arbeiten, empfiehlt sich dieser Ansatz für Edge-Umgebungen und Proof-of-Concept-Projekte.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.