Beobachtetes Signal · 20. Juni 2026 · Benchmark · Quelle: DEV Community · Relevanz: 3/5 · Sentiment: Positiv
GB10-Benchmark: DiffusionGemma 26B mit 32K-Kontext im Praxistest
Ein Entwickler hat technische Benchmark-Daten veröffentlicht, die den Betrieb von nvidia/diffusiongemma-26B-A4B-it-NVFP4 mittels vLLM 0.22.1rc1 auf einer NVIDIA GB10 (Grace Blackwell, 128 GB Unified Memory) evaluieren. Auf der GB10 erreichte der maximale Generierungsdurchsatz etwa 155 Tokens pro Sekunde bei 512-Token-Outputs und unterstützte erfolgreich lange Kontexte bis zu rund 32.600 Tokens bei einem Modelllimit von 32.768 und gesetztem --max-model-len=32768. Verglichen mit einem NVIDIA GH200-System fällt der rohe Durchsatz der GB10 geringer aus (etwa ein Achtel des GH200-Spitzenwerts), jedoch bietet sie eine vergleichbare maximale Kontextlänge bei deutlich niedrigeren Kosten und geringerem Energiebedarf. Zudem dokumentiert der Bericht Stolpersteine bei der Podman-Bereitstellung sowie wichtige Tuning-Optimierungen zur Vermeidung von Out-of-Memory-Fehlern.
Liefert umsetzbare Einblicke in die LLM-Inferenzleistung und Bereitstellung der neuen NVIDIA GB10-Plattform mit 32K-Kontextfähigkeit, was für Teams bei der Evaluierung von lokaler Inferenz-Hardware von Bedeutung ist.
Marktsignale zu vLLM in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Plattform: NVIDIA GB10 (Grace Blackwell) mit 128 GB Unified Memory.
- Framework: vLLM 0.22.1rc1; Modell: nvidia/diffusiongemma-26B-A4B-it-NVFP4.
- Spitzendurchsatz auf der GB10: ~155 Tokens/s (gemessen bei 512-Token-Ausgaben).
- GB10 erreichte eine maximale Nutzlänge von ~32.600 Tokens (Modelllimit 32.768) bei --max-model-len=32768.
- Bereitstellungshinweise: Podman mit --device nvidia.com/gpu=all nutzen; gpu-memory-utilization auf ~0.7 senken und --max-num-seqs limitieren, um CUDA-Graph-OOMs zu verhindern.
Verknüpfte Unternehmen
3 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Gemma 4 26B auf alter GTX 1080 mit llama.cpp ausführen
Ein Entwickler-Leitfaden demonstriert die lokale Ausführung von Googles Gemma 4 26B-A4B Mixture-of-Experts-Modell auf einer 8 GiB NVIDIA GeForce GTX 1080 mittels eines erweiterten llama.cpp-Forks (AtomicBot-ai/atomic-llama-cpp-turboquant). Die Anleitung beschreibt die Systemeinrichtung, das Erstellen des Forks mit CUDA, den Download von GGUF sowie MTP Assistant Head und die Optimierung der Offload-Parameter. Wichtige Optimierungen umfassen das Speichern der MoE-Experten-Gewichte im Host-RAM (über PCIe gestreamt), RotorQuant/TurboQuant KV-Cache für 128k Kontext sowie das Erzwingen der Assistant Embedding Table auf der GPU via --override-tensor-draft für effektives MTP Speculative Decoding. Der Autor berichtet von ca. 24,5 Tokens/Sekunde bei 128k Kontext und erläutert Speicher- und PCIe-Kompromisse.
DiffusionGemma beschleunigt LLM-Inferenz durch diskrete Diffusion
Google DeepMind hat DiffusionGemma veröffentlicht, ein Open-Weight-Sprachmodell, das Text per diskreter Diffusion anstelle der klassischen Token-für-Token-Autoregressivität generiert. Dem Bericht zufolge erreicht das Modell auf einer einzelnen H100 im Schnitt rund 20 Token pro Forward-Pass und circa 1.500 Ausgabetoken pro Sekunde, verglichen mit etwa 303 Token pro Sekunde bei einer autoregressiven Gemma-4-Baseline. DiffusionGemma entrauscht eine 256-Token-Canvas in rund zwölf Schritten und tauscht dabei einen höheren Rechenaufwand pro Schritt gegen deutlich weniger Forward-Passes ein. Das Modell arbeitet bei niedriger Concurrency und Latenz-sensitiven Workloads schneller, schneidet jedoch bei Capability-Benchmarks schwächer ab (beispielsweise AIME 2026: 69,1 gegenüber 88,3 bei Gemma 4 MTP). Zu den Einschränkungen zählen kürzere Ausgaben, gelegentliches Token-Stuttering und ein nachlassender Durchsatzvorteil bei größeren Batches. Das Modell ist unter der Apache-Lizenz verfügbar, mit Referenzunterstützung in Hugging Face Transformers und vLLM.
Gemma 4 26B auf 13 Jahre alter Xeon-CPU ausführen
Ein technisches Tutorial demonstriert, wie Googles LLM Gemma 4 26B mithilfe reiner CPU-Optimierungen auf älterer Server-Hardware betrieben werden kann. Die Anleitung nennt die Voraussetzungen wie einen Xeon-Server mit mindestens 64 GB RAM, Python 3.10+ und rund 200 GB freiem Speicherplatz. Durch den Einsatz von Hugging Face Transformers, PyTorch und einer 4-Bit-Quantisierung (load_in_4bit) sinkt der Speicherbedarf von rund 120 GB auf etwa 40 GB. Ergänzend kommen CPU-Ausführungsoptimierungen wie torch._dynamo.optimize_for_cpu und Intel-MKL-Tuning zum Einsatz. Auf einem Intel Xeon E5 v2 wurden ein RAM-Verbrauch von rund 45 GB, eine Leistung von etwa 12 Token pro Sekunde, eine Kaltstartzeit von drei bis fünf Minuten sowie eine Leistungsaufnahme von rund 150 Watt gemessen. Obwohl GPUs mit 100 bis 300 Token pro Sekunde deutlich schneller arbeiten, empfiehlt sich dieser Ansatz für Edge-Umgebungen und Proof-of-Concept-Projekte.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
