Beobachtetes Signal · 17. Juli 2026 · Technical Release · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Positiv

Portierung der Gemma-4-Modellfamilie auf AWS Inferentia2

Zusammenfassung des Signals

Der Autor hat die Google Gemma-4-Modellfamilie (E2B, E4B, 12B, 31B und 26B-A4B MoE) erfolgreich auf AWS Inferentia2 portiert und dabei modellspezifische Einschränkungen, Kompilierungs-Rezepte sowie einen wiederkehrenden Korrekturbug dokumentiert. Jedes Modell wurde so angepasst, dass es Token für Token identisch mit einer CPU-fp32-Referenz dekodiert; entsprechende Artefakte (Docker Hub-Images und Hugging Face-Repos unter xbill9) wurden veröffentlicht. Die Portierung entwickelte sich von Single-Core-Tracing (torch_neuronx.trace) über manuelle Tensor-Parallel-Aliase bis hin zu einer NxD ModelBuilder Single-Rank-Kompilierung, die für große dense (31B) und sparse MoE (26B-A4B) Konfigurationen erforderlich ist. Das multimodale Checkpoint google/gemma-4-12B-it erforderte drei gerätespezifische Fixes, wodurch eine Token-für-Token-Gleichheit bei einer Prefill-Latenz von ~101 ms und ~12 GB bf16 pro Rank auf einer einzelnen inf2.8xlarge (TP=2) erreicht wird.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Praktische, reproduzierbare Leitlinien für den Betrieb großer Gemma-4-Modelle auf AWS Inferentia2 sowie ein ausgereiftes Kompilierungs-Rezept (Single-Rank ModelBuilder) für Dense-31B- und Sparse-MoE-Deployments, die für Ingenieure bei LLM-Inference-Workloads von hohem Nutzen sind.

SIGNAL RADAR

Marktsignale zu Hugging Face in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • Portierung der Gemma-4-Familie (E2B, E4B, 12B, 31B, 26B-A4B) auf AWS Inferentia2; Veröffentlichung von Docker Hub-Images und Hugging Face-Repos unter xbill9.
  • Alle fünf Modelle dekodieren in den Tests des Autors Token für Token identisch zu einer CPU-fp32-Referenz.
  • Entwicklung der Kompilierungs-Rezepte: torch_neuronx.trace zu tp_alias bis hin zu NxD ModelBuilder, welcher für die 31B- und 26B-A4B-MoE-Modelle zwingend erforderlich war.
  • Das Modell google/gemma-4-12B-it erforderte drei Device-Fixes (korrektes nkv=1 Global Attention Sharding, Deaktivierung des On-Device Logits Softcap, Erzwingen von Eager Attention zur Vermeidung eines SBUF-Overflows) und läuft auf einer einzelnen inf2.8xlarge (TP=2) mit ~101 ms Prefill und ~12 GB bf16 pro Rank.
  • Das Modell 26B-A4B ist eine MoE mit 128 Experten und Top-8-Routing; es aktiviert ~4B Parameter, aber alle 128 Experten (~49 GB) verbleiben im Speicher, was ein entsprechendes Memory-Budgeting erfordert.
Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: DEV Community•Veröffentlicht: 17. Juli 2026
Ursprünglicher Berichttitel: “Five Gemma-4 models, one accelerator: what porting E2B 31B to AWS Inferentia2 taught me”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Large Language Models (LLM) & AI29. Aug. 2026

Gemma 4 in Pure JAX: Erkenntnisse zur Portierung von TPU auf GPU

Ein Entwickler hat einen Gemma 4 E2B Checkpoint auf eine einheitliche Pure-JAX Codebasis portiert und auf Cloud TPU v5e/v6e sowie einer NVIDIA T4G (AWS Graviton2) ausgeführt. Während die meiste Modellcodebasis, das Caching-Verhalten und statische Formen unverändert blieben, traten zwei hardwareabhängige Probleme auf: Ein in Pallas geschriebener, für TPU-VMEM optimierter, gefuselter W4A16-Kernel lässt sich aufgrund geringerer GPU-Shared-Memory-Limits nicht auf GPUs ausführen, und die Datentyp-Auswahl für Berechnungen (float16 vs. bfloat16) muss zur Laufzeit erfolgen, um versteckte Konvertierungskosten zu vermeiden. Der Artikel dokumentiert vier Modellunregelmäßigkeiten von Gemma 4, einen KV-Ring-Padding-Bug, der zu stillen Token-Schleifen führte, gemessene Dekodierungs-Durchsätze (13,10 Token/s auf T4G) sowie Profiling-Daten, die unerwarteten Konvertierungs-Overhead auf einer Turing-GPU aufzeigen.

Signal analysieren
Large Language Models (LLM) & AI21. Mai 2026

Gemma 4 ermöglicht lokale multimodale Workflows mit langem Kontext

Ein Entwickler berichtet über die Ablösung fragmentierter OCR- und RAG-Stacks durch lokale Gemma-4-Modelle, wodurch kohärente, datenschutzkonforme On-Device-Multimodalität auf Consumer-Hardware praktikabel wird. Mit dem Ollama Python SDK und lokalen Inferenz-Setups erzielen die 26B-MoE- und 31B-Dense-Varianten von Gemma 4 eine Extraktionsgenauigkeit von ca. 94 Prozent bei komplexen Belegen direkt über Pixel-Layouts ohne separates OCR. Dank des nativen 128K-Kontextfensters konnte ein kontinuierlicher Log-Stream von 115K Tokens in rund 70 Sekunden analysiert werden, was zeitliche Kohärenz gegenüber gestückeltem RAG beweist. Die Tests erfolgten auf einem M1 MacBook Pro mit 16 GB RAM. Der Beitrag beleuchtet empfohlene Budgets, Grenzen wie Wissensgrenzkanten sowie Echtzeitlatenzen und verweist auf offizielle Google-Entwicklerressourcen. Veröffentlichungsdatum: 21.05.2026.

Signal analysieren
Large Language Models (LLM) & AI24. Mai 2026

Gemma 4 26B auf alter GTX 1080 mit llama.cpp ausführen

Ein Entwickler-Leitfaden demonstriert die lokale Ausführung von Googles Gemma 4 26B-A4B Mixture-of-Experts-Modell auf einer 8 GiB NVIDIA GeForce GTX 1080 mittels eines erweiterten llama.cpp-Forks (AtomicBot-ai/atomic-llama-cpp-turboquant). Die Anleitung beschreibt die Systemeinrichtung, das Erstellen des Forks mit CUDA, den Download von GGUF sowie MTP Assistant Head und die Optimierung der Offload-Parameter. Wichtige Optimierungen umfassen das Speichern der MoE-Experten-Gewichte im Host-RAM (über PCIe gestreamt), RotorQuant/TurboQuant KV-Cache für 128k Kontext sowie das Erzwingen der Assistant Embedding Table auf der GPU via --override-tensor-draft für effektives MTP Speculative Decoding. Der Autor berichtet von ca. 24,5 Tokens/Sekunde bei 128k Kontext und erläutert Speicher- und PCIe-Kompromisse.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.