Beobachtetes Signal · 29. Aug. 2026 · Technical Release · Quelle: DEV Community · Relevanz: 3/5 · Sentiment: Positiv

Gemma 4 in Pure JAX: Erkenntnisse zur Portierung von TPU auf GPU

Zusammenfassung des Signals

Ein Entwickler hat einen Gemma 4 E2B Checkpoint auf eine einheitliche Pure-JAX Codebasis portiert und auf Cloud TPU v5e/v6e sowie einer NVIDIA T4G (AWS Graviton2) ausgeführt. Während die meiste Modellcodebasis, das Caching-Verhalten und statische Formen unverändert blieben, traten zwei hardwareabhängige Probleme auf: Ein in Pallas geschriebener, für TPU-VMEM optimierter, gefuselter W4A16-Kernel lässt sich aufgrund geringerer GPU-Shared-Memory-Limits nicht auf GPUs ausführen, und die Datentyp-Auswahl für Berechnungen (float16 vs. bfloat16) muss zur Laufzeit erfolgen, um versteckte Konvertierungskosten zu vermeiden. Der Artikel dokumentiert vier Modellunregelmäßigkeiten von Gemma 4, einen KV-Ring-Padding-Bug, der zu stillen Token-Schleifen führte, gemessene Dekodierungs-Durchsätze (13,10 Token/s auf T4G) sowie Profiling-Daten, die unerwarteten Konvertierungs-Overhead auf einer Turing-GPU aufzeigen.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Liefert umsetzbare, gemessene Einblicke zur LLM-Inferenz-Portabilität zwischen TPU- und GPU-Hardware (Inkompatibilitäten beim Kernel-Speichermodell, Laufzeit-Datentyp-Auswahl und Leistungsprofile), die für Teams bei der Bereitstellung von Foundation-Model-Inferenz von großer Bedeutung sind.

SIGNAL RADAR

Marktsignale zu NVIDIA in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • Eine einheitliche Pure-JAX Gemma 4 Portierung wurde auf Cloud TPU v5e, Cloud TPU v6e und einer NVIDIA T4G mit AWS Graviton2-Host ausgeführt.
  • Gemma 4 E2B erfordert vier nicht-standardmäßige Anpassungen: zwei Attention-Head-Dimensionen (256 und 512), 8:1 MQA, eine KV-Share-Map (35 Layer auf 15 Caches reduziert) sowie einen 512-Slot Sliding Ring mit einer 4,70 GB großen Embedding-Tabelle pro Layer.
  • Ein in Pallas implementierter, gefuselter W4A16-Kernel ist für TPU-VMEM (16 MB/Kern) getiled und kann auf GPUs nicht ausgeführt werden, da der GPU-Shared-Memory pro Block um Größenordnungen kleiner ist.
  • Die Portierung muss die Rechenfähigkeit des Geräts zur Laufzeit erkennen und den Datentyp bestimmen (float16 vs. bfloat16); auf einer Turing-GPU dominierte die Datentyp-Konvertierung die Laufzeit (ca. 54 % der Dekodierungszeit).
  • Gemessener Dekodierungs-Durchsatz: 13,10 Token/Sekunde auf der NVIDIA T4G; Weights Resident betrugen ca. 6,155 GB.
Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: DEV Community•Veröffentlicht: 29. Aug. 2026
Ursprünglicher Berichttitel: “Gemma 4 in Pure JAX: What Ports from TPU to GPU, and What Doesn't”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Large Language Models (LLM) & AI29. Juli 2026

Ein TPU-Chip, acht Agenten: Serving von LLM-Workloads mit reinem JAX

Ein Ingenieur hat einen reinen JAX-Serving-Pfad implementiert, um einen quantization-aware-trained (QAT) Gemma-4-E2B-Checkpoint auf einem einzelnen Cloud TPU v6e auszuführen, da vLLM diesen QAT-Export auf TPUs nicht laden konnte. Die Lösung umfasst einen Safetensors-zu-JAX-Loader sowie einen JAX-Decode-Kernel, der eine Kernel-Decode-Rate von bis zu ~2.888 tok/s (int4/int8-Pfad mit Buffer Donation) erreichte. Bei 32 GB HBM-Kapazität des v6e-Chips belegen acht 8K-Kontexte samt quantisierten Gewichten lediglich rund 7,77 GB. Da dem experimentellen Server jedoch Kernfunktionen wie Prefix Caching, Continuous Batching und schemagesteuertes Decoding fehlen, lag der End-to-End-HTTP-Durchsatz ohne Batching nur bei ~139–143 aggregierten tok/s mit steigender Latenz unter Last. Es handelt sich um eine funktionale Machbarkeitsstudie für spezifische QAT-Workloads, jedoch noch nicht um einen vollwertigen vLLM-Ersatz für den Produktivbetrieb.

Signal analysieren
Large Language Models (LLM) & AI29. Aug. 2026

Bereitstellung von Googles Gemma 4 auf AWS G5g mit purem JAX

Ein technischer Bereitstellungsleitfaden demonstriert die Inferenz des offenen Modells Gemma 4 (google/gemma-4-E2B-it) von Google auf einer AWS EC2 G5g-Instanz mittels eines puren JAX-Stacks. Der Artikel enthält ein reproduzierbares Repository, Voraussetzungen, automatisierte Installationsschritte sowie Leistungsmessungen von rund 13 Tokens/Sekunde Decodierung auf der T4G-GPU mit purem JAX im Vergleich zu 43 Tokens/Sekunde bei einem angepassten vLLM. Zudem werden operative Aspekte wie AMI-Auswahl, Secrets Manager, SSM Run Command und S3-basierter XLA-Cache beleuchtet. Der Autor hebt die reproduzierbare Installationszeit von 117 Sekunden sowie die Abwägungen zwischen einfacher Bereitstellung und rohem Durchsatz hervor.

Signal analysieren
Large Language Models (LLM) & AI24. Mai 2026

Gemma 4 26B auf alter GTX 1080 mit llama.cpp ausführen

Ein Entwickler-Leitfaden demonstriert die lokale Ausführung von Googles Gemma 4 26B-A4B Mixture-of-Experts-Modell auf einer 8 GiB NVIDIA GeForce GTX 1080 mittels eines erweiterten llama.cpp-Forks (AtomicBot-ai/atomic-llama-cpp-turboquant). Die Anleitung beschreibt die Systemeinrichtung, das Erstellen des Forks mit CUDA, den Download von GGUF sowie MTP Assistant Head und die Optimierung der Offload-Parameter. Wichtige Optimierungen umfassen das Speichern der MoE-Experten-Gewichte im Host-RAM (über PCIe gestreamt), RotorQuant/TurboQuant KV-Cache für 128k Kontext sowie das Erzwingen der Assistant Embedding Table auf der GPU via --override-tensor-draft für effektives MTP Speculative Decoding. Der Autor berichtet von ca. 24,5 Tokens/Sekunde bei 128k Kontext und erläutert Speicher- und PCIe-Kompromisse.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.