Beobachtetes Signal · 29. Aug. 2026 · Technical Release · Quelle: DEV Community · Relevanz: 3/5 · Sentiment: Neutral

Bereitstellung von Googles Gemma 4 auf AWS G5g mit purem JAX

Zusammenfassung des Signals

Ein technischer Bereitstellungsleitfaden demonstriert die Inferenz des offenen Modells Gemma 4 (google/gemma-4-E2B-it) von Google auf einer AWS EC2 G5g-Instanz mittels eines puren JAX-Stacks. Der Artikel enthält ein reproduzierbares Repository, Voraussetzungen, automatisierte Installationsschritte sowie Leistungsmessungen von rund 13 Tokens/Sekunde Decodierung auf der T4G-GPU mit purem JAX im Vergleich zu 43 Tokens/Sekunde bei einem angepassten vLLM. Zudem werden operative Aspekte wie AMI-Auswahl, Secrets Manager, SSM Run Command und S3-basierter XLA-Cache beleuchtet. Der Autor hebt die reproduzierbare Installationszeit von 117 Sekunden sowie die Abwägungen zwischen einfacher Bereitstellung und rohem Durchsatz hervor.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Praxisnaher, reproduzierbarer Leitfaden zur Bereitstellung eines modernen offenen LLM auf Arm- und CUDA-AWS-Hardware mit messbaren Kosten-Leistungs-Kompromissen; relevant für Teams, die LLM-Inferenzinfrastruktur aufbauen, jedoch nicht branchenverändernd.

SIGNAL RADAR

Marktsignale zu Google in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • Veröffentlicht am 29.08.2026.
  • Leitfaden zeigt das Serving von google/gemma-4-E2B-it auf AWS EC2 G5g (Graviton2 + NVIDIA T4G) mit purem JAX.
  • Standard-Setup nutzt g5g.2xlarge: 1 GPU, 8 vCPUs, 16 GiB RAM (T4G weist 15.360 MiB Gerätespeicher aus).
  • Cloud-init installiert jax[cuda13] und Abhängigkeiten; die gemessene Installation dauert 117 Sekunden ohne Kompilierungsschritt.
  • Gemessener Decodierungsdurchsatz für pures JAX auf T4G: ~13 tok/s (kalt 18,77s vs. warm 4,35s); vLLM auf derselben Hardware erreichte ~43 tok/s, erforderte jedoch langwierige Builds und Triton-Patches.

Verknüpfte Unternehmen

6 verknüpfte Unternehmen

“This article provides a step by step deployment guide for serving Google's Gemma 4 on an AWS EC2 G5g instance using pure JAX....”

“G5g instances pair an AWS Graviton2 (64-bit Arm) processor with NVIDIA T4G Tensor Core GPUs....”

“the engine is this repo's own Gemma 4 port driven by a JAX generation loop behind an OpenAI-compatible FastAPI server, running under systemd...”

Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: DEV Community•Veröffentlicht: 29. Aug. 2026
Ursprünglicher Berichttitel: “Pure JAX on G5g: Serving Gemma 4 on Graviton and a T4G”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Large Language Models (LLM) & AI29. Aug. 2026

Gemma 4 in Pure JAX: Erkenntnisse zur Portierung von TPU auf GPU

Ein Entwickler hat einen Gemma 4 E2B Checkpoint auf eine einheitliche Pure-JAX Codebasis portiert und auf Cloud TPU v5e/v6e sowie einer NVIDIA T4G (AWS Graviton2) ausgeführt. Während die meiste Modellcodebasis, das Caching-Verhalten und statische Formen unverändert blieben, traten zwei hardwareabhängige Probleme auf: Ein in Pallas geschriebener, für TPU-VMEM optimierter, gefuselter W4A16-Kernel lässt sich aufgrund geringerer GPU-Shared-Memory-Limits nicht auf GPUs ausführen, und die Datentyp-Auswahl für Berechnungen (float16 vs. bfloat16) muss zur Laufzeit erfolgen, um versteckte Konvertierungskosten zu vermeiden. Der Artikel dokumentiert vier Modellunregelmäßigkeiten von Gemma 4, einen KV-Ring-Padding-Bug, der zu stillen Token-Schleifen führte, gemessene Dekodierungs-Durchsätze (13,10 Token/s auf T4G) sowie Profiling-Daten, die unerwarteten Konvertierungs-Overhead auf einer Turing-GPU aufzeigen.

Signal analysieren
Large Language Models (LLM) & AI4. Apr. 2026

Gemma 4 auf Cloud Run mit Scale-to-Zero deployen

Dieser technische Leitfaden erläutert die Bereitstellung von Googles Gemma 4-Modellfamilie auf Google Cloud Run mittels vLLM und dem Run:ai Model Streamer für skalierbare, kosteneffiziente und selbst gehostete Inference. Beschrieben werden die vier Modellvarianten (E2B, E4B, 26B A4B MoE, 31B), multimodale Eingaben, verbessertes Reasoning und Function-Calling sowie die Abwägung zwischen Gewichts-Downloads von HuggingFace und dem Streaming aus Google Cloud Storage (GCS). Der Autor dokumentiert die VPC-Einrichtung, GPU-Quotenprüfungen, Upload-Schritte und vollständige gcloud-Befehle. Gemessene Kaltstart- und Warmstart-Zeiten belegen, dass GCS-Streaming mit dem Run:ai Streamer und vLLM bei großen Modellen deutlich schnellere Kaltstarts ermöglicht und Cloud Runs Scale-to-Zero untätige GPU-Kosten für Entwicklung und Tests eliminiert.

Signal analysieren
Large Language Models (LLM) & AI24. Mai 2026

Google Gemma 4 lokal auf dem Laptop ausführen

Ein praxisorientierter Entwickler-Leitfaden beschreibt, wie Googles Gemma 4 KI-Modelle mithilfe des Tools Ollama lokal auf einem Consumer-Laptop heruntergeladen und ausgeführt werden können. Der Autor erläutert verschiedene Modellgrößen wie E2B mit rund 2 GB, E4B mit etwa 4 GB sowie die 31B-Variante mit zirka 20 GB. Zudem wird ein einfacher Dreizack-Workflow demonstriert: Ollama installieren, das Modell via Terminal-Befehl starten und direkt chatten. Getestet wurde das Setup unter Windows mit 8 GB RAM und einer Nvidia GPU mit 4 GB VRAM. Der Beitrag kontrastiert die lokale Inferenz hinsichtlich Kosten und Datenschutz mit gehosteten APIs für die Production und hebt Offline-Anwendungsfälle wie den Einsatz in Regionen mit geringer Konnektivität hervor. OpenRouter wird als unkomplizierte API-Option für cloudbasierte Gemma-Zugriffe genannt.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.