Beobachtetes Signal · 29. Aug. 2026 · Technical Release · Quelle: DEV Community · Relevanz: 3/5 · Sentiment: Neutral
Bereitstellung von Googles Gemma 4 auf AWS G5g mit purem JAX
Ein technischer Bereitstellungsleitfaden demonstriert die Inferenz des offenen Modells Gemma 4 (google/gemma-4-E2B-it) von Google auf einer AWS EC2 G5g-Instanz mittels eines puren JAX-Stacks. Der Artikel enthält ein reproduzierbares Repository, Voraussetzungen, automatisierte Installationsschritte sowie Leistungsmessungen von rund 13 Tokens/Sekunde Decodierung auf der T4G-GPU mit purem JAX im Vergleich zu 43 Tokens/Sekunde bei einem angepassten vLLM. Zudem werden operative Aspekte wie AMI-Auswahl, Secrets Manager, SSM Run Command und S3-basierter XLA-Cache beleuchtet. Der Autor hebt die reproduzierbare Installationszeit von 117 Sekunden sowie die Abwägungen zwischen einfacher Bereitstellung und rohem Durchsatz hervor.
Praxisnaher, reproduzierbarer Leitfaden zur Bereitstellung eines modernen offenen LLM auf Arm- und CUDA-AWS-Hardware mit messbaren Kosten-Leistungs-Kompromissen; relevant für Teams, die LLM-Inferenzinfrastruktur aufbauen, jedoch nicht branchenverändernd.
Marktsignale zu Google in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Veröffentlicht am 29.08.2026.
- Leitfaden zeigt das Serving von google/gemma-4-E2B-it auf AWS EC2 G5g (Graviton2 + NVIDIA T4G) mit purem JAX.
- Standard-Setup nutzt g5g.2xlarge: 1 GPU, 8 vCPUs, 16 GiB RAM (T4G weist 15.360 MiB Gerätespeicher aus).
- Cloud-init installiert jax[cuda13] und Abhängigkeiten; die gemessene Installation dauert 117 Sekunden ohne Kompilierungsschritt.
- Gemessener Decodierungsdurchsatz für pures JAX auf T4G: ~13 tok/s (kalt 18,77s vs. warm 4,35s); vLLM auf derselben Hardware erreichte ~43 tok/s, erforderte jedoch langwierige Builds und Triton-Patches.
Verknüpfte Unternehmen
6 verknüpfte Unternehmen“This article provides a step by step deployment guide for serving Google's Gemma 4 on an AWS EC2 G5g instance using pure JAX....”
“G5g instances pair an AWS Graviton2 (64-bit Arm) processor with NVIDIA T4G Tensor Core GPUs....”
“G5g instances pair an AWS Graviton2 (64-bit Arm) processor with NVIDIA T4G Tensor Core GPUs....”
“A Hugging Face token with access to the Gemma weights...”
“the engine is this repo's own Gemma 4 port driven by a JAX generation loop behind an OpenAI-compatible FastAPI server, running under systemd...”
“The code is here: https://github.com/xbill9/gemma4-dev...”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Gemma 4 in Pure JAX: Erkenntnisse zur Portierung von TPU auf GPU
Ein Entwickler hat einen Gemma 4 E2B Checkpoint auf eine einheitliche Pure-JAX Codebasis portiert und auf Cloud TPU v5e/v6e sowie einer NVIDIA T4G (AWS Graviton2) ausgeführt. Während die meiste Modellcodebasis, das Caching-Verhalten und statische Formen unverändert blieben, traten zwei hardwareabhängige Probleme auf: Ein in Pallas geschriebener, für TPU-VMEM optimierter, gefuselter W4A16-Kernel lässt sich aufgrund geringerer GPU-Shared-Memory-Limits nicht auf GPUs ausführen, und die Datentyp-Auswahl für Berechnungen (float16 vs. bfloat16) muss zur Laufzeit erfolgen, um versteckte Konvertierungskosten zu vermeiden. Der Artikel dokumentiert vier Modellunregelmäßigkeiten von Gemma 4, einen KV-Ring-Padding-Bug, der zu stillen Token-Schleifen führte, gemessene Dekodierungs-Durchsätze (13,10 Token/s auf T4G) sowie Profiling-Daten, die unerwarteten Konvertierungs-Overhead auf einer Turing-GPU aufzeigen.
Gemma 4 auf Cloud Run mit Scale-to-Zero deployen
Dieser technische Leitfaden erläutert die Bereitstellung von Googles Gemma 4-Modellfamilie auf Google Cloud Run mittels vLLM und dem Run:ai Model Streamer für skalierbare, kosteneffiziente und selbst gehostete Inference. Beschrieben werden die vier Modellvarianten (E2B, E4B, 26B A4B MoE, 31B), multimodale Eingaben, verbessertes Reasoning und Function-Calling sowie die Abwägung zwischen Gewichts-Downloads von HuggingFace und dem Streaming aus Google Cloud Storage (GCS). Der Autor dokumentiert die VPC-Einrichtung, GPU-Quotenprüfungen, Upload-Schritte und vollständige gcloud-Befehle. Gemessene Kaltstart- und Warmstart-Zeiten belegen, dass GCS-Streaming mit dem Run:ai Streamer und vLLM bei großen Modellen deutlich schnellere Kaltstarts ermöglicht und Cloud Runs Scale-to-Zero untätige GPU-Kosten für Entwicklung und Tests eliminiert.
Google Gemma 4 lokal auf dem Laptop ausführen
Ein praxisorientierter Entwickler-Leitfaden beschreibt, wie Googles Gemma 4 KI-Modelle mithilfe des Tools Ollama lokal auf einem Consumer-Laptop heruntergeladen und ausgeführt werden können. Der Autor erläutert verschiedene Modellgrößen wie E2B mit rund 2 GB, E4B mit etwa 4 GB sowie die 31B-Variante mit zirka 20 GB. Zudem wird ein einfacher Dreizack-Workflow demonstriert: Ollama installieren, das Modell via Terminal-Befehl starten und direkt chatten. Getestet wurde das Setup unter Windows mit 8 GB RAM und einer Nvidia GPU mit 4 GB VRAM. Der Beitrag kontrastiert die lokale Inferenz hinsichtlich Kosten und Datenschutz mit gehosteten APIs für die Production und hebt Offline-Anwendungsfälle wie den Einsatz in Regionen mit geringer Konnektivität hervor. OpenRouter wird als unkomplizierte API-Option für cloudbasierte Gemma-Zugriffe genannt.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
