Beobachtetes Signal · 24. Mai 2026 · Technical Guide · Quelle: DEV Community · Relevanz: 3/5 · Sentiment: Positiv
Gemma 4 26B auf alter GTX 1080 mit llama.cpp ausführen
Ein Entwickler-Leitfaden demonstriert die lokale Ausführung von Googles Gemma 4 26B-A4B Mixture-of-Experts-Modell auf einer 8 GiB NVIDIA GeForce GTX 1080 mittels eines erweiterten llama.cpp-Forks (AtomicBot-ai/atomic-llama-cpp-turboquant). Die Anleitung beschreibt die Systemeinrichtung, das Erstellen des Forks mit CUDA, den Download von GGUF sowie MTP Assistant Head und die Optimierung der Offload-Parameter. Wichtige Optimierungen umfassen das Speichern der MoE-Experten-Gewichte im Host-RAM (über PCIe gestreamt), RotorQuant/TurboQuant KV-Cache für 128k Kontext sowie das Erzwingen der Assistant Embedding Table auf der GPU via --override-tensor-draft für effektives MTP Speculative Decoding. Der Autor berichtet von ca. 24,5 Tokens/Sekunde bei 128k Kontext und erläutert Speicher- und PCIe-Kompromisse.
Liefert praxisnahe, reproduzierbare Techniken zum Betrieb eines großen MoE LLM (Gemma 4) auf weit verbreiteter Low-VRAM-Hardware und senkt Barrieren für die lokale Inferenz. Dies informiert über Infrastruktur-Kompromisse zwischen PCIe, VRAM, quantisierten KV-Caches und Speculative Decoding für Teams, die On-Prem- oder Edge-LLMs einsetzen.
Marktsignale zu NVIDIA in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Gemma 4 26B-A4B ist ein Mixture-of-Experts-Modell mit 25,2B Gesamtparametern und ca. 3,8B aktiven Parametern pro Token (30 Layer, trainierter Kontext 256K).
- Unter Verwendung von AtomicBot-ai/atomic-llama-cpp-turboquant und einer NVIDIA GeForce GTX 1080 (8 GiB VRAM) erreichte der Autor ca. 24,5 Tokens/Sekunde bei 128k Kontext.
- RotorQuant / TurboQuant KV-Cache plus das Auslagern der meisten MoE-Experten in den Host-RAM ermöglichen 128k Kontext auf 8 GiB VRAM.
- Der Assistant MTP Head erforderte das Erzwingen des verknüpften Embedding-Tensors auf die GPU mittels --override-tensor-draft "token_embd\.weight=CUDA0", um große PCIe-Transfers zu vermeiden.
- Die optimale Konfiguration auf dieser Hardware nutzte --n-cpu-moe 21 (mit MTP) — --n-cpu-moe 20 führt bei 128k Kontext zu Out-of-Memory (OOM).
Verknüpfte Unternehmen
2 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Quantisierung von Gemma 4 auf dem Mac mit llama.cpp
Ein technischer Leitfaden zeigt, wie Googles Gemma 4 LLM auf macOS mithilfe des Community-Projekts llama.cpp ausgeführt und quantisiert werden kann. Die Anleitung behandelt das Erstellen von llama.cpp mit Metal (GGML_METAL), das Einrichten einer Python-Umgebung mit den erforderlichen Paketen (torch, transformers, gguf, huggingface_hub, sentencepiece, protobuf) sowie das Herladen des Hugging Face Modells google/gemma-4-E4B-it. Weitere Schritte umfassen die Konvertierung von safetensors in das GGUF-Format (BF16), die Quantisierung auf Q4_K_M mit llama-quantize und das Starten des Modells über die llama-cli. Der Beitrag enthält Beispielbefehle, eine kurze interaktive Session zur Demonstration von Antworten und Durchsatzmetriken sowie den Hinweis, dass sich das Modell als von Google DeepMind entwickeltes Gemma 4 ausgibt.
Gemma 4 auf Raspberry Pi mit TurboQuant ausführen
Ein Entwickler-Leitfaden demonstriert, wie ein autonomer OpenClaw-Agent auf einem Raspberry Pi 4B (8 GB) betrieben wird, indem ein TurboQuant-fähiger Fork von llama.cpp kompiliert wird, um Gemma 4 (Q4_K_M-Quantisierung) lokal zu hosten. Der Beitrag dokumentiert Hardware- und Betriebssystem-Empfehlungen wie SSD-Boot, Swap-Erhöhung und Kühlung, Build-Schritte inklusive NEON-Beschleunigung und TurboQuant-KV-Cache-Branch, die Modellbeschaffung über Hugging Face (gemma-4-E2B-it Q4_K_M) sowie Laufzeit-Flags wie --cache-type-k turbo4 und Flash Attention. Es wird gezeigt, wie das lokale Modell via llama-server als OpenAI-kompatible API für OpenClaw bereitgestellt wird, ergänzt durch optionalen Fernzugriff via Tailscale und ein hybrides Fallback auf die Google Gemini API für komplexere Aufgaben. Der Autor beschreibt zudem die Steuerung des Agenten mittels eines KheAi Protocol System-Prompts für zielorientiertes Verhalten.
Gemma 4 26B auf 13 Jahre alter Xeon-CPU ausführen
Ein technisches Tutorial demonstriert, wie Googles LLM Gemma 4 26B mithilfe reiner CPU-Optimierungen auf älterer Server-Hardware betrieben werden kann. Die Anleitung nennt die Voraussetzungen wie einen Xeon-Server mit mindestens 64 GB RAM, Python 3.10+ und rund 200 GB freiem Speicherplatz. Durch den Einsatz von Hugging Face Transformers, PyTorch und einer 4-Bit-Quantisierung (load_in_4bit) sinkt der Speicherbedarf von rund 120 GB auf etwa 40 GB. Ergänzend kommen CPU-Ausführungsoptimierungen wie torch._dynamo.optimize_for_cpu und Intel-MKL-Tuning zum Einsatz. Auf einem Intel Xeon E5 v2 wurden ein RAM-Verbrauch von rund 45 GB, eine Leistung von etwa 12 Token pro Sekunde, eine Kaltstartzeit von drei bis fünf Minuten sowie eine Leistungsaufnahme von rund 150 Watt gemessen. Obwohl GPUs mit 100 bis 300 Token pro Sekunde deutlich schneller arbeiten, empfiehlt sich dieser Ansatz für Edge-Umgebungen und Proof-of-Concept-Projekte.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
