Beobachtetes Signal · 19. Apr. 2026 · Technical Release · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Positiv
Gemma 4 auf Raspberry Pi mit TurboQuant ausführen
Ein Entwickler-Leitfaden demonstriert, wie ein autonomer OpenClaw-Agent auf einem Raspberry Pi 4B (8 GB) betrieben wird, indem ein TurboQuant-fähiger Fork von llama.cpp kompiliert wird, um Gemma 4 (Q4_K_M-Quantisierung) lokal zu hosten. Der Beitrag dokumentiert Hardware- und Betriebssystem-Empfehlungen wie SSD-Boot, Swap-Erhöhung und Kühlung, Build-Schritte inklusive NEON-Beschleunigung und TurboQuant-KV-Cache-Branch, die Modellbeschaffung über Hugging Face (gemma-4-E2B-it Q4_K_M) sowie Laufzeit-Flags wie --cache-type-k turbo4 und Flash Attention. Es wird gezeigt, wie das lokale Modell via llama-server als OpenAI-kompatible API für OpenClaw bereitgestellt wird, ergänzt durch optionalen Fernzugriff via Tailscale und ein hybrides Fallback auf die Google Gemini API für komplexere Aufgaben. Der Autor beschreibt zudem die Steuerung des Agenten mittels eines KheAi Protocol System-Prompts für zielorientiertes Verhalten.
Liefert eine praxisnahe, reproduzierbare Methode zur Ausführung eines quantisierten LLMs und Agenten-Frameworks am Edge, senkt Hardware-Barrieren für private und lokale Agenten-Deployments und demonstriert Edge-to-Cloud-Architekturen für KI-Operationen.
Marktsignale zu Raspberry Pi in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Autor betrieb einen autonomen OpenClaw-Agenten auf einem Raspberry Pi 4B (8 GB RAM) mit Boot von einer 120-GB-SSD.
- Kompilierung eines Community-Forks von llama.cpp (llama-cpp-turboquant) mit TurboQuant-KV-Cache-Kompprimierung und NEON-Beschleunigung zur Ausführung von Gemma 4 auf ARMv8.
- Nutzung des Gemma 4 E2B-Modells im quantisierten GGUF-Format (gemma-4-E2B-it-Q4_K_M.gguf) als lokale LLM-Gewichte.
- Laufzeit-Flags --cache-type-k turbo4 und --cache-type-v turbo4 sowie Flash Attention (-fa) komprimieren den KV-Cache und reduzieren die RAM-Nutzung bei langen Kontexten.
- Bereitstellung des Modells über llama-server auf Port 8080 als OpenAI-kompatibles Backend für OpenClaw; optionaler Fernzugriff über Tailscale und hybrides Fallback auf Google Gemini API beschrieben.
Verknüpfte Unternehmen
3 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Edge-Autonomie-Agent: Gemma 4 auf Raspberry Pi 4B
Eine technische Schritt-für-Schritt-Anleitung zeigt, wie sich ein lokaler, autonomer KI-Agent auf einem Raspberry Pi 4B (8 GB RAM, SSD-Boot) betreiben lässt. Durch die Kombination von OpenClaw mit Gemma 4 E2B (Q4_K_M) und einem Community-Fork von llama.cpp mit TurboQuant KV-Cache-Kompression wird Edge-Inferenz ermöglicht. Der Autor beschreibt detailliert die Hardware- und Betriebssystemoptimierung, die Kompilierung von llama.cpp auf ARMv8 (NEON) sowie den Betrieb von llama-server als OpenAI-kompatibles Backend. Zudem wird erklärt, wie OpenClaw angebunden, das KheAi Protocol OODA-Persona angewendet und Tailscale für sicheren Remote-Zugriff genutzt wird. Für rechenintensive Aufgaben ist optional ein hybrides Routing zur Google Gemini API vorgesehen.
Gemma 4 26B auf alter GTX 1080 mit llama.cpp ausführen
Ein Entwickler-Leitfaden demonstriert die lokale Ausführung von Googles Gemma 4 26B-A4B Mixture-of-Experts-Modell auf einer 8 GiB NVIDIA GeForce GTX 1080 mittels eines erweiterten llama.cpp-Forks (AtomicBot-ai/atomic-llama-cpp-turboquant). Die Anleitung beschreibt die Systemeinrichtung, das Erstellen des Forks mit CUDA, den Download von GGUF sowie MTP Assistant Head und die Optimierung der Offload-Parameter. Wichtige Optimierungen umfassen das Speichern der MoE-Experten-Gewichte im Host-RAM (über PCIe gestreamt), RotorQuant/TurboQuant KV-Cache für 128k Kontext sowie das Erzwingen der Assistant Embedding Table auf der GPU via --override-tensor-draft für effektives MTP Speculative Decoding. Der Autor berichtet von ca. 24,5 Tokens/Sekunde bei 128k Kontext und erläutert Speicher- und PCIe-Kompromisse.
Quantisierung von Gemma 4 auf dem Mac mit llama.cpp
Ein technischer Leitfaden zeigt, wie Googles Gemma 4 LLM auf macOS mithilfe des Community-Projekts llama.cpp ausgeführt und quantisiert werden kann. Die Anleitung behandelt das Erstellen von llama.cpp mit Metal (GGML_METAL), das Einrichten einer Python-Umgebung mit den erforderlichen Paketen (torch, transformers, gguf, huggingface_hub, sentencepiece, protobuf) sowie das Herladen des Hugging Face Modells google/gemma-4-E4B-it. Weitere Schritte umfassen die Konvertierung von safetensors in das GGUF-Format (BF16), die Quantisierung auf Q4_K_M mit llama-quantize und das Starten des Modells über die llama-cli. Der Beitrag enthält Beispielbefehle, eine kurze interaktive Session zur Demonstration von Antworten und Durchsatzmetriken sowie den Hinweis, dass sich das Modell als von Google DeepMind entwickeltes Gemma 4 ausgibt.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
