Beobachtetes Signal · 28. Mai 2026 · Technical Release · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Neutral

Quantisierung von Gemma 4 auf dem Mac mit llama.cpp

Zusammenfassung des Signals

Ein technischer Leitfaden zeigt, wie Googles Gemma 4 LLM auf macOS mithilfe des Community-Projekts llama.cpp ausgeführt und quantisiert werden kann. Die Anleitung behandelt das Erstellen von llama.cpp mit Metal (GGML_METAL), das Einrichten einer Python-Umgebung mit den erforderlichen Paketen (torch, transformers, gguf, huggingface_hub, sentencepiece, protobuf) sowie das Herladen des Hugging Face Modells google/gemma-4-E4B-it. Weitere Schritte umfassen die Konvertierung von safetensors in das GGUF-Format (BF16), die Quantisierung auf Q4_K_M mit llama-quantize und das Starten des Modells über die llama-cli. Der Beitrag enthält Beispielbefehle, eine kurze interaktive Session zur Demonstration von Antworten und Durchsatzmetriken sowie den Hinweis, dass sich das Modell als von Google DeepMind entwickeltes Gemma 4 ausgibt.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Praktisches Community-Tutorial, das die lokale Inferenz und Quantisierung eines großen LLM (Gemma 4) ermöglicht; nützlich für Ingenieure, die mit On-Device- oder kostengünstiger Inferenz experimentieren, stellt jedoch keine branchenweite Richtlinie oder Plattformankündigung dar.

SIGNAL RADAR

Marktsignale zu Google DeepMind in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • Das Tutorial erstellt llama.cpp aus ggml-org/llama.cpp mit CMake, aktiviert GGML_METAL und deaktiviert LLAMA_CURL.
  • Zu den gelisteten Python-Umgebungsabhängigkeiten gehören torch>=2.9, transformers>=4.45, sentencepiece, protobuf>=4.21,<5.0, gguf>=0.19 und huggingface_hub.
  • Das in der Anleitung heruntergeladene Hugging Face Modell ist google/gemma-4-E4B-it.
  • Die Anleitung konvertiert model.safetensors mittels convert_hf_to_gguf.py in eine GGUF-BF16-Datei und quantisiert sie dann mit llama-quantize nach Q4_K_M.
  • Das quantisierte Modell wird mit llama-cli ausgeführt; ein Beispiel-Prompt zeigt interaktive Antworten und gemessene Durchsätze (z. B. Prompt: 42,9 t/s | Generation: 40,0 t/s).

Ontologie & Marktkonzepte

Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: DEV Community•Veröffentlicht: 28. Mai 2026

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Large Language Models (LLM) & AI24. Mai 2026

Gemma 4 26B auf alter GTX 1080 mit llama.cpp ausführen

Ein Entwickler-Leitfaden demonstriert die lokale Ausführung von Googles Gemma 4 26B-A4B Mixture-of-Experts-Modell auf einer 8 GiB NVIDIA GeForce GTX 1080 mittels eines erweiterten llama.cpp-Forks (AtomicBot-ai/atomic-llama-cpp-turboquant). Die Anleitung beschreibt die Systemeinrichtung, das Erstellen des Forks mit CUDA, den Download von GGUF sowie MTP Assistant Head und die Optimierung der Offload-Parameter. Wichtige Optimierungen umfassen das Speichern der MoE-Experten-Gewichte im Host-RAM (über PCIe gestreamt), RotorQuant/TurboQuant KV-Cache für 128k Kontext sowie das Erzwingen der Assistant Embedding Table auf der GPU via --override-tensor-draft für effektives MTP Speculative Decoding. Der Autor berichtet von ca. 24,5 Tokens/Sekunde bei 128k Kontext und erläutert Speicher- und PCIe-Kompromisse.

Signal analysieren
Large Language Models (LLM) & AI19. Apr. 2026

Gemma 4 auf Raspberry Pi mit TurboQuant ausführen

Ein Entwickler-Leitfaden demonstriert, wie ein autonomer OpenClaw-Agent auf einem Raspberry Pi 4B (8 GB) betrieben wird, indem ein TurboQuant-fähiger Fork von llama.cpp kompiliert wird, um Gemma 4 (Q4_K_M-Quantisierung) lokal zu hosten. Der Beitrag dokumentiert Hardware- und Betriebssystem-Empfehlungen wie SSD-Boot, Swap-Erhöhung und Kühlung, Build-Schritte inklusive NEON-Beschleunigung und TurboQuant-KV-Cache-Branch, die Modellbeschaffung über Hugging Face (gemma-4-E2B-it Q4_K_M) sowie Laufzeit-Flags wie --cache-type-k turbo4 und Flash Attention. Es wird gezeigt, wie das lokale Modell via llama-server als OpenAI-kompatible API für OpenClaw bereitgestellt wird, ergänzt durch optionalen Fernzugriff via Tailscale und ein hybrides Fallback auf die Google Gemini API für komplexere Aufgaben. Der Autor beschreibt zudem die Steuerung des Agenten mittels eines KheAi Protocol System-Prompts für zielorientiertes Verhalten.

Signal analysieren
Large Language Models (LLM) & AI9. Mai 2026

Edge-Autonomie-Agent: Gemma 4 auf Raspberry Pi 4B

Eine technische Schritt-für-Schritt-Anleitung zeigt, wie sich ein lokaler, autonomer KI-Agent auf einem Raspberry Pi 4B (8 GB RAM, SSD-Boot) betreiben lässt. Durch die Kombination von OpenClaw mit Gemma 4 E2B (Q4_K_M) und einem Community-Fork von llama.cpp mit TurboQuant KV-Cache-Kompression wird Edge-Inferenz ermöglicht. Der Autor beschreibt detailliert die Hardware- und Betriebssystemoptimierung, die Kompilierung von llama.cpp auf ARMv8 (NEON) sowie den Betrieb von llama-server als OpenAI-kompatibles Backend. Zudem wird erklärt, wie OpenClaw angebunden, das KheAi Protocol OODA-Persona angewendet und Tailscale für sicheren Remote-Zugriff genutzt wird. Für rechenintensive Aufgaben ist optional ein hybrides Routing zur Google Gemini API vorgesehen.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.