Beobachtetes Signal · 24. Mai 2026 · Technical Release · Quelle: DEV Community · Relevanz: 4/5 · Sentiment: Neutral

Gemma 4 nutzt 48×48 Soft Tokens für native Vision-Verarbeitung

Zusammenfassung des Signals

Dieser technische Artikel erläutert, wie Google mit Gemma 4 native Vision-Funktionen in alle Modellvarianten integriert, indem feste 16×16-Patch-Tokenisierungen durch grössere, gepoolte „Soft Tokens“ ersetzt werden. Gemma 4 fasst 3×3-Blöcke aus 16×16-Patches zu 48×48-Soft-Tokens zusammen, um Rechenaufwand und Kontext-Overhead zu reduzieren. Zudem werden konfigurierbare Token-Budgets (70, 140, 280, 560, 1120) eingeführt, die die an das Sprachmodell übergebenen Soft Tokens limitieren. Das Modell bewahrt Seitenverhältnisse, indem Eingaben so skaliert werden, dass Höhe und Breite durch 48 teilbar sind. Es verwendet patch-basierte absolute Positionstabellen (X- und Y-Achsen) zusammen mit 2D-RoPE für die relative Positionierung. Der Beitrag enthält Anwendungsbeispiele über Hugging Face Transformers (z. B. das Setzen von processor.image_processor.max_soft_tokens) sowie Leitlinien zur Budgetwahl für Aufgaben von Mobile Inference bis hin zum detaillierten Document Parsing.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Gemma 4 ist ein wichtiges Google-Modellrelease, das die multimodale Vision-Tokenisierung (Soft Tokens und Budgets) revolutioniert, die Effizienz für Edge- und Mobile Inference steigert und Entwickler multimodaler LLMs massgeblich beeinflusst.

SIGNAL RADAR

Marktsignale zu Google in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • Gemma 4 repräsentiert Bilder über 48×48-Soft-Tokens, die durch die Gruppierung von 3×3-Blöcken aus 16×16-Patches gebildet werden.
  • Gemma 4 unterstützt konfigurierbare Token-Budgets (70, 140, 280, 560, 1120), die die maximalen Soft Tokens für das Sprachmodell steuern.
  • Bildverarbeitungsregeln: Skalierte Höhe und Breite müssen durch 48 teilbar sein, und das skalierte Bild muss zum gewählten Token-Budget passen.
  • Positionale Codierung: Gemma 4 nutzt zwei Patch-Embedding-Tabellen (X- und Y-Achsen) mit je 10.240 Vektoren der Grösse 768 und wendet 2D-RoPE an.
  • Der Artikel bietet ein Hugging Face-Beispiel mit der MODEL_ID 'google/gemma-4-E2B-it' zur Steuerung des Token-Budgets via processor.image_processor.max_soft_tokens.
Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: DEV Community•Veröffentlicht: 24. Mai 2026
Ursprünglicher Berichttitel: “Gemma 4 Soft Tokens: The Rise and Fall of 16x16 Words ⚡👀”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Large Language Models (LLM) & AI3. Apr. 2026

Google DeepMind veröffentlicht multimodale Open-Weight-Modelle der Gemma-4-Familie

Google DeepMind hat Gemma 4 vorgestellt, eine neue Familie von Open-Weight-Modellen unter einer Apache-2.0-Lizenz mit nativer Unterstützung für Text, Vision und Audio. Das Line-up umfasst ein 31B-Dense-Modell, eine 26B-MoE-Variante sowie zwei Edge-fokussierte Modelle (E4B, E2B). Die großen Modelle unterstützen Kontextfenster von bis zu 256K Token und wurden für Agenten-Workflows sowie lokale Deployments optimiert. Erste Benchmarks zeigen eine starke Performance bei Reasoning und Token-Effizienz. Zudem gab es einen Day-0-Support in gängigen Serving-Stacks wie llama.cpp, Ollama, vLLM und LM Studio. Die Veröffentlichung markiert einen signifikanten Fortschritt für On-Device-Agents und Open-Agent-Architekturen.

Signal analysieren
Large Language Models (LLM) & AI25. Mai 2026

Gemma 4 demonstriert lokale multimodale KI jenseits von Text

Ein Entwicklerbericht auf Dev.to verdeutlicht, wie Googles Gemma 4-Modellfamilie die Wahrnehmung von lokalem AI-Einsatz verändert, da sie multimodale Funktionen wie Text, Bilder und in bestimmten Setups Audio auf gewöhnlicher Hardware ermöglicht. Als Open-Weight-Modellfamilie umfasst Gemma 4 diverse Grössenvarianten, darunter Edge-optimierte E2B- und E4B-Modelle für Laptops sowie grössere 26B- und 31B-Varianten für anspruchsvollere Reasoning-Aufgaben. Der Autor testete lokale Workflows mit Bild-Input und Text-Output, wie etwa das Erklären von Diagrammen, das Zusammenfassen handschriftlicher Notizen und das Bewerten von UI-Mockups. Dabei stechen besonders die langen Context Windows von etwa 128K bis 256K Token, die Datenschutzvorteile durch lokale Inferenz sowie die praxisnahen Kompromisse bei der Auswahl der passenden Modellvariante für spezifische Hardware und Anwendungsfälle hervor.

Signal analysieren
Large Language Models (LLM) & AI23. Mai 2026

Google veröffentlicht Gemma 4: Open-Weight-LLMs für Edge und Cloud

Google hat im April 2026 Gemma 4 vorgestellt, eine Familie offener, multimodaler Large Language Models unter der Apache-2.0-Lizenz. Die vier Varianten E2B, E4B, 26B MoE und 31B ermöglichen die vollständige Offline-Ausführung auf lokalen Geräten wie Smartphones und Laptops. Die kleineren Modelle unterstützen ein Kontextfenster von 128.000 Token, während die größeren Varianten 256.000 Token bewältigen. Gemma 4 bietet erweiterte Funktionen wie Function Calling, agentenbasierte Workflows, multimodale Vision- und Audio-Eingaben sowie einen Thinking Mode für schrittweises Reasoning. Die Veröffentlichung legt den Fokus auf lokale, kostenfreie Inferenz ohne Cloud-Gebühren sowie auf maximale Datensouveränität für Entwickler. Dank gängiger Runtimes wie Ollama und LM Studio gestaltet sich die Bereitstellung unkompliziert. Architektonische Innovationen bei der Skalierung langer Kontexte ermöglichen eine effiziente On-Device-Inferenz für breite kommerzielle Anwendungen ohne laufende API-Kosten.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.