Beobachtetes Signal · 28. Juni 2026 · Technical Release · Quelle: DEV Community · Relevanz: 5/5 · Sentiment: Neutral

On-Device-KI wird praxistauglich: Apple und Google setzen neue Maßstäbe

Zusammenfassung des Signals

Apple und Google haben On-Device-Foundation-Modelle etabliert, die die Ökonomie, den Datenschutz und die Verfügbarkeit von LLM-Funktionen grundlegend verändern. Apples auf der WWDC am 8. Juni vorgestellte AFM-3-Generation nutzt eine sparsame Aktivierungsstrategie, bei der von rund 20 Milliarden Parametern im Flash-Speicher nur 1 bis 4 Milliarden pro Anfrage aktiv sind. Googlesto stellt die Gemma-4-Familie bereit, die durch Per-Layer-Embeddings und Mixture-of-Experts-Architekturen extrem kleine aktive Footprints erzielt. Edge-Varianten laufen offline auf Geräten wie Raspberry Pi oder NVIDIA Jetson Orin Nano. Da Apple zudem sein Framework für Drittanbieter- und Open-Modelle öffnet sowie Agenten-Primitives und lokale semantische Suche integriert, verlagern sich zahlreiche Features von kostenpflichtigen Cloud-Inferenzdiensten hin zu kostenfreien, privaten Ausführungen auf dem Endgerät.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Die Plattform-Updates von Apple und Google senken die Grenzkosten der Inferenz drastisch, ermöglichen datenschutzkonforme On-Device-KI und verändern die Infrastruktur-Anforderungen für App-Architektur und Monetarisierung grundlegend.

SIGNAL RADAR

Marktsignale zu Apple in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • Apple kündigte am 8. Juni 2026 auf der WWDC seine Foundation Models der dritten Generation (AFM 3) an.
  • Apples On-Device-Modell speichert rund 20 Milliarden Parameter, aktiviert pro Anfrage jedoch nur etwa 1 bis 4 Milliarden.
  • Google veröffentlichte am 2. April 2026 die Gemma-4-Familie, deren Edge-Varianten (E2B/E4B) dank MoE-Design minimale aktive Footprints aufweisen.
  • Gemma-4-Edge-Modelle laufen offline auf Hardware wie Raspberry Pi und NVIDIA Jetson Orin Nano, wobei E4B mit rund 3 GB RAM auskommt.
  • Apple öffnete sein Foundation-Models-Framework für Drittanbieter- sowie Open-Modelle und ergänzte das SDK um Agenten-Primitives und lokale semantische Suche.

Verknüpfte Unternehmen

6 verknüpfte Unternehmen

“Two releases — Apple's third-generation Foundation Models at WWDC on June 8, and Google's Gemma 4 family on April 2 — quietly moved the floo...”

“Apple opened its Foundation Models framework to third‑party and open models, with Swift packages for Anthropic's and Google's models on the ...”

“Google says the Gemma 4 edge models run "completely offline with near‑zero latency" not just on phones but on a Raspberry Pi and an NVIDIA J...”

“Google says the Gemma 4 edge models run "completely offline with near‑zero latency" not just on phones but on a Raspberry Pi and an NVIDIA J...”

Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: DEV Community•Veröffentlicht: 28. Juni 2026
Ursprünglicher Berichttitel: “On-Device AI Just Got Real”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Platform14. Apr. 2026

Apples On-Device-Foundation-Modelle revolutionieren das iOS-Machine-Learning

Der Artikel beleuchtet das Foundation-Models-Framework von Apple in iOS 26, welches die lokale Ausführung eines Sprachmodells mit rund 3 Milliarden Parametern direkt auf A17-Pro- und M1+-Geräten ermöglicht. Die Swift-native API stellt fortschrittliche Werkzeuge wie das @Generable-Makro, strukturierte Generierung, LoRA-Adapter für leichtgewichtige Feinabstimmungen sowie ein Tool-Protokoll bereit. Lokale Inferenz sichert minimale Latenzen, verbesserten Datenschutz und den Verzicht auf transaktionsbasierte API-Kosten. Entwickler müssen jedoch Hardware-Restriktionen wie den RAM-Bedarf von 2 bis 3 GB, thermische Drosselung und Batterieeffizienz berücksichtigen. Der Beitrag liefert konkrete Swift-Codebeispiele, Architekturmuster für Kontextmanagement und Caching sowie Kompatibilitätsrichtlinien für aktuelle iPhones, iPads und Macs.

Signal analysieren
Large Language Models (LLM) & AI18. Juni 2026

Apple erweitert Foundation Models Framework auf der WWDC 2026

Auf der WWDC 2026 hat Apple sein Foundation Models Framework von einem reinen On-Device-Modell zu einer hybriden, multimodalen KI-Plattform ausgebaut. Das Update umfasst ein überarbeitetes On-Device-Modell mit einem 8.192-Token-Kontextfenster, visuelle und multimodale Funktionen sowie agentische Primitiven wie DynamicProfile. Ein neues LanguageModel-Protokoll ermöglicht die Integration von Drittanbietermodellen wie Anthropic Claude oder Google Gemini in dieselbe Session-API, während Apple-Servermodelle über Private Cloud Compute (PCC) ein 32K-Kontextfenster bereitstellen. Zudem wurden ein Python SDK, eine fm CLI und ein Evaluations-Framework veröffentlicht. Im Sommer soll das Framework inklusive Linux-Unterstützung als Open Source erscheinen. Entwickler mit weniger als zwei Millionen Erstdownloads im App Store erhalten kostenlosen PCC-Zugriff. Die Nutzung eigener Fine-Tuning-Gewichte für On-Device-Runtimes wird weiterhin nicht unterstützt.

Signal analysieren
Large Language Models (LLM) & AI12. Mai 2026

Lokale KI wird zum neuen Standard für Entwickler

Eine Analyse der DEV Community zeigt, dass lokale KI – das Ausführen von Modellen und Agents direkt auf Endgeräten – für viele Entwickler zum Standard geworden ist. Auslöser war ein viral gegangener Hacker-News-Beitrag Anfang 2025 mit 1.763 Upvotes und über 800 Kommentaren. Technologische Treiber dieser Entwicklung sind Fortschritte bei Consumer-Hardware wie Apples M-Serie und MLX, Inferenz-Tools wie llama.cpp und Ollama, die Verfügbarkeit von Open-Weight-Modellen im Hugging-Face-Ökosystem sowie Quantisierungstechniken wie GGUF, AWQ und GPTQ. Als Hauptvorteile nennt der Artikel Datenschutz, geringere Latenzen, Kosteneffizienz, Offline-Verfügbarkeit und Reproduzierbarkeit. Ein konkretes Praxisbeispiel ist der von Mininglamp Technology veröffentlichte, Open-Source-fähige, vision-basierte GUI-Agent Mano-P, der im OSWorld-Benchmark mit 58,2 % Genauigkeit den ersten Platz belegt und ein quantisiertes 4B-Modell auf einem M4 Pro ausführt.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.