Beobachtetes Signal · 24. Apr. 2026 · Technical Release · Quelle: DEV Community · Relevanz: 3/5 · Sentiment: Positiv
Vision-basierte AI Agents überwinden Browser-Grenzen per Pixel-Analyse
Der Artikel beleuchtet einen rein visuellen Ansatz zur GUI-Automatisierung, bei dem AI Agents über Pixel-Analysen mit beliebigen Bildschirm-Anwendungen interagieren, statt auf den Browser-DOM oder OS Accessibility APIs angewiesen zu sein. Neben einem Vergleich dreier Ansätze (CDP/HTML-Parsing, Accessibility APIs und Vision-Only) wird Mano-P vorgestellt – ein Open-Source GUI-Agentenmodell von Mininglamp-AI unter Apache-2.0. Mano-P erzielt im cross-application OSWorld-Benchmark eine Erfolgsquote von 58,2 Prozent (gegenüber 45,0 Prozent des Zweitplatzierten), schlägt Wettbewerber im Web-Navigation-Benchmark (41,7 NavEval) und läuft dank w4a16-Quantisierung als 4B-Parameter-Modell lokal auf dem Endgerät. Der Beitrag behandelt das Training (SFT, Offline RL, Online RL), Modellkomprimierung (GS-Pruning), Edge-Performance-Metriken auf dem Apple M4 Pro sowie einen dreiphasigen Release-Plan für Skills, lokale Modelle, SDKs und Trainingsmethoden.
Demonstriert einen praktischen Open-Source Vision-First Agenten (Mano-P), der die Automatisierung über Browser- und DOM-Grenzen hinaus erweitert, messbare Benchmark-Zuwächse erzielt und On-Device-Performance für Multi-App-Workflows liefert.
Marktsignale zu Apple in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Mano-P ist ein von Mininglamp-AI unter Apache 2.0 veröffentlichtes Open-Source Vision-Only GUI-Agentenmodell.
- Im cross-application OSWorld-Benchmark erreicht Mano-P eine Erfolgsquote von 58,2 Prozent im Vergleich zu 45,0 Prozent des zweitplatzierten Modells.
- Beim WebRetriever Protocol I Benchmark erzielt Mano-P 41,7 NavEval und liegt damit vor Gemini 2.5 Pro (40,9) sowie Claude 4.5 (31,3).
- Mano-P nutzt ein 4B-Parameter-Modell mit w4a16-Quantisierung und erreicht auf einem Apple M4 Pro 476 Tokens/s (Prefill), 76 Tokens/s (Decode) bei 4,3 GB Peak-Memory.
- Das Projekt verwendet eine dreistufige Training Pipeline (Supervised Fine-Tuning, Offline RL, Online RL) und nutzt GS-Pruning zur Modellkomprimierung.
Verknüpfte Unternehmen
4 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Mano-P: Edge-Native KI-Agent stellt Datensouveränität wieder her
Der Artikel stellt Mano-P vor, eine Open-Source-Architektur für edge-native KI-Agenten, die vollständig auf lokaler Hardware läuft, um die Datensouveränität zu wahren und Cloud-Abhängigkeiten zu reduzieren. Mano-P nutzt rein visuelles Verständnis über Screenshots, w4a16-Quantisierung und GS-Pruning, um ein Modell mit 4 Milliarden Parametern interaktiv auf Consumer Apple Silicon auszuführen. Getestet auf einem Apple M4 Pro (32 GB) liefert das Modell 476 Token/s Prefill, 76 Token/s Decode und benötigt maximal 4,3 GB Speicher. Zitierten Benchmarks zufolge erreicht es eine Erfolgsquote von 58,2 % bei OSWorld sowie 41.7 NavEval beim WebRetriever Protocol I und übertrifft damit größere Cloud-Modelle bei GUI-Automatisierungsaufgaben. Das Projekt folgt einer dreistufigen Trainingspipeline (SFT, Offline-RL, Online-RL), unterstützt lokales USB-4.0-Beschleuniger-Offloading und wird schrittweise als Open Source unter Apache 2.0 veröffentlicht.
Mano-P: Open-Source On-Device GUI-Agent und Führungswechsel bei Apple
Der Artikel stellt Mano-P vor, einen Open-Source On-Device GUI-Agenten für macOS, der per Pure-Vision-Ansatz grafische Benutzeroberflächen bedient. Unter Apache 2.0 veröffentlicht (GitHub: Mininglamp-AI/Mano-P), nutzt das Tool eine dreistufige Trainingspipeline aus Supervised Fine-Tuning, Offline-RL und Online-RL sowie eine Think-Act-Verify-Inferenzschleife zur Selbstkorrektur. Benchmarks zeigen eine Erfolgsquote von 58,2 Prozent für das 72B-Modell auf OSWorld und 41,7 NavEval Punkte auf WebRetriever Protocol I, womit es einige Wettbewerber übertrifft. Eine quantisierte 4B-w4a16-Variante läuft lokal auf dem Apple M4 Pro (476 Tokens/s Prefill, 76 Tokens/s Decode, 4,3 GB Peak-Memory). Zudem gab Apple bekannt, dass Tim Cook als Executive Chairman wechselt und John Ternus zum 1. September neuer CEO wird.
Lokale KI wird zum neuen Standard für Entwickler
Eine Analyse der DEV Community zeigt, dass lokale KI – das Ausführen von Modellen und Agents direkt auf Endgeräten – für viele Entwickler zum Standard geworden ist. Auslöser war ein viral gegangener Hacker-News-Beitrag Anfang 2025 mit 1.763 Upvotes und über 800 Kommentaren. Technologische Treiber dieser Entwicklung sind Fortschritte bei Consumer-Hardware wie Apples M-Serie und MLX, Inferenz-Tools wie llama.cpp und Ollama, die Verfügbarkeit von Open-Weight-Modellen im Hugging-Face-Ökosystem sowie Quantisierungstechniken wie GGUF, AWQ und GPTQ. Als Hauptvorteile nennt der Artikel Datenschutz, geringere Latenzen, Kosteneffizienz, Offline-Verfügbarkeit und Reproduzierbarkeit. Ein konkretes Praxisbeispiel ist der von Mininglamp Technology veröffentlichte, Open-Source-fähige, vision-basierte GUI-Agent Mano-P, der im OSWorld-Benchmark mit 58,2 % Genauigkeit den ersten Platz belegt und ein quantisiertes 4B-Modell auf einem M4 Pro ausführt.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
