Beobachtetes Signal · 28. Juli 2026 · Technical Release · Quelle: DEV Community · Relevanz: 3/5 · Sentiment: Positiv
Mac-Port ermöglicht lokale Ausführung von NVIDIA Nemotron Omni
NVIDIA hat mit Nemotron-3-Nano-Omni-30B-A3B ein trimodales Modell mit 30 Milliarden Parametern (Bild, Audio, Text) und öffentlich zugänglichen Gewichten veröffentlicht. Da die Audio- und Bild-Module jedoch eine multimodale Laufzeitumgebung erfordern, die auf Apple Silicon standardmäßig nicht verfügbar ist, entwickelte ein Entwickler den fehlenden Port. Dieser ermöglicht die Ausführung mittels MLX-4-Bit-Quantisierung direkt auf dem Mac. Der unter einer MIT-Lizenz auf GitHub veröffentlichte Quellcode wurde erfolgreich gegen NVIDIAs PyTorch-Referenz validiert, wobei nahezu identische Embeddings und exakte CPU-Berechnungen erzielt wurden. Die lokale Ausführung benötigt rund 22 GB und läuft stabil. Zudem deckte der Autor Schwachstellen in der NVIDIA-Referenz auf, etwa NaN-Werte bei gebatchtem Audio. Dies senkt die Hürde für datenschutzsensible On-Device-KI-Anwendungen erheblich.
Ermöglicht lokale multimodale Inferenz auf Apple Silicon mit öffentlichen Gewichten und senkt die Hürde für datenschutzsensible On-Device-KI-Anwendungen, stellt jedoch keinen breiten Branchenumbruch dar.
Marktsignale zu NVIDIA in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- NVIDIA veröffentlichte das trimodale 30B-Modell Nemotron-3-Nano-Omni-30B-A3B inklusive offener Gewichte und Referenzcode.
- Eine MLX-4-Bit-quantisierte Version (ca. 19 GB auf dem Datenträger) diente als Basis für den Apple-Silicon-Port.
- Der Autor implementierte die fehlenden multimodalen Laufzeitkomponenten für Vision und Audio auf dem Mac und veröffentlichte den Code auf GitHub unter der MIT-Lizenz.
- Paritätstests gegenüber NVIDIAs PyTorch-Referenz ergaben eine Audio-Embedding-Kosinusähnlichkeit von 0,99999 sowie exakte CPU-Berechnungen.
- Im NVIDIA-Referenzcode wurden Fehler identifiziert, darunter NaN-Ausgaben bei Audio-Batches unterschiedlicher Länge.
Verknüpfte Unternehmen
3 verknüpfte Unternehmen“NVIDIA released Nemotron-3-Nano-Omni-30B-A3B — a “tri-modal” model, which is a fancy way of saying one brain with eyes and ears attached....”
“Someone had already done the hard, unglamorous work of shrinking it down to a 4-bit MLX version that fits on Apple Silicon — that’s yayr ove...”
“The code is on GitHub, MIT, with every parity test in it....”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
NVIDIA präsentiert Nemotron 3 Nano Omni Multimodal-Modell
NVIDIA hat ein Forschungspapier zu Nemotron 3 Nano Omni veröffentlicht, einem einheitlichen multimodalen Modell, das Text, Bilder, Video und Audio nativ verarbeitet und analysiert. Das Modell nutzt ein Mixture-of-Experts (MoE)-Backbone mit einer Konfiguration von 30 Milliarden Gesamt- und rund 3 Milliarden aktiven Parametern, integriert die Encoder C-RADIOv4-H und Parakeet-TDT für Vision und Audio sowie Funktionen zur dynamischen Bildauflösung und Conv3D-basierten temporalen Kompression. Mit einem erweiterten Kontextfenster von 256.000 Token und quantisierten Varianten in BF16, FP8 und FP4 zielt das System auf effiziente Inference auf Standardhardware ab. Der Bericht zeigt signifikante Leistungssteigerungen beim Durchsatz und der GPU-Effizienz im Vergleich zu Wettbewerbern auf und stellt Modellgewichte sowie Trainingsdetails bereit.
Mano-P: Edge-Native AI Agent Restores Data Sovereignty
The article presents Mano-P, an open-source, edge-native AI agent architecture designed to run entirely on local hardware to preserve data sovereignty and reduce cloud dependencies. Mano-P uses vision-only understanding (screenshots as raw pixels), w4a16 quantization, and GS-Pruning to run a 4B-parameter model interactively on consumer Apple Silicon. Measured on an Apple M4 Pro (32GB), the model shows 476 tokens/s prefill, 76 tokens/s decode, and 4.3 GB peak memory. Benchmarks cited include a 58.2% success rate on OSWorld and 41.7 NavEval on WebRetriever Protocol I, outperforming larger cloud models in GUI automation tasks. The project follows a three-stage training pipeline (SFT, offline RL, online RL), supports local USB 4.0 accelerator offload, and is being released in phased open-source stages under Apache 2.0.
NVIDIA: Chris Alexiuk über Nemotron, GPUs und Agentic AI
In einem Interview erläutert Chris Alexiuk von NVIDIA die Nemotron-Modellfamilie und deren gezielte Ausrichtung auf die hauseigene GPU-Hardware. Nemotron 3 erscheint in drei Stufen (Nano, Super, Ultra), die für Single-GPU-, Single-Node- sowie NVL72-Rack-Deployments optimiert sind. Die Architektur kombiniert Mamba-2-Schichten mit sparse Mixture-of-Experts (MoE) bei reduzierten Attention-Layern. Durch LatentMoE-Routing werden Tokens komprimiert, um bei gleichen Kosten rund viermal mehr Experten anzusteuern. Neben multimodalen Erweiterungen wie Nemotron 3 Nano Omni veröffentlicht NVIDIA umfangreiche Open-Data-Trainingsdaten parallel zu den Modellgewichten. Zudem wurde Nemotron 3.5 Lightning vorgestellt – ein 30B-MoE-Modell (3B aktiv), das speziell für Agentic-AI-Workloads konzipiert ist und Speculative Decoding sowie NVFP4-Quantisierung nutzt. NVIDIAs Strategie zielt darauf ab, das breite Open-Source-Ökosystem zu stärken, anstatt als Closed-Model-Anbieter aufzutreten.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
