Beobachtetes Signal · 18. Juli 2026 · Technical Release · Quelle: DEV Community · Relevanz: 4/5 · Sentiment: Positiv
Prism ML veröffentlicht Bonsai 27B: Ein 1-Bit On-Device LLM
Prism ML hat Bonsai 27B vorgestellt, ein Large Language Model der 27B-Klasse, das echte 1-Bit-Binärgewichte nutzt und den Speicherbedarf auf rund 3,9 GB reduziert. Dies ermöglicht On-Device Inference auf modernen Smartphones und Laptops. Das Modell basiert auf einem Qwen3.6-27B-Backbone mit hybrider Attention sowie optionalem Vision Tower und unterstützt einen Kontext von 262K Token durch lineare Attention und 4-Bit KV-Cache-Quantisierung. Zudem beinhaltet das Release angepasste 1-Bit-Kernels für Apple MLX und CUDA sowie einen DSpark Speculative-Decoding Drafter, der auf NVIDIA H100 eine 1,37-fache Beschleunigung erzielt. Benchmarks belegen, dass Bonsai 89,5 % der FP16-Leistung bei der Reasoning-Fähigkeit beibehält und dabei Energie- sowie Speicherverbrauch massiv senkt. Die Veröffentlichung erfolgt unter der Apache 2.0-Lizenz.
Ein technisch neuartiges LLM, das echte On-Device Inference der 27B-Klasse mit geringem Speicherbedarf, langem Kontext und plattformübergreifenden Kernels ermöglicht. Dies verändert die Edge-AI-Bereitstellung grundlegend, reduziert die Cloud-Abhängigkeit und verbessert Datenschutz, Latenz sowie Energieeffizienz.
Marktsignale zu Apple in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Prism ML enthüllte Bonsai 27B, ein LLM mit 1-Bit-Binärgewichten (effektiv 1,125 Bits pro Gewicht).
- Bonsai 27B reduziert den Footprint auf ca. 3,9 GB, was einer 14,2-fachen Verkleinerung gegenüber der FP16-Baseline (54 GB) entspricht.
- Das Modell unterstützt einen 262K-Token-Kontext On-Device mittels Qwen3.6-27B Hybrid-Attention-Backbone und 4-Bit KV-Cache-Quantisierung.
- Ein DSpark Speculative-Decoding Drafter sorgt für einen 1,37-fachen Decode-Speedup auf NVIDIA H100 (CUDA).
- Benchmarks zeigen einen 'Thinking'-Durchschnitt von 76,11 (89,5 % des FP16-Referenzwerts) bei geringerem Energieverbrauch; Lizenz: Apache 2.0.
Verknüpfte Unternehmen
2 verknüpfte Unternehmen“Prism ML has developed custom 1-bit hybrid-attention kernels for Apple MLX (Python, Swift) and CUDA....”
“Bonsai 27B was evaluated using EvalScope + vLLM on NVIDIA H100 in 'thinking mode,' designed to stress the model's reasoning capabilities....”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
PrismML veröffentlicht Bonsai 2 27B: Leistungsstarkes ternäres KI-Modell für lokales Deployment
PrismML hat den Launch von Bonsai 2 27B bekannt gegeben, seinem neuen ternären Flaggschiff-KI-Modell, das auf Qwen3.8 27B basiert. Das Modell wurde auf 5,9 GB komprimiert, was einer Reduktion des Speicherbedarfs um mehr als das Neunfache gegenüber der Full-Precision-Version entspricht. Trotz dieser starken Kompression behält es über 98 % der Benchmark-Leistung bei. Bonsai 2 27B ist für den lokalen Einsatz konzipiert und unterstützt komplexe Aufgaben in den Bereichen Reasoning, Coding, Vision sowie agentische Workflows. Mit einem Gesamtwert von 83,9 über 20 Benchmarks hinweg erreicht es 98,2 % der Leistungsfähigkeit von Qwen3.8 27B. Das Modell steht ab dem 17. September 2026 unter der Apache 2.0-Lizenz kostenfrei zur Verfügung. PrismML verfolgt damit das Ziel, maximale Intelligenzdichte auf Consumer-Hardware und Edge-Geräten bereitzustellen.
PrismML bringt kompaktes Bonsai 2 27B LLM für On-Device AI
Das KI-Startup PrismML hat Bonsai 2 27B vorgestellt, ein stark komprimiertes Large Language Model, das für den Einsatz auf PCs und High-End-Smartphones optimiert ist. Die Technologie komprimiert das Modell Qwen3.8 27B von Alibaba auf lediglich 5,9 GB – eine neun- bis zehnfache Reduktion des Speicherbedarfs – bei Erhalt von 98 Prozent der ursprünglichen Benchmark-Performance. PrismML wurde von Forschern des Caltech gegründet und wird von CEO Babak Hassibi geführt. Das Startup sicherte sich eine Seed-Finanzierung in Höhe von 22,25 Millionen US-Dollar unter Führung von Khosla Ventures, Cerberus Capital und dem Caltech. Die proprietäre ternäre Gewichtskompression reduziert Gewichte auf +1, -1 oder 0. PrismML beabsichtigt, dieses Verfahren in den kommenden Monaten auf noch größere Modelle anzuwenden. Medienberichten zufolge befindet sich das Unternehmen zudem in ersten Gesprächen mit Apple.
Apple verhandelt mit PrismML über On‑Device‑KI-Komprimierung
Apple führt frühe Gespräche mit dem Caltech-Spinout PrismML, das von Khosla Ventures unterstützt wird. Das Startup hat komprimierte Versionen des Open-Source-Modells Qwen von Alibaba veröffentlicht, die die Größe von rund 54 GB auf unter 4 GB reduzieren. Durch die Reduzierung interner Werte auf wenige Zustände soll ein Modell mit 27 Milliarden Parametern auf dem iPhone 15 oder neueren Geräten laufen können, was Geschwindigkeit und Energieeffizienz steigert. PrismML hat zwei komprimierte Modellvarianten kostenlos veröffentlicht und eine Seed-Finanzierung von 16,25 Millionen US-Dollar eingesammelt. Analysten betonen die potenziellen Auswirkungen auf Siri, den lokalen Energieverbrauch und globale Chip-Märkte, weisen jedoch darauf hin, dass Praxistests im großen Maßstab die tatsächliche Effizienz bestätigen müssen.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
