Beobachtetes Signal · 18. Juli 2026 · Technical Release · Quelle: DEV Community · Relevanz: 4/5 · Sentiment: Positiv

Prism ML veröffentlicht Bonsai 27B: Ein 1-Bit On-Device LLM

Zusammenfassung des Signals

Prism ML hat Bonsai 27B vorgestellt, ein Large Language Model der 27B-Klasse, das echte 1-Bit-Binärgewichte nutzt und den Speicherbedarf auf rund 3,9 GB reduziert. Dies ermöglicht On-Device Inference auf modernen Smartphones und Laptops. Das Modell basiert auf einem Qwen3.6-27B-Backbone mit hybrider Attention sowie optionalem Vision Tower und unterstützt einen Kontext von 262K Token durch lineare Attention und 4-Bit KV-Cache-Quantisierung. Zudem beinhaltet das Release angepasste 1-Bit-Kernels für Apple MLX und CUDA sowie einen DSpark Speculative-Decoding Drafter, der auf NVIDIA H100 eine 1,37-fache Beschleunigung erzielt. Benchmarks belegen, dass Bonsai 89,5 % der FP16-Leistung bei der Reasoning-Fähigkeit beibehält und dabei Energie- sowie Speicherverbrauch massiv senkt. Die Veröffentlichung erfolgt unter der Apache 2.0-Lizenz.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Ein technisch neuartiges LLM, das echte On-Device Inference der 27B-Klasse mit geringem Speicherbedarf, langem Kontext und plattformübergreifenden Kernels ermöglicht. Dies verändert die Edge-AI-Bereitstellung grundlegend, reduziert die Cloud-Abhängigkeit und verbessert Datenschutz, Latenz sowie Energieeffizienz.

SIGNAL RADAR

Marktsignale zu Apple in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • Prism ML enthüllte Bonsai 27B, ein LLM mit 1-Bit-Binärgewichten (effektiv 1,125 Bits pro Gewicht).
  • Bonsai 27B reduziert den Footprint auf ca. 3,9 GB, was einer 14,2-fachen Verkleinerung gegenüber der FP16-Baseline (54 GB) entspricht.
  • Das Modell unterstützt einen 262K-Token-Kontext On-Device mittels Qwen3.6-27B Hybrid-Attention-Backbone und 4-Bit KV-Cache-Quantisierung.
  • Ein DSpark Speculative-Decoding Drafter sorgt für einen 1,37-fachen Decode-Speedup auf NVIDIA H100 (CUDA).
  • Benchmarks zeigen einen 'Thinking'-Durchschnitt von 76,11 (89,5 % des FP16-Referenzwerts) bei geringerem Energieverbrauch; Lizenz: Apache 2.0.

Verknüpfte Unternehmen

2 verknüpfte Unternehmen
Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: DEV Community•Veröffentlicht: 18. Juli 2026
Ursprünglicher Berichttitel: “Prism ML Introduces Bonsai 27B: A 1-bit LLM for On-Device Inference”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

AI17. Sept. 2026

PrismML veröffentlicht Bonsai 2 27B: Leistungsstarkes ternäres KI-Modell für lokales Deployment

PrismML hat den Launch von Bonsai 2 27B bekannt gegeben, seinem neuen ternären Flaggschiff-KI-Modell, das auf Qwen3.8 27B basiert. Das Modell wurde auf 5,9 GB komprimiert, was einer Reduktion des Speicherbedarfs um mehr als das Neunfache gegenüber der Full-Precision-Version entspricht. Trotz dieser starken Kompression behält es über 98 % der Benchmark-Leistung bei. Bonsai 2 27B ist für den lokalen Einsatz konzipiert und unterstützt komplexe Aufgaben in den Bereichen Reasoning, Coding, Vision sowie agentische Workflows. Mit einem Gesamtwert von 83,9 über 20 Benchmarks hinweg erreicht es 98,2 % der Leistungsfähigkeit von Qwen3.8 27B. Das Modell steht ab dem 17. September 2026 unter der Apache 2.0-Lizenz kostenfrei zur Verfügung. PrismML verfolgt damit das Ziel, maximale Intelligenzdichte auf Consumer-Hardware und Edge-Geräten bereitzustellen.

Signal analysieren
AI Infrastructure17. Sept. 2026

PrismML bringt kompaktes Bonsai 2 27B LLM für On-Device AI

Das KI-Startup PrismML hat Bonsai 2 27B vorgestellt, ein stark komprimiertes Large Language Model, das für den Einsatz auf PCs und High-End-Smartphones optimiert ist. Die Technologie komprimiert das Modell Qwen3.8 27B von Alibaba auf lediglich 5,9 GB – eine neun- bis zehnfache Reduktion des Speicherbedarfs – bei Erhalt von 98 Prozent der ursprünglichen Benchmark-Performance. PrismML wurde von Forschern des Caltech gegründet und wird von CEO Babak Hassibi geführt. Das Startup sicherte sich eine Seed-Finanzierung in Höhe von 22,25 Millionen US-Dollar unter Führung von Khosla Ventures, Cerberus Capital und dem Caltech. Die proprietäre ternäre Gewichtskompression reduziert Gewichte auf +1, -1 oder 0. PrismML beabsichtigt, dieses Verfahren in den kommenden Monaten auf noch größere Modelle anzuwenden. Medienberichten zufolge befindet sich das Unternehmen zudem in ersten Gesprächen mit Apple.

Signal analysieren
Large Language Models & On‑device AI14. Juli 2026

Apple verhandelt mit PrismML über On‑Device‑KI-Komprimierung

Apple führt frühe Gespräche mit dem Caltech-Spinout PrismML, das von Khosla Ventures unterstützt wird. Das Startup hat komprimierte Versionen des Open-Source-Modells Qwen von Alibaba veröffentlicht, die die Größe von rund 54 GB auf unter 4 GB reduzieren. Durch die Reduzierung interner Werte auf wenige Zustände soll ein Modell mit 27 Milliarden Parametern auf dem iPhone 15 oder neueren Geräten laufen können, was Geschwindigkeit und Energieeffizienz steigert. PrismML hat zwei komprimierte Modellvarianten kostenlos veröffentlicht und eine Seed-Finanzierung von 16,25 Millionen US-Dollar eingesammelt. Analysten betonen die potenziellen Auswirkungen auf Siri, den lokalen Energieverbrauch und globale Chip-Märkte, weisen jedoch darauf hin, dass Praxistests im großen Maßstab die tatsächliche Effizienz bestätigen müssen.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.