Beobachtetes Signal · 11. Juni 2026 · Technical Release · Quelle: DEV Community · Relevanz: 3/5 · Sentiment: Neutral
Alibabas Qwen 3.6 35B-A3B MoE-Modell und lokaler 24GB VRAM-Leitfaden
Der Artikel analysiert Alibabas Qwen 3.6 35B-A3B, ein am 16. April 2026 unter Apache 2.0 veröffentlichtes Mixture-of-Experts (MoE) LLM, und erläutert, warum das Modell die Speicherung aller 35 Milliarden Parameter im Speicher erfordert, woraus sich ein praktisches VRAM-Minimum von 24GB ergibt. Benchmarks und Quantisierungsleitfäden zeigen, dass das Modell auf Consumer-GPUs mit 24GB einen hohen Tokendurchsatz erzielt, wie etwa rund 120 Token pro Sekunde auf einer RTX 4090 mit Q4_K_M und angepassten llama.cpp-Einstellungen. Der Beitrag vergleicht das MoE 35B-A3B mit dem dichten Qwen 3.6 27B, das in rund 16GB passt und bei SWE-bench besser abschneidet, detailliert die VRAM-Auslastung durch Quantisierung sowie KV-Cache und liefert Hardware- und Backend-Empfehlungen für die lokale Bereitstellung über Ollama, llama.cpp, vLLM und Unsloth.
Ein neues Open-Weight MoE-Foundation-Modell eines führenden KI-Entwicklers beeinflusst lokale Bereitstellungsstrategien, Hardware-Anforderungen und Entwickler-Tooling und ist daher hochrelevant für Teams, die On-Premise- oder Consumer-GPU-LLM-Hosting evaluieren.
Marktsignale zu vLLM in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Alibaba hat Qwen 3.6 35B-A3B am 16. April 2026 unter der Apache 2.0-Lizenz veröffentlicht.
- Qwen 3.6 35B-A3B ist ein MoE-Modell, das etwa 3 Milliarden aktive Parameter pro Token nutzt, aber das Laden aller 35 Milliarden Parameter in den Speicher erfordert, was ein praktisches VRAM-Minimum von 24GB bedingt.
- Auf einer 24GB RTX 4090 mit Q4_K_M-Quantisierung und llama.cpp-Tuning erreicht das Modell rund 120 Token/Sekunde; auf einer 24GB RTX 3090 sind es rund 107 tok/s mit Ollama und rund 135,7 tok/s mit llama.cpp plus UD-Q4_K_XL und KV-Cache-Quantisierung.
- Qwen 3.6 35B-A3B erzielt 73,4 % bei SWE-bench, während das dichte Schwestermodell Qwen 3.6 27B 77,2 % erreicht und komfortabler auf 16GB-Hardware läuft.
- VRAM-Schätzungen für die Gewichte: Q4_K_M ca. 21 GB, UD-Q4_K_XL ca. 22,1 GB, Q5_K_M ca. 25,2 GB (übersteigt 24GB), FP16 ca. 71,8 GB.
Verknüpfte Unternehmen
4 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Qwen 3.6-35B-A3B auf heterogenem 30GB-GPU-Setup ausgeführt
Ein Entwickler beschreibt das Upgrade einer autonomen Minecraft-KI namens „Kiwi-chan“, die auf einem heterogenen 30GB-Consumer-GPU-Rig (bestehend aus RTX 3060, RTX 3050, GTX 1660 Ti und GTX 1660 Super) betrieben wird, auf das MoE-Modell Qwen 3.6-35B-A3B-Instruct. Die Active 3 Billion-Architektur von Qwen, die etwa 3,5 Milliarden Parameter pro Token aktiv nutzt, übertrifft dichte Modelle auf gemischten PCIe-Systemen durch geringere Rechen- und Bandbreitenengpässe. In Kombination mit dem Split Mode Graph Tensor-Parallelismus von ik_llama.cpp und einer 8-Bit-Quantisierung des KV-Caches (-ctk q8_0 -ctv q8_0) erreicht das Setup unter Ubuntu Server 24.04 LTS mit CUDA 13.0 einen höheren Durchsatz von rund 70–90 Token/s gegenüber 20–35 Token/s bei dichten Modellen sowie ein nutzbares Kontextfenster von 32K bis 64K. Der Beitrag liefert konkrete Deployment-Flags und Empfehlungen für das Tensor-Splitting auf unterschiedlichen GPUs.
Alibaba veröffentlicht Open-Weight-Modell Qwen3.8-27B für lokale Inferenz
Das Qwen-Team von Alibaba hat das Open-Weight-Modell Qwen3.8-27B unter Apache-2.0-Lizenz veröffentlicht. Das Modell umfasst 27 Milliarden Parameter, bietet Bildverarbeitungsfunktionen sowie ein Kontextfenster von 262.144 Tokens. Durch 4-Bit-Quantisierung lassen sich die Modellgewichte auf rund 17 bis 18 GB komprimieren, was den lokalen Betrieb fortschrittlicher Coding- und Agenten-Workloads auf Consumer-Hardware ermöglicht – etwa auf einer einzelnen 24-GB-GPU (wie RTX 3090/4090) oder Apple Silicon im mittleren Leistungssegment. Unabhängige Benchmarks von Artificial Analysis bewerten das Modell mit einem Score von 52 auf dem Intelligence Index, womit es mit Spitzenmodellen gleichzieht. Zudem zeigt der Terminal-Bench 2.1 für agentenbasierte Programmierung einen signifikanten Leistungssprung gegenüber der Vorgängerversion Qwen3.6-27B. Der zugrunde liegende technische Leitfaden analysiert Runtime-Konfigurationen, Quantisierungsstufen, Hardware-Voraussetzungen und Implementierungsschritte für das lokale Deployment.
Alibaba veröffentlicht neue LLM-Modellfamilie Qwen 3.5 mit nativer Multimodalität
Alibabas Qwen-Team hat die Modellfamilie Qwen 3.5 vorgestellt, angeführt vom Flaggschiff Qwen3.5-397B-A17B sowie der mittleren Variante Qwen3.5-35B-A3B. Zudem umfasst der Release eine 'Small'-Serie (0,8B bis 9B Parameter), die speziell für On-Device- und Edge-Deployments optimiert ist. Technisch markiert Qwen 3.5 einen signifikanten Architekturwechsel: Die Modelle weichen von reinen Dense-Transformern ab, setzen auf neu konzipierte Attention-Mechanismen, extreme Mixture-of-Experts (MoE)-Sparsity und bieten native multimodale Fähigkeiten selbst in smartphone-kompatiblen Größen. Erste Benchmarks positionieren das Flaggschiff auf Augenhöhe mit proprietären Modellen wie GPT-5.2 und Claude Opus 4.5. Der Launch unterstreicht Alibabas Bestreben, einen größeren Teil des Deployment-Stacks zu kontrollieren, und setzt neue Maßstäbe für Open-Weight-Modelle sowohl im High-End- als auch im Edge-Segment.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
