Beobachtetes Signal · 11. Juni 2026 · Technical Release · Quelle: DEV Community · Relevanz: 3/5 · Sentiment: Neutral

Alibabas Qwen 3.6 35B-A3B MoE-Modell und lokaler 24GB VRAM-Leitfaden

Zusammenfassung des Signals

Der Artikel analysiert Alibabas Qwen 3.6 35B-A3B, ein am 16. April 2026 unter Apache 2.0 veröffentlichtes Mixture-of-Experts (MoE) LLM, und erläutert, warum das Modell die Speicherung aller 35 Milliarden Parameter im Speicher erfordert, woraus sich ein praktisches VRAM-Minimum von 24GB ergibt. Benchmarks und Quantisierungsleitfäden zeigen, dass das Modell auf Consumer-GPUs mit 24GB einen hohen Tokendurchsatz erzielt, wie etwa rund 120 Token pro Sekunde auf einer RTX 4090 mit Q4_K_M und angepassten llama.cpp-Einstellungen. Der Beitrag vergleicht das MoE 35B-A3B mit dem dichten Qwen 3.6 27B, das in rund 16GB passt und bei SWE-bench besser abschneidet, detailliert die VRAM-Auslastung durch Quantisierung sowie KV-Cache und liefert Hardware- und Backend-Empfehlungen für die lokale Bereitstellung über Ollama, llama.cpp, vLLM und Unsloth.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Ein neues Open-Weight MoE-Foundation-Modell eines führenden KI-Entwicklers beeinflusst lokale Bereitstellungsstrategien, Hardware-Anforderungen und Entwickler-Tooling und ist daher hochrelevant für Teams, die On-Premise- oder Consumer-GPU-LLM-Hosting evaluieren.

SIGNAL RADAR

Marktsignale zu vLLM in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • Alibaba hat Qwen 3.6 35B-A3B am 16. April 2026 unter der Apache 2.0-Lizenz veröffentlicht.
  • Qwen 3.6 35B-A3B ist ein MoE-Modell, das etwa 3 Milliarden aktive Parameter pro Token nutzt, aber das Laden aller 35 Milliarden Parameter in den Speicher erfordert, was ein praktisches VRAM-Minimum von 24GB bedingt.
  • Auf einer 24GB RTX 4090 mit Q4_K_M-Quantisierung und llama.cpp-Tuning erreicht das Modell rund 120 Token/Sekunde; auf einer 24GB RTX 3090 sind es rund 107 tok/s mit Ollama und rund 135,7 tok/s mit llama.cpp plus UD-Q4_K_XL und KV-Cache-Quantisierung.
  • Qwen 3.6 35B-A3B erzielt 73,4 % bei SWE-bench, während das dichte Schwestermodell Qwen 3.6 27B 77,2 % erreicht und komfortabler auf 16GB-Hardware läuft.
  • VRAM-Schätzungen für die Gewichte: Q4_K_M ca. 21 GB, UD-Q4_K_XL ca. 22,1 GB, Q5_K_M ca. 25,2 GB (übersteigt 24GB), FP16 ca. 71,8 GB.
Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: DEV Community•Veröffentlicht: 11. Juni 2026
Ursprünglicher Berichttitel: “Qwen 3.6 35B-A3B for Local AI in 2026: The 24GB VRAM Line That Gets You 120 tok/s”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Large Language Models (LLM) & AI29. Apr. 2026

Qwen 3.6-35B-A3B auf heterogenem 30GB-GPU-Setup ausgeführt

Ein Entwickler beschreibt das Upgrade einer autonomen Minecraft-KI namens „Kiwi-chan“, die auf einem heterogenen 30GB-Consumer-GPU-Rig (bestehend aus RTX 3060, RTX 3050, GTX 1660 Ti und GTX 1660 Super) betrieben wird, auf das MoE-Modell Qwen 3.6-35B-A3B-Instruct. Die Active 3 Billion-Architektur von Qwen, die etwa 3,5 Milliarden Parameter pro Token aktiv nutzt, übertrifft dichte Modelle auf gemischten PCIe-Systemen durch geringere Rechen- und Bandbreitenengpässe. In Kombination mit dem Split Mode Graph Tensor-Parallelismus von ik_llama.cpp und einer 8-Bit-Quantisierung des KV-Caches (-ctk q8_0 -ctv q8_0) erreicht das Setup unter Ubuntu Server 24.04 LTS mit CUDA 13.0 einen höheren Durchsatz von rund 70–90 Token/s gegenüber 20–35 Token/s bei dichten Modellen sowie ein nutzbares Kontextfenster von 32K bis 64K. Der Beitrag liefert konkrete Deployment-Flags und Empfehlungen für das Tensor-Splitting auf unterschiedlichen GPUs.

Signal analysieren
Large Language Models (LLM) & AI20. Aug. 2026

Alibaba veröffentlicht Open-Weight-Modell Qwen3.8-27B für lokale Inferenz

Das Qwen-Team von Alibaba hat das Open-Weight-Modell Qwen3.8-27B unter Apache-2.0-Lizenz veröffentlicht. Das Modell umfasst 27 Milliarden Parameter, bietet Bildverarbeitungsfunktionen sowie ein Kontextfenster von 262.144 Tokens. Durch 4-Bit-Quantisierung lassen sich die Modellgewichte auf rund 17 bis 18 GB komprimieren, was den lokalen Betrieb fortschrittlicher Coding- und Agenten-Workloads auf Consumer-Hardware ermöglicht – etwa auf einer einzelnen 24-GB-GPU (wie RTX 3090/4090) oder Apple Silicon im mittleren Leistungssegment. Unabhängige Benchmarks von Artificial Analysis bewerten das Modell mit einem Score von 52 auf dem Intelligence Index, womit es mit Spitzenmodellen gleichzieht. Zudem zeigt der Terminal-Bench 2.1 für agentenbasierte Programmierung einen signifikanten Leistungssprung gegenüber der Vorgängerversion Qwen3.6-27B. Der zugrunde liegende technische Leitfaden analysiert Runtime-Konfigurationen, Quantisierungsstufen, Hardware-Voraussetzungen und Implementierungsschritte für das lokale Deployment.

Signal analysieren
Large Language Models & AI4. März 2026

Alibaba veröffentlicht neue LLM-Modellfamilie Qwen 3.5 mit nativer Multimodalität

Alibabas Qwen-Team hat die Modellfamilie Qwen 3.5 vorgestellt, angeführt vom Flaggschiff Qwen3.5-397B-A17B sowie der mittleren Variante Qwen3.5-35B-A3B. Zudem umfasst der Release eine 'Small'-Serie (0,8B bis 9B Parameter), die speziell für On-Device- und Edge-Deployments optimiert ist. Technisch markiert Qwen 3.5 einen signifikanten Architekturwechsel: Die Modelle weichen von reinen Dense-Transformern ab, setzen auf neu konzipierte Attention-Mechanismen, extreme Mixture-of-Experts (MoE)-Sparsity und bieten native multimodale Fähigkeiten selbst in smartphone-kompatiblen Größen. Erste Benchmarks positionieren das Flaggschiff auf Augenhöhe mit proprietären Modellen wie GPT-5.2 und Claude Opus 4.5. Der Launch unterstreicht Alibabas Bestreben, einen größeren Teil des Deployment-Stacks zu kontrollieren, und setzt neue Maßstäbe für Open-Weight-Modelle sowohl im High-End- als auch im Edge-Segment.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.