Beobachtetes Signal · 29. Apr. 2026 · Technical Release · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Positiv
Qwen 3.6-35B-A3B auf heterogenem 30GB-GPU-Setup ausgeführt
Ein Entwickler beschreibt das Upgrade einer autonomen Minecraft-KI namens „Kiwi-chan“, die auf einem heterogenen 30GB-Consumer-GPU-Rig (bestehend aus RTX 3060, RTX 3050, GTX 1660 Ti und GTX 1660 Super) betrieben wird, auf das MoE-Modell Qwen 3.6-35B-A3B-Instruct. Die Active 3 Billion-Architektur von Qwen, die etwa 3,5 Milliarden Parameter pro Token aktiv nutzt, übertrifft dichte Modelle auf gemischten PCIe-Systemen durch geringere Rechen- und Bandbreitenengpässe. In Kombination mit dem Split Mode Graph Tensor-Parallelismus von ik_llama.cpp und einer 8-Bit-Quantisierung des KV-Caches (-ctk q8_0 -ctv q8_0) erreicht das Setup unter Ubuntu Server 24.04 LTS mit CUDA 13.0 einen höheren Durchsatz von rund 70–90 Token/s gegenüber 20–35 Token/s bei dichten Modellen sowie ein nutzbares Kontextfenster von 32K bis 64K. Der Beitrag liefert konkrete Deployment-Flags und Empfehlungen für das Tensor-Splitting auf unterschiedlichen GPUs.
Liefert praxisnahe, reproduzierbare Optimierungen für das Self-Hosting großer MoE LLMs auf kostengünstigen, heterogenen Consumer-GPU-Rigs. Dies ist für Praktiker bei lokalen Inferenz-Deployments von direktem Nutzen, besitzt jedoch eine eher begrenzte branchenweite Tragweite.
Marktsignale zu NVIDIA in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Der Autor betreibt ein heterogenes GPU-Rig aus NVIDIA RTX 3060 (12GB), RTX 3050 (6GB), GTX 1660 Ti (6GB) und GTX 1660 Super (6GB) mit insgesamt 30GB VRAM.
- Das gewählte Modell Qwen 3.6-35B-A3B-Instruct aktiviert durch seinen MoE-Ansatz ca. 3,5 Milliarden Parameter pro Token, anstatt alle 35 Milliarden zu berechnen.
- ik_llama.cpp (ein Fork von llama.cpp) implementiert Split Mode Graph Tensor-Parallelismus und steigert den Durchsatz auf gemischten GPUs um das Dreifache bis Vierfache.
- Die 8-Bit-KV-Cache-Quantisierung (-ctk q8_0 -ctv q8_0) verdoppelte das nutzbare Kontextfenster bei minimalem Qualitätsverlust auf ca. 32K–64K.
- Der gemessene Inferenz-Durchsatz liegt bei ~70–90 Token/s im Vergleich zu ~20–35 Token/s bei einem dichten 31B-Modell auf Ubuntu Server 24.04 LTS mit CUDA 13.0.
Verknüpfte Unternehmen
2 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Alibabas Qwen 3.6 35B-A3B MoE-Modell und lokaler 24GB VRAM-Leitfaden
Der Artikel analysiert Alibabas Qwen 3.6 35B-A3B, ein am 16. April 2026 unter Apache 2.0 veröffentlichtes Mixture-of-Experts (MoE) LLM, und erläutert, warum das Modell die Speicherung aller 35 Milliarden Parameter im Speicher erfordert, woraus sich ein praktisches VRAM-Minimum von 24GB ergibt. Benchmarks und Quantisierungsleitfäden zeigen, dass das Modell auf Consumer-GPUs mit 24GB einen hohen Tokendurchsatz erzielt, wie etwa rund 120 Token pro Sekunde auf einer RTX 4090 mit Q4_K_M und angepassten llama.cpp-Einstellungen. Der Beitrag vergleicht das MoE 35B-A3B mit dem dichten Qwen 3.6 27B, das in rund 16GB passt und bei SWE-bench besser abschneidet, detailliert die VRAM-Auslastung durch Quantisierung sowie KV-Cache und liefert Hardware- und Backend-Empfehlungen für die lokale Bereitstellung über Ollama, llama.cpp, vLLM und Unsloth.
Lokale LLMs erreichen praktische Alltagstauglichkeit auf Consumer-Hardware
Ein Entwickler berichtet über signifikante Fortschritte bei der lokalen Ausführung von Large Language Models auf Consumer-Hardware mit zwei RX6800 GPUs und 64 GB RAM. Neuere Qwen-Modelle bieten nun eine überzeugende Performance: Das dichte Modell Qwen3.6-27B überzeugt durch hohe Genauigkeit, während die Mixture-of-Experts-Variante Qwen3.6-35B-A3B durch Geschwindigkeit für agentenbasierte Aufgaben punktet und Qwen-Coder-Next-80B speziell für Programmieraufgaben optimiert ist. Auf Infrastrukturebene verbessern Neuerungen wie der experimentelle Router-Modus von llama.cpp sowie optimierte Attention-Checkpoints und Kontext-Slots die Handhabung erheblich. Ergänzt durch Harnesses wie Hermes und Pi ermöglichen diese lokalen Inferenz-Lösungen eine datenschutzkonforme, netzwerkunabhängige und kosteneffiziente Entwicklung ohne kommerzielle Inferenz-Anbieter. Dies erlaubt Teams eine flexible Evaluierung von On-Premise-Szenarien und Datenschutzanforderungen abseits zentralisierter Cloud-Infrastrukturen.
Qwen 3.8-27B lokal auf RTX 3090 mit Unsloth und DeepSeek betreiben
Ein technischer Leitfaden von Jacques Gariépy beschreibt Schritt für Schritt, wie sich das Modell Qwen 3.8-27B lokal auf einer NVIDIA RTX 3090 mit 24 GB VRAM ausführen lässt. Als lokale Inferenz-Engine dient Unsloth mit llama.cpp CUDA 13, während DeepSeek Harness als Agent-Orchestrierungs-Runtime fungiert. Der Leitfaden behandelt den Bezug von Token, einen Windows-spezifischen SSLKEYLOGFILE-Patch, die Kompilierung sowie empfohlene Startparameter für llama-server.exe wie FlashAttention-2, Q8-KV-Cache und 32k-Kontext. Zudem werden die Konfiguration via .env und Cordis, Windows-Fehlerbehebungen sowie gemessene Benchmarks von rund 125 Prompt-Token/s und 38 generierten Token/s bei einer VRAM-Auslastung von etwa 23,5 GB erläutert.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
