Beobachtetes Signal · 12. Aug. 2026 · Technical Release · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Neutral
DeepSeek V3 LLM mit SGLang auf ROCm und AMD Instinct bereitstellen
Dieser technische Leitfaden demonstriert die Bereitstellung von DeepSeek V3, einem Mixture-of-Experts Sprachmodell mit 671 Milliarden Parametern, über den SGLang Inference Server in einem ROCm-aktivierten Docker-Container auf einem AMD Instinct MI300X GPU-Host. Die Anleitung erläutert den Modell-Download per Hugging Face CLI, das Klonen und Erstellen des SGLang ROCm-Containers auf Basis des Branches v0.4.2 sowie den Serverstart mit GPU-Gerätezugriff und Tensor Parallelism (--tp 8). Die Inferenzverifizierung erfolgt über einen OpenAI-kompatiblen HTTP-Endpunkt auf Port 30000. Voraussetzung ist der Zugriff auf eine AMD MI300X GPU-Instanz mit hoher VRAM-Kapazität; die vollständige Dokumentation wird über Vultr bereitgestellt.
Praktischer Implementierungsleitfaden für den Betrieb eines großen MoE LLM auf AMD MI300X unter Verwendung von SGLang und ROCm; relevant für Ingenieure im Bereich der LLM-Inferenzinfrastruktur, jedoch ohne branchenverändernde Tragweite.
Marktsignale zu AMD in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- DeepSeek V3 ist ein Mixture-of-Experts Sprachmodell mit 671 Milliarden Parametern, das auf 14,8 Billionen Token vortrainiert wurde.
- Die Anleitung beschreibt die Bereitstellung von DeepSeek V3 via SGLang in einem ROCm-unterstützten Docker-Container auf einem AMD Instinct MI300X GPU-Server.
- Der Modell-Download wird über die Hugging Face CLI mit dem Identifikator deepseek-ai/DeepSeek-V3 initiiert.
- SGLang wird aus dem sgl-project GitHub-Repository geklont, aus dem Branch v0.4.2 als ROCm Docker-Image gebaut und ausgeführt.
- Der Inference Server läuft mit Tensor Parallelism über 8 GPUs und stellt eine OpenAI-kompatible API auf Port 30000 für Chat Completions bereit.
Verknüpfte Unternehmen
4 verknüpfte Unternehmen“This guide deploys it via SGLang in a ROCm-supported container on an AMD Instinct MI300X GPU server, then verifies inference over HTTP....”
“Install the Hugging Face CLI and start the model download in the background — it's large, so kick it off early and continue with the next st...”
“$ git clone https://github.com/sgl-project/sglang.git...”
“This track will guide you through Google AI Studio's new "Build apps with Gemini" feature, where you can turn a simple text prompt into a fu...”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Qwen 3.8-27B lokal auf RTX 3090 mit Unsloth und DeepSeek betreiben
Ein technischer Leitfaden von Jacques Gariépy beschreibt Schritt für Schritt, wie sich das Modell Qwen 3.8-27B lokal auf einer NVIDIA RTX 3090 mit 24 GB VRAM ausführen lässt. Als lokale Inferenz-Engine dient Unsloth mit llama.cpp CUDA 13, während DeepSeek Harness als Agent-Orchestrierungs-Runtime fungiert. Der Leitfaden behandelt den Bezug von Token, einen Windows-spezifischen SSLKEYLOGFILE-Patch, die Kompilierung sowie empfohlene Startparameter für llama-server.exe wie FlashAttention-2, Q8-KV-Cache und 32k-Kontext. Zudem werden die Konfiguration via .env und Cordis, Windows-Fehlerbehebungen sowie gemessene Benchmarks von rund 125 Prompt-Token/s und 38 generierten Token/s bei einer VRAM-Auslastung von etwa 23,5 GB erläutert.
DeepSeek v4 Day‑0 to Day‑43 Inference Performance Report
SemiAnalysis’ InferenceX published an engineering analysis of DeepSeek v4 Pro’s Day‑0 through Day‑43 inference performance across multiple accelerator SKUs (GB300 NVL72, Huawei Ascend 950DT, MI355X, B200/B300, H200). The report documents Day‑0 support on CUDA and Huawei CANN, early ROCm/AMD regressions and a subsequent >100x AMD throughput improvement by Day 26 led by HaiShaw’s team. It details kernel and runtime issues (notably a TensorRT‑LLM fused HC hidden‑size guard), PRs submitted to TensorRT‑LLM, and many incremental software optimizations (MTP, MegaMoE, FP4 paths, AITER kernels, Triton/TileLang/FlyDSL integration). The article highlights rack‑scale GB300 NVL72 SGLang results (with CoreWeave providing GB300 racks), discusses DeepSeek v4 architectural features (HCA/CSA, MegaMoE) and reports throughput and tokens‑per‑MW efficiency gains tied to software improvements.
So betreiben Entwickler Large Language Models lokal auf eigener Hardware
Ein von Nilesh Raut veröffentlichter Praxis-Leitfaden zeigt, wie Entwickler Large Language Models lokal ausführen können, um API-Kosten zu senken, Datenschutzvorgaben zu erfüllen, Offline-Workflows zu ermöglichen und die Experimentiergeschwindigkeit zu erhöhen. Die Anleitung demonstriert die Installation von Ollama, das Laden von Modellen wie Llama 3 und Qwen2.5-Coder:7b sowie die Nutzung einer lokalen REPL-Umgebung. Zudem wird die Integration in VS Code mithilfe von Continue.dev und Cline sowie das Hosting einer ChatGPT-ähnlichen Benutzeroberfläche über Open WebUI in Docker auf Port 3000 erläutert. Empfohlen werden Modelle wie Qwen2.5 Coder, DeepSeek Coder, Llama 3, Phi und Mistral bei einer Mindesthardwareausstattung von 16 GB RAM, einer SSD und idealerweise einer NVIDIA-GPU für verbesserte Inferenz-Performance. Typische Anwendungsfälle umfassen Coding-Assistenz, Refactoring, Dokumentation und kleinere Agenten-Workflows.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
