Beobachtetes Signal · 21. Juli 2026 · Technical Release · Quelle: TheSequence · Relevanz: 3/5 · Sentiment: Positiv

Teacher Traces: DeepSeek destilliert Reasoning-Fähigkeiten in kleinere LLMs

Zusammenfassung des Signals

Ein Fachbeitrag analysiert ein Experiment von DeepSeek aus dem Januar 2025, bei dem das Reasoning-Modell R1 rund 800.000 ausgearbeitete Lösungswege generierte. Nach Filterung auf Korrektheit und Lesbarkeit nutzte DeepSeek simples Supervised Fine-Tuning mittels Next-Token Prediction auf verschiedenen Open-Source-Modellen (Qwen mit 1.5B bis 32B; Llama mit 8B und 70B) – vollständig ohne Reinforcement Learning oder On-Policy-Methoden. Die destillierten Modelle zeigten unerwartet starke emergente Reasoning-Muster: Das 32B-Modell löste komplexe Mathematikaufgaben auf Wettbewerbsniveau, während ein 7B-Modell eigenständige Zwischenschritt-Verifizierungen und logische Verzweigungen entwickelte. Dieses Ergebnis überrascht die Branche, da naive sequenzbasierte Imitation bisher als unzureichend für komplexes Reasoning galt.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Die Methode belegt, dass simples Supervised Distillation hochentwickeltes Reasoning in kompakte Modelle übertragen kann. Dies senkt Inference-Kosten drastisch und beschleunigt On-Device-KI-Deployments im Enterprise-Segment.

SIGNAL RADAR

Marktsignale zu DeepSeek in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • DeepSeek generierte im Januar 2025 rund 800.000 Chain-of-Thought-Lösungswege mit dem R1-Reasoning-Modell.
  • Nach Qualitätsfilterung erfolgte ein reines Supervised Fine-Tuning auf offenen Modellen (Qwen 1.5B–32B, Llama 8B und 70B).
  • Der Trainingsansatz verzichtete vollständig auf Reinforcement Learning, Reverse KL Divergence oder On-Policy Sampling.
  • Die destillierten Modelle entwickelten emergente Fähigkeiten wie Selbstverifikation und fortgeschrittene mathematische Problemlösungskompetenz.

Verknüpfte Unternehmen

3 verknüpfte Unternehmen

“In January 2025, DeepSeek took its big reasoning model, R1, and used it to generate around 800,000 worked solutions — long, rambling chains ...”

“Title: The Sequence Knowledge #898: The Trace Is the Teacher: Distilling Reasoning Into Small Models...”

Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: TheSequence•Veröffentlicht: 21. Juli 2026
Ursprünglicher Berichttitel: “The Sequence Knowledge #898: The Trace Is the Teacher: Distilling Reasoning Into Small Models”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Large Language Models & AI17. Juli 2026

Gezielte Prompts zwingen Reasoning-LLMs zu ressourcenintensiven Endlosschleifen

Forscher der Zhejiang-Universität demonstrieren in einem auf der ICML vorgestellten arXiv-Paper (2605.13338), wie Large Reasoning Models (LRMs) durch logisch inkonsistente oder unvollständige Prompts in redundante interne Denkschleifen („Overthinking“) getrieben werden können. Mittels eines hierarchischen genetischen Algorithmus (HGA) generierten die Wissenschaftler gezielt Eingaben mit Trigger-Wörtern wie „aber“, „warte“ oder „vielleicht“, um die Argumentationskette maximal zu verlängern. Bei Tests mit vier führenden LRMs – DeepSeek-R1, Qwen3-Thinking, GPT-o3 und Gemini-2.5-Flash – auf modifizierten MATH-Bench-Aufgaben stieg die Antwortlänge um das bis zu 26-Fache. Dieser massive Anstieg des Token-, Compute- und Energieverbrauchs eröffnet einen neuartigen, prompt-basierten Denial-of-Service-Angriffsvektor gegen Inferenz-Infrastrukturen. Die Autoren fordern daher ein proaktives Monitoring von Reasoning-Loops, verbesserte Erkennungsmechanismen für inkonsistente Inputs sowie robuste Schutzmaßnahmen für Model-Serving-Architekturen.

Signal analysieren
Large Language Models (LLM) & AI26. Apr. 2026

DeepSeek-R1 Reasoning-API: Produktionsleitfaden und Implementierung von Chain-of-Thought

DeepSeek-R1 ist ein LLM-Inferenzmodell, das seine Chain-of-Thought über eine API zugänglich macht und explizite Zwischenschritte vor der finalen Antwort zurückgibt. Der Leitfaden dokumentiert das API-Verhalten, darunter ein separates 'reasoning_content'-Feld sowie im Streaming stets vorangestellte Reasoning-Token. Empfohlene Produktionsmuster umfassen Logging, Reasoning-bewusste Agenten-Loops und Validator-Pipelines. Die Bereitstellung erfolgt über ein einheitliches Gateway wie ofox.ai. Da die Generierung von Reasoning-Token die Latenz um das Zwei- bis Vierfache erhöht, eignet sich das Modell insbesondere für asynchrone, Batch- oder erklärungsbedürftige Use Cases. Zudem werden niedrige Token-Kosten hervorgehoben – genannt werden 0,28 US-Dollar pro Million Token sowie ein Beispielwert von 0,42 US-Dollar pro Million Output-Token –, wodurch transparente Reasoning-Prozesse in Enterprise-KI-Stacks wirtschaftlicher skalierbar werden.

Signal analysieren
Large Language Models (LLM) & AI18. Aug. 2026

Test-Time Compute Distillation: Modelle lernen schnelleres und effizienteres Reasoning

Die Analyse untersucht, wie sich Test-Time Compute neben Modellparametern und Trainingsdaten als dritte Skalierungsachse für Reasoning-Modelle etabliert hat. Bisherige Verfahren wie Chain-of-Thought, Tree Search oder Ensembles mit Majority Voting erfordern jedoch rechenintensive Inferenzprozesse. Das Konzept der „Test-Time Compute Distillation“ adressiert diesen Engpass: Dabei fungiert der aufwendige Inferenz-Ablauf als Teacher, dessen multimodale Reasoning-Muster zurück in die Modellgewichte komprimiert werden. Das Ziel ist es, die Qualität komplexer Multi-Sample-Abfragen in einem einzigen Forward Pass zu replizieren. Diese Form der Self-Distillation nutzt dasselbe Netzwerk mit temporär erweitertem Inferenz-Budget als Lehrmeister. Der Ansatz bietet enormes Potenzial, um wiederkehrende operative Inferenzkosten drastisch zu senken und hochperformante Reasoning-Fähigkeiten direkt und ressourceneffizient in Basismodellen zu verankern.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.