Beobachtetes Signal · 22. Juli 2026 · Technical Release · Quelle: TheSequence · Relevanz: 2/5 · Sentiment: Neutral
Inkling: Billionen-Modell aktiviert nur 41 Milliarden Parameter pro Token
Der Artikel stellt Inkling vor, ein Large-Language-Model mit einer nominalen Größe von rund 975 Milliarden Parametern, das jedoch pro Token nur etwa 41 Milliarden Parameter (ca. 4,2 %) aktiv einsetzt. Anstelle eines monolithischen Netzwerks fungiert Inkling als umfangreiches Repository an Spezialistenkapazitäten: Ein Routing-Mechanismus wählt für jedes Token ein kleines Arbeitsset aus, wobei der Beitrag die Auswahl von sechs spezialisierten Abteilungen sowie zwei stets aktiven Allzweckabteilungen beschreibt. Dieses Design führt zu sparsamen arithmetischen Operationen während der Inferenz, erfordert jedoch erhebliche Ressourcen für Speicher, Netzwerkinfrastruktur und Deployment. Der Artikel wurde am 22.07.2026 veröffentlicht.
Beschreibt eine groß angelegte LLM-Architektur mit sparsamer Aktivierung und routerbasierten Experten, die KI-Funktionen in Marketing- und Kreativ-Tools beeinflussen könnte, stellt jedoch keine fundamentale Plattformänderung oder direkte AdTech-Produktlaunche dar.
Marktsignale zu The Sequence in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Inklings nominelle Parameteranzahl wird mit rund 975 Milliarden angegeben.
- Pro Token sind bei Inkling etwa 41 Milliarden Parameter aktiv (ca. 4,2 % der Gesamtzahl).
- Ein Router wählt für jedes Token ein kleines Arbeitsset aus (sechs Spezialabteilungen plus zwei Allzweckabteilungen).
- Das Design ermöglicht eine sparse Arithmetik, während Speicher-, Netzwerk- und Deployment-Anforderungen hoch bleiben.
- Veröffentlichungsdatum des Artikels: 22.07.2026.
Verknüpfte Unternehmen
1 verknüpfte Unternehmen“Title: The Sequence AI of the Week #899: Inside Inkling: A Trillion-Parameter Model That Only Wakes Up 41 Billion at a Time...”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Thinking Machines veröffentlicht Open-Weight-Modell Inkling
Thinking Machines hat Inkling vorgestellt, ein Open-Weights Multimodal-Fundamentmodell auf Basis einer Mixture-of-Experts-Architektur mit rund 975 Milliarden Gesamtparametern und etwa 41 Milliarden aktiven Parametern pro Task. Das 66-layer decoder-only transformer-Modell verarbeitet nativ Text, Bilder sowie Audio und wurde auf Basis einer strategischen Partnerschaft mit NVIDIA auf NVIDIA GB300 NVL72 Systemen von Grund auf trainiert. Inkling unterstützt Kontexte von bis zu einer Million Token (über die Tinker API sind 256K verfügbar) und erscheint unter einer Apache-2.0-Lizenz mit sofortiger Integration in führende Ökosysteme wie Hugging Face, vLLM und Databricks. Ergänzt durch eine kleinere Preview-Version richtet sich das Modell gezielt an Unternehmen, die datenschutzkonforme Enterprise Fine-Tuning-Prozesse realisieren möchten.
ByteDance setzt auf KI-Sprachmodell mit 5 bis 10 Billionen Parametern
Berichten zufolge bündelt ByteDance im August 2026 Talente, Daten und Rechenleistung für ein ambitioniertes Sprachmodellprojekt mit dem internen Codenamen Seed bzw. Seedance. Laut LatePost steuert das Projekt auf über 5 Billionen Parameter zu, während die Financial Times in der Frühphase des Trainings sogar bis zu 10 Billionen Parameter nennt. Die Unternehmensführung, darunter Gründer Zhang Yiming und CEO Liang Rubo, priorisiert Spitzenleistungen im KI-Bereich gegenüber reinen Benchmark-Ergebnissen oder der Destillation bestehender Modelle. Dieser strategische Schwenk steht im Gegensatz zu ByteDances bisheriger Methodik, schnell zu iterieren und Ressourcen auf kurzlebigere Consumer-Apps zu konzentrieren. Zur Finanzierung dieser langfristigen KI-Infrastruktur trug unter anderem der Verkauf des Gaming-Studios Moonton im März 2026 bei, während gleichzeitig das KI-Flaggschiff Doubao bis Juni 2026 eine starke Nutzerbasis verzeichnen konnte.
Tasteful Tokenmaxxing: KI-Führungskräfte setzen auf Tiefe statt Breite
Der AINews-Überblick vom 23. April 2026 beleuchtet Branchentrends hin zu effizienter KI-Nutzung und Plattformfortschritten. Im Fokus steht der Trend des „Tokenmaxxing“ – der gezielte, verschwendungsfreie Einsatz von Model-Tokens. Viele Entwicklungsleiter bevorzugen demnach tiefere, serielle Autoresearch-Schleifen gegenüber massiv parallelen LLM-Läufen. Zu den wichtigsten technologischen Ankündigungen zählen Googles TPU v8-Familie (TPU 8t für Training, TPU 8i für Inferenz), die Gemini Enterprise Agent Platform sowie Workspace Intelligence, Alibabas Open-Source-Modell Qwen3.6-27B, OpenAIs Apache-2.0 Privacy Filter zur PII-Erkennung und -Maskierung sowie Xiaomis MiMo-V2.5-Modelle. Weitere analysierte Trends umfassen die Standardisierung von Agent-Harness-Abstraktionen, BYOM-Unterstützung (Bring-Your-Own-Model) in Entwicklungswerkzeugen, Traces und Agent-Daten als Kernprimitive, Verbesserungen beim Post-Training-RL sowie kontinuierliche Innovationen zur Inferenz-Effizienz.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
