Beobachtetes Signal · 7. Sept. 2026 · Technical Release · Quelle: SemiAnalysis · Relevanz: 5/5 · Sentiment: Positiv
Google TPUv7 Ironwood erzielt bis zu 50 % besseres Preis-Leistungs-Verhältnis
Unabhängige Inferenz-Benchmarks des Analysehauses SemiAnalysis zeigen, dass Googles TPUv7 Ironwood im direkten Vergleich mit NVIDIAs B200- und B300-GPUs ein bis zu 50 % besseres Preis-Leistungs-Verhältnis erzielt. Bei typischen Interaktivitätsanforderungen sinken die Kosten pro Token um 19 bis 34 %. Ausschlaggebend für diesen Effizienzsprung sind das abgestimmte Hardware- und Software-Design, der neue TorchTPU-Stack mit nativem PyTorch-Support sowie Kernel- und Serving-Optimierungen für vLLM und SGLang. Google forciert die Externalisierung seiner TPU-Infrastruktur – sowohl durch Hardware-Direktverkäufe als auch über die Google Cloud Platform, wobei Anthropic bereits als Großkunde fungiert. Der TorchTPU-Stack befindet sich in der Private Beta und soll Mitte Oktober als Open Source bereitgestellt werden. Zusätzliche Funktionen wie Speculative Decoding und disaggregiertes Serving etablieren Googles TPUs als ernsthafte Herausforderer im KI-Inferenzmarkt.
Googles Benchmark-Erfolge unterstreichen die wachsende Wettbewerbsfähigkeit von TPUs gegenüber NVIDIA und könnten die Kostenstruktur sowie die Plattformstrategien im KI-Inferenzmarkt nachhaltig verändern.
Marktsignale zu Google in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Googles TPUv7 Ironwood bietet im Vergleich zu NVIDIAs B200/B300-GPUs ein bis zu 50 % besseres Preis-Leistungs-Verhältnis.
- Ironwood kostet rund 0,181 $ pro Million Token bei 100 Token/s/User (im Vergleich zu 0,222 $ bei B200 und 0,276 $ bei B300).
- Anthropic hat sich für über eine Million TPUs verpflichtet (über 400.000 Direktkäufe und über 600.000 via GCP gemietet).
- Der TorchTPU-Stack für niven PyTorch-Support befindet sich in der Private Beta und wird voraussichtlich Mitte Oktober Open Source.
- Die Nachfolgegeneration TPUv8i Boardfly mit nativem FP4-Support soll mit NVIDIAs Rubin NVL72 konkurrieren.
Verknüpfte Unternehmen
7 verknüpfte Unternehmen“Google has been running disaggregated serving internally and is externalizing its TPU stack....”
“Ironwood delivers up to 50% better performance per dollar compared to B200/B300 from NVIDIA....”
“SemiAnalysis published third-party inference results for TPUv7 Ironwood on InferenceX....”
“Anthropic is the biggest user of TPUs, surpassing Deepmind’s own use by 2029....”
“vLLM and SGLang are the two major open-source production inference serving stacks, and TorchTPU will be the go-to backend for them going for...”
“Red Hat is investing heavily in collaboration with Google to make the TorchTPU backend a first-class experience....”
“SGLang's current public TPU stack uses SGLang-JAX, and TorchTPU will be the go-to backend for SGLang on TPUs going forward....”
Ontologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Google kommerzialisiert TPUv7 und fordert Nvidias Vormachtstellung im KI-Markt heraus
Laut SemiAnalysis vollzieht Google einen strategischen Wandel und bietet seine proprietäre TPUv7-Hardware („Ironwood“) nun auch externen Kunden sowie über GCP an. Zentraler Treiber ist ein Großauftrag von Anthropic über eine Million TPUs, aufgeteilt in Direktkäufe und GCP-Mietkapazitäten. Der Bericht betont, dass die TPUv7 die Leistungslücke zu aktuellen Nvidia-GPUs weitgehend schließt und bei Trainings-Workloads signifikant niedrigere Total Cost of Ownership (TCO) aufweist. Die Architektur setzt auf ein 3D-Torus-ICI-Scale-Up-Netzwerk, OCS-basiertes optisches Routing sowie erweiterte Software-Unterstützung (nativer PyTorch-Support, Pallas-Kernel). Als zentrale Ökosystem-Partner fungieren unter anderem Broadcom, Fluidstack, TeraWulf und Cipher Mining. Diese Kommerzialisierung positioniert Googles Merchant-Silicon als ernsthafte Alternative zu Nvidia und hat weitreichende Implikationen für Rechenzentrumsinfrastruktur, Neocloud-Hosting und globale Hardware-Lieferketten.
Google stellt neue TPU-Generation für KI-Training und -Inferenz vor
Google Cloud hat seine Tensor Processing Units der achten Generation angekündigt und die Produktfamilie in zwei spezialisierte Chips aufgeteilt: den TPU 8t für das Modelltraining und den TPU 8i für die Inferenz. Laut Google bietet der TPU 8t im Vergleich zur vorherigen Generation eine bis zu 2,8- bis 3-mal schnellere Trainingsleistung bei vergleichbaren Kosten, während der TPU 8i eine rund 80 Prozent bessere Leistung pro Dollar bei Inferenz-Workloads erzielt. Zudem lassen sich mehr als eine Million TPUs in einem einzigen Cluster betreiben. Google betont, dass die eigenen Chips Nvidia-GPUs in der Cloud zunächst ergänzen und diese nicht sofort ersetzen werden; Nvidias Vera Rubin GPU soll noch in diesem Jahr verfügbar sein. Flankiert wird dies von einer Kooperation zur Optimierung des Software-basierten Netzwerkstandards Falcon für Nvidia-Systeme. Dieser Schritt positioniert Google Cloud als skalierbare Rechenalternative für große KI-Workloads bei gleichzeitiger Interoperabilität mit Nvidia-Infrastrukturen.
Google baut TPU-Vorsprung im KI-Computing-Wettlauf gezielt aus
Alphabets hauseigene Tensor Processing Units (TPUs) etablieren sich zunehmend als kosten- und energieeffiziente Alternative zu Nvidia-GPUs. Sie treiben nicht nur Googles Gemini-Modelle an, sondern beschleunigen auch das B2B-Wachstum der Google Cloud. Google stellte die achte TPU-Generation mit separaten Varianten für Training (TPU 8t) und Inference (TPU 8i) vor und verspricht bis zu dreimal schnelleres Training sowie eine um 80 % bessere Cost-Performance. Parallel dazu forciert der Konzern die Kommerzialisierung über Cloud-Vermietung, direkte Hardware-Verkäufe und ein TPU-Cloud-Joint-Venture mit Blackstone. Führende KI-Akteure wie Anthropic und Meta nutzen bereits TPUs im großen Stil. Analysten und Führungskräfte betonen, dass die TPU-Monetarisierung und Effizienzvorteile den Umsatz von Google Cloud signifikant steigern und die Wirtschaftlichkeit von KI-Compute-Infrastrukturen nachhaltig verändern könnten.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
