Beobachtetes Signal · 21. Juni 2026 · Technical Analysis · Quelle: DEV Community · Relevanz: 2/5 · Sentiment: Neutral
TPUs vs GPUs: Funktionsweise und Architektur von Googles Tensor Processing Units
Dieser technische Leitfaden analysiert, warum Google Tensor Processing Units (TPUs) gezielt für massive Matrixmultiplikationen in neuronalen Netzwerken und anders als GPUs konzipiert hat. Im Zentrum steht die Kernarchitektur: Ein systolisches Array aus Rechenelementen streamt Daten, um speicherintensive Prozesse zu minimieren. Dabei sind Speicherbandbreite und On-Chip-Buffer oft wichtiger als roher Rechendurchsatz. Der Artikel beleuchtet zudem TPU Pods, die als großskalierte Cluster über High-Speed-Interconnects Modell-, Daten- und Pipeline-Parallelismus für das Training von Frontier-Modellen ermöglichen. Abschließend erfolgt ein Vergleich der Anwendungsfälle: GPUs bieten weiterhin höhere Flexibilität und breite Unterstützung, während TPUs bei großen TensorFlow- und JAX-Workloads durch höheren Durchsatz und Energieeffizienz überzeugen.
Liefert eine klare technische Erläuterung der TPU-Architektur und der Abwägung gegenüber GPUs. Dies bietet wertvollen Kontext für Teams bei der Auswahl von KI-Infrastruktur, stellt jedoch keine Plattformankündigung oder Richtlinienänderung dar.
Marktsignale zu Google in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Google entwickelte TPUs speziell zur Beschleunigung matrixintensiver Workloads in neuronalen Netzen anstelle universeller GPU-Architekturen.
- Das systolische Array – ein Raster aus Processing Elements (PEs) zur Datenströmung und -akkumulation – bildet das Herzstück jeder TPU.
- TPUs reduzieren die Speicherbewegung durch große On-Chip-Buffer, High-Bandwidth Memory, Datenwiederverwendung und systolische Ausführung.
- Durch den Zusammenschluss vieler TPUs zu TPU Pods mittels spezialisierter High-Speed-Interconnects werden Modell-, Daten- und Pipeline-Parallelismus für das Training massiver Modelle ermöglicht.
- GPUs bieten dank ihres Ursprungs in der Grafikverarbeitung größere Flexibilität und ein reiferes Tooling, während TPUs vor allem bei großskalierten TensorFlow- und JAX-Workloads glänzen.
Verknüpfte Unternehmen
7 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Google baut TPU-Vorsprung im KI-Computing-Wettlauf gezielt aus
Alphabets hauseigene Tensor Processing Units (TPUs) etablieren sich zunehmend als kosten- und energieeffiziente Alternative zu Nvidia-GPUs. Sie treiben nicht nur Googles Gemini-Modelle an, sondern beschleunigen auch das B2B-Wachstum der Google Cloud. Google stellte die achte TPU-Generation mit separaten Varianten für Training (TPU 8t) und Inference (TPU 8i) vor und verspricht bis zu dreimal schnelleres Training sowie eine um 80 % bessere Cost-Performance. Parallel dazu forciert der Konzern die Kommerzialisierung über Cloud-Vermietung, direkte Hardware-Verkäufe und ein TPU-Cloud-Joint-Venture mit Blackstone. Führende KI-Akteure wie Anthropic und Meta nutzen bereits TPUs im großen Stil. Analysten und Führungskräfte betonen, dass die TPU-Monetarisierung und Effizienzvorteile den Umsatz von Google Cloud signifikant steigern und die Wirtschaftlichkeit von KI-Compute-Infrastrukturen nachhaltig verändern könnten.
Google stellt neue TPU-Generation für KI-Training und -Inferenz vor
Google Cloud hat seine Tensor Processing Units der achten Generation angekündigt und die Produktfamilie in zwei spezialisierte Chips aufgeteilt: den TPU 8t für das Modelltraining und den TPU 8i für die Inferenz. Laut Google bietet der TPU 8t im Vergleich zur vorherigen Generation eine bis zu 2,8- bis 3-mal schnellere Trainingsleistung bei vergleichbaren Kosten, während der TPU 8i eine rund 80 Prozent bessere Leistung pro Dollar bei Inferenz-Workloads erzielt. Zudem lassen sich mehr als eine Million TPUs in einem einzigen Cluster betreiben. Google betont, dass die eigenen Chips Nvidia-GPUs in der Cloud zunächst ergänzen und diese nicht sofort ersetzen werden; Nvidias Vera Rubin GPU soll noch in diesem Jahr verfügbar sein. Flankiert wird dies von einer Kooperation zur Optimierung des Software-basierten Netzwerkstandards Falcon für Nvidia-Systeme. Dieser Schritt positioniert Google Cloud als skalierbare Rechenalternative für große KI-Workloads bei gleichzeitiger Interoperabilität mit Nvidia-Infrastrukturen.
Google TPUv7 Ironwood erzielt bis zu 50 % besseres Preis-Leistungs-Verhältnis
Unabhängige Inferenz-Benchmarks des Analysehauses SemiAnalysis zeigen, dass Googles TPUv7 Ironwood im direkten Vergleich mit NVIDIAs B200- und B300-GPUs ein bis zu 50 % besseres Preis-Leistungs-Verhältnis erzielt. Bei typischen Interaktivitätsanforderungen sinken die Kosten pro Token um 19 bis 34 %. Ausschlaggebend für diesen Effizienzsprung sind das abgestimmte Hardware- und Software-Design, der neue TorchTPU-Stack mit nativem PyTorch-Support sowie Kernel- und Serving-Optimierungen für vLLM und SGLang. Google forciert die Externalisierung seiner TPU-Infrastruktur – sowohl durch Hardware-Direktverkäufe als auch über die Google Cloud Platform, wobei Anthropic bereits als Großkunde fungiert. Der TorchTPU-Stack befindet sich in der Private Beta und soll Mitte Oktober als Open Source bereitgestellt werden. Zusätzliche Funktionen wie Speculative Decoding und disaggregiertes Serving etablieren Googles TPUs als ernsthafte Herausforderer im KI-Inferenzmarkt.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
