Beobachtetes Signal · 20. Apr. 2026 · Interview · Quelle: Chipstrat · Relevanz: 4/5 · Sentiment: Positiv
Meta VP Matt Steiner über Ads-Infrastruktur und KI-Skalierung
Meta-VP Matt Steiner erläutert, wie Metas Ad-Stack Hardware- und Softwaredesign für Empfehlungssysteme und generative KI antreibt. Er beschreibt eine zweistufige Ad-Serving-Pipeline: Retrieval, angetrieben von Andromeda auf einer co-designten NVIDIA Grace Hopper SKU, und Ranking, konsolidiert in einem Einzelmodell namens Lattice. Meta trainierte ein großes Foundation Model namens GEM und destillierte es zu einem servierfähigen, adaptiven Ranking-Modell mit rund einer Billion Parametern bei Latenzen im Sub-Sekunden-Bereich. Recommender-Workloads sind speichergebunden mit einem anderen Compute-Memory-Profil als Standard-LLM-GPUs, was Metas Arbeit an eigener MTIA-Hardware motiviert. Steiner hebt zudem durch LLMs geschriebene Kernel hervor, um hardwarespezifische Optimierungen zu automatisieren, und prognostiziert eine steigende Nachfrage nach optimierten Kerneln, während Metas heterogene Flotte wächst. Er betont die End-to-End-Co-Optimierung von Hardware, Networking, Modellen und Software in den kommenden zwei Jahren.
Liefert fundierte technische Einblicke eines Meta-VP in großskalierte Ads-Infrastruktur, Modellkonsolidierung, kundenspezifische Silizium-Entwicklung (MTIA) und Hardware-Software-Co-Design für AdTech- und Infrastrukturstrategien.
Marktsignale zu Meta in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Matt Steiner ist VP of Monetization Infrastructure, Ranking & AI Foundations bei Meta.
- Meta unterteilt das Ad-Serving in die Phasen Retrieval (Andromeda) und Ranking (Lattice).
- Meta trainierte GEM als Foundation Model und destillierte es in ein adaptives Ranking-Modell mit ca. einer Billion Parametern bei Sub-Sekunden-Latenz.
- Recommender-Retrieval-Workloads sind speichergebunden; Meta co-designte eine kundenspezifische NVIDIA Grace Hopper SKU.
- Meta entwickelt MTIA-Beschleuniger und nutzt LLM-generierte Kernel (Alpha Evolve / KernelEvolve) zur Software-Optimierung.
Verknüpfte Unternehmen
3 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Meta's ROIC Strategy: GEM Now, LLMs Later
ChipStrat analyzes Meta’s capital allocation approach: prioritize GEM (Generative Ads Recommendation Model) now to generate immediate, measurable ROI in ad ranking and monetization, while investing in frontier LLMs later for layered upside. Meta treats GEM as a large-scale teacher model that transfers knowledge to smaller, latency-sensitive serving models, keeping inference costs low. The company reports concrete ad-performance gains tied to recent model and infrastructure investments (+5% Instagram conversions; +3% Facebook Feed conversions; +3.5% Facebook ad clicks in Q4). Meta is also diversifying compute (NVIDIA, AMD, and custom MTIA silicon) and unifying ranking across paid and organic content. Concurrently, Meta funds Superintelligence Labs (co-led by Alexandr Wang and Nat Friedman) to build frontier LLMs that could further enhance recommendations, creative generation, and content localization.
Meta setzt auf eigene MTIA-KI-Chips zur Rechenzentrumsexpansion
Meta hat vier eigene KI-Chips der MTIA-Familie (Meta Training and Inference Accelerator) vorgestellt, um die Rechenzentrumskapazitäten massiv auszubauen. Bereits im Einsatz ist der MTIA 300 für das Ranking, Empfehlungen und die Ad Delivery; der auf generative KI-Inferenz optimierte MTIA 400 hat Tests abgeschlossen und steht vor dem Rollout, während MTIA 450 und MTIA 500 für 2027 geplant sind. Die Chips werden von Taiwan Semiconductor produziert; ein Rack soll künftig 72 MTIA-400-Chips fassen. Mit der Eigenentwicklung will Meta das Preis-Leistungs-Verhältnis verbessern, Lieferketten diversifizieren und sich gegen Preisschwankungen absichern, trotz anhaltender Herausforderungen bei High-Bandwidth Memory (HBM). Gleichzeitig wurden langfristige Großverträge für Nvidia- und AMD-GPUs geschlossen, um maximale Flexibilität zu wahren.
Meta's Kunlun Recommender Shows Predictable Scaling
This Import AI issue surveys recent AI research and benchmarks, with a focus on Meta/Facebook’s new Kunlun recommender architecture and its discovered scaling laws. Meta describes Kunlun’s modular design (Transformer and Interaction blocks) that raises Model FLOPs Utilization (MFU) from 17% to 37% on NVIDIA B200 GPUs and demonstrates predictable power-law scaling in recommender performance measured by normalized entropy (NE). Meta reports deployment of Kunlun across major Meta Ads models with a reported 1.2% improvement in topline metrics. The newsletter also summarizes AIRS-BENCH (a 20-task benchmark from Meta and UK universities) showing current agents trail best-in-class humans, First Proof (a sealed 10-question frontier-math benchmark from multiple universities) which state-of-the-art models currently fail in one-shot settings, and a Nick Bostrom paper arguing trade-offs in timing development of superintelligence.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
