Beobachtetes Signal · 2. Apr. 2026 · Technical Release · Quelle: techcrunch · Relevanz: 4/5 · Sentiment: Positiv
Microsoft stellt drei neue MAI-Foundational-Modelle für KI vor
Microsoft AI hat drei neue multimodale Foundational-Modelle veröffentlicht — MAI-Transcribe-1, MAI-Voice-1 und MAI-Image-2 —, die Text, Sprache bzw. Video generieren. Die vom MAI-Superintelligence-Team unter der Leitung von Mustafa Suleyman entwickelten Modelle werden über Microsoft Foundry sowie MAI Playground bereitgestellt. Microsoft positioniert die Modelle als kostengünstigere Alternativen zu Angeboten von Google und OpenAI und veröffentlichte entsprechende Preisstrukturen. Das Unternehmen betonte, dass es mehr als 13 Milliarden US-Dollar in sein KI-Forschungslabor investiert hat, und bekräftigte seine fortlaufende Partnerschaft mit OpenAI, während es gleichzeitig die eigene Superintelligenz-Forschung vorantreibt.
Die Veröffentlichung multimodaler Foundational-Modelle durch einen großen Cloud- und Plattform-Anbieter wie Microsoft und deren Integration in das Foundry-Ökosystem beeinflusst die KI-Infrastruktur, den Preiswettbewerb mit Google und OpenAI sowie die Verfügbarkeit generativer Funktionen für Produkt- und Marketing-Teams maßgeblich.
Marktsignale zu Microsoft in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Microsoft AI hat drei Foundational-Modelle veröffentlicht: MAI-Transcribe-1, MAI-Voice-1 und MAI-Image-2.
- MAI-Transcribe-1 transkribiert Sprache in 25 Sprachen und ist laut Microsoft 2,5-mal schneller als das Azure Fast-Angebot.
- MAI-Voice-1 generiert Audio, kann laut Angaben 60 Sekunden Audio in einer Sekunde erzeugen und unterstützt benutzerdefinierte Stimmen.
- MAI-Image-2 ist ein Videogenerierungsmodell, das nun auf Microsoft Foundry verfügbar ist.
- Veröffentlichte Preisgestaltung: MAI-Transcribe-1 ab 0,36 USD/Stunde; MAI-Voice-1 ab 22 USD pro 1 Mio. Zeichen; MAI-Image-2 ab 5 USD pro 1 Mio. Text-Input-Token und 33 USD pro 1 Mio. Image-Output-Token.
Verknüpfte Unternehmen
4 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Microsoft stellt sieben eigene MAI-Modelle inklusive MAI-Thinking-1 vor
Auf der Build 2026 hat Microsoft sieben eigene MAI-Modelle angekündigt und treibt damit den Aufbau eines proprietären Frontier-KI-Stacks unabhängig von OpenAI voran. Im Fokus stehen das Reasoning-Modell MAI-Thinking-1 als spärliches Mixture-of-Experts-System mit 35 Milliarden aktiven Parametern und einer 256.000-Token-Kontextfenster sowie das Coding-Modell MAI-Code-1-Flash, das bei komplexen Aufgaben deutlich weniger Tokens verbraucht als vergleichbare Lösungen. Microsoft vertreibt die MAI-Modelle über Azure Foundry sowie Drittanbieter-Inferenzprovider wie Fireworks AI, Baseten und OpenRouter und hat MAI-Code-1-Flash direkt in den GitHub Copilot integriert. Ergänzt wird die Veröffentlichung durch multimodale Upgrades wie MAI-Image-2.5, MAI-Voice-2 und MAI-Transcribe-1.5, was die strategische Absicht unterstreicht, Entwicklern und Enterprise-Kunden ein eigenständiges, wettbewerbsfähiges KI-Ökosystem bereitzustellen.
Microsoft stellt eigene KI-Modelle vor, um OpenAI-Abhängigkeit und Kosten zu senken
Auf der Entwicklerkonferenz Build am 2. Juni 2026 in San Francisco hat Microsoft neue proprietäre KI-Modelle vorgestellt, um die Abhängigkeit von Drittanbietern wie OpenAI zu verringern und die Entwicklerkosten zu senken. Das Unternehmen präsentierte MAI-Code-1-Flash, ein auf Coding spezialisiertes Modell, das direkt in GitHub Copilot und Visual Studio Code integriert ist, sowie MAI-Thinking-1, ein mittelgroßes Reasoning-Modell in einer Private Preview über Microsoft Foundry. Microsoft betonte signifikante Effizienzgewinne und reduzierte Token-Kosten als Kernvorteile. Zudem wurden aktualisierte Cloud-Modelle für Spracherkennung, synthetische Stimmen, Bildgenerierung sowie On-Device-Aion-Modelle für Windows-PCs angekündigt. Durch den nativen Betrieb der eigenen Modelle auf Azure will Microsoft erhebliche Kostenvorteile realisieren und sich strategisch robuster gegenüber OpenAI, Anthropic und Google positionieren. Zuvor hatte Microsoft 13 Milliarden Dollar in OpenAI und 5 Milliarden Dollar in Anthropic investiert.
Microsoft Launches MAI-Transcribe-2, Cheapest and Most Accurate in Market
Microsoft AI has launched MAI-Transcribe-2, a speech-to-text model that supports 60 languages and achieves top accuracy on the FLEURS benchmark with a 5.2% average word error rate. The model is 10x faster than OpenAI's GPT-Transcribe, 7x faster than ElevenLabs' Scribe v2, and 5x faster than Google's Gemini 3.5 Transcribe. It offers features like speaker diarization, word-level timestamps, keyword biasing, and code-switching. Priced at $0.10 per audio hour (promotional until end of year), it undercuts competitors significantly. For Thai, it achieves a 3.4% word error rate, besting Gemini 3.5 Transcribe (3.8%) and Whisper v3-large (8.7%). The model is available via Microsoft Foundry, MAI Playground, and OpenRouter, and is part of Microsoft's strategy to replace OpenAI technologies with in-house models.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
