Beobachtetes Signal · 18. Mai 2026 · Product Launch · Quelle: https://martechseries.com/feed/ · Relevanz: 3/5 · Sentiment: Positiv
WaveSpeed erweitert vereinheitlichte LLM-API auf über 260 Modelle
WaveSpeed hat eine erweiterte, vereinheitlichte LLM-API angekündigt, die Entwicklern Zugriff auf mehr als 260 Sprachmodelle – darunter GPT, Claude, Gemini, Grok, DeepSeek, Llama, Qwen und Mistral – sowie auf einen umfassenderen Katalog von über 1.000 KI-Modellen für Bild-, Video-, Audio-, Avatar- und 3D-Generierung bietet. Die API stellt einen einzigen Chat-Completions-Endpunkt bereit, der Streaming, den JSON-Modus, Tool-Nutzung sowie Vision unterstützt, und arbeitet mit transparenter Token-genauer Abrechnung über einen einzigen API-Schlüssel. Laut WaveSpeed minimiert die Infrastruktur Kaltstarts und sorgt für eine geringe Latenz beim ersten Token, wodurch Entwickler Modelle nach Preis, Kontextfenster und Leistungsmerkmalen vergleichen, wechseln und routen können. Zeyi Cheng, CEO von WaveSpeed, bezeichnet das Produkt als einheitliche Integrationsschicht für multimodale Modell-Stacks. Der Artikel erschien am 18. Mai 2026.
Konsolidiert den Zugriff auf Hunderte von Sprach- und multimodalen Generierungsmodellen über eine einzige API und Abrechnungsbeziehung, wodurch der Integrations- und Betriebsaufwand für Teams bei der Entwicklung multimodaler KI-Workflows deutlich reduziert wird.
Marktsignale zu Twilio in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- WaveSpeed hat eine erweiterte, vereinheitlichte LLM-API angekündigt, die Zugriff auf über 260 Sprachmodelle wie GPT, Claude, Gemini, Grok, DeepSeek, Llama, Qwen und Mistral bietet.
- Die Plattform verknüpft Sprachmodelle mit einem breiteren Katalog von mehr als 1.000 KI-Modellen für die Generierung von Bild, Video, Audio, Avatar und 3D.
- Die LLM-API nutzt eine standardmäßige Chat-Completions-Schnittstelle mit Unterstützung für Streaming, JSON-Modus, Tool-Nutzung und Vision über einen einzigen Endpunkt bei transparenter Token-Preistransparenz.
- WaveSpeed minimiert laut eigenen Angaben Kaltstarts und erzielt eine niedrige Latenz beim ersten Token, wodurch Modellzugriff, Zugangsdaten, Abrechnung und SDK-Verwaltung zentralisiert werden.
Verknüpfte Unternehmen
3 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
AIWave bündelt über 50 chinesische AI Modelle in einer einzigen API
AIWave bietet einen einheitlichen, OpenAI-kompatiblen API-Endpunkt, der über 50 chinesische AI Modelle von mehr als 10 Providern aggregiert. Entwickler können nahtlos zwischen Modellen wie DeepSeek, GLM, Qwen, Moonshot und MiniMax wechseln, indem sie lediglich den Modellnamen anpassen. Die Plattform normalisiert Authentifizierung, Request- und Response-Schemas, Streaming-Formate sowie Rate Limits und integriert Fallback- sowie Load-Balancing-Mechanismen. Ein Schnappschuss des /v1/models-Endpunkts verzeichnet rund 50 Modelle, während Leistungstests nur einen geringen Proxy-Overhead von etwa 20 bis 50 Millisekunden bei der First-Token-Latenz belegen. AIWave bewirbt ein kostenloses Testkontingent und stellt Code-Beispiele für das OpenAI SDK bereit. Gleichzeitig werden Szenarien diskutiert, in denen der direkte Zugriff auf Provider weiterhin sinnvoll bleibt, darunter extrem niedrige Latenzen, spezifische Features, Data Residency und Fine-Tuning.
OpenAI bringt drei neue Echtzeit-Sprachmodelle in die Realtime API
OpenAI hat am 7. Mai 2026 drei neue Echtzeit-Sprachmodelle für seine Realtime API eingeführt: GPT-Realtime-2 als GPT-5-Klasse Reasoning-Sprachmodell für realistische Konversationen und agentische Workflows, GPT-Realtime-Translate für Live-Übersetzungen mit über 70 Eingangs- und 13 Ausgangssprachen sowie GPT-Realtime-Whisper für latenzarme Streaming-Sprach-zu-Text-Transkription. Die Lösungen zielen auf Kundenservice, Bildung, Medien, Events und Creator-Plattformen ab. Während Translate und Whisper minütlich abgerechnet werden, erfolgt die Abrechnung bei GPT-Realtime-2 über den Token-Verbrauch. OpenAI hat zudem integrierte Sicherheitsleitplanken und aktive Klassifizierer implementiert, um Richtlinienverstöße bei schädlichen Inhalten zu unterbinden. Die Ankündigung umfasst detaillierte Preisstrukturen und Sicherheitskontrollen in der API-Dokumentation.
Small Language Models zielen auf AdTech-Workflows ab
ZeroGPU hat eine Reihe spezialisierter Small Language Models (SLMs) für den Einsatz im AdTech-Bereich vorgestellt. Diese dienen als kostengünstigere und schnellere Alternativen zu Large Language Models (LLMs) für repetitive Aufgaben wie Content Classification, Intent Detection und Moderation bei Publishern und im Marketing. Die Modelle laufen auf CPUs sowie direkt im Browser, nutzen OpenAI-kompatible Endpoints zur einfachen Integration und basieren auf Datensätzen mit weniger als zehn Milliarden Parametern. Das AI-Monetization-Unternehmen Dappier setzt bereits drei ZeroGPU-Modelle ein und verzeichnet dadurch eine Kostenreduktion von rund 50 Prozent. Laut ZeroGPU bieten die SLMs durch ihre Spezialisierung auf Taxonomien wie IAB Content Categories eine höhere Geschwindigkeit mit Latenzen unter 50 Millisekunden sowie ein geringeres Risiko für Halluzinationen im Vergleich zu großen Frontier-Modellen.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
