Beobachtetes Signal · 3. Juli 2025 · Technical Release · Quelle: OnlineMarketing.de · Relevanz: 3/5 · Sentiment: Positiv
Alibaba stellt OmniAvatar vor: Open-Source-Modell für KI-Ganzkörperavatare
Die Alibaba Group hat in Zusammenarbeit mit der Zhejiang University OmniAvatar veröffentlicht, ein Open-Source-Modell zur Generierung vollständig körperanimierter, sprachgesteuerter Videos aus einem Einzelbild, Audio und einem Text-Prompt. Im Gegensatz zu reinen Lipsync-Systemen ermöglicht OmniAvatar komplexe Körpersprache, Emotionen und Objektinteraktionen und setzt damit neue Maßstäbe für die automatisierte Videoproduktion. Die Pipeline verknüpft Audiodaten, Bilder und Prompts über ein multimodales System, das Audio mit einem wav2vec-Modell analysiert, Merkmale in einen latenten Raum abbildet und mit Referenz-Visuals kombiniert. LoRA-basiertes Training bietet präzise Kontrolle über Emotionen, Gesten und Blickrichtung bei hoher Effizienz. Ein pixelbasiertes, multihierarchisches Audio-Embedding verbessert die Lipsync-Genauigkeit und die Szenenübergreifende Generalisierung. Das Modell wurde auf GitHub veröffentlicht, um kollaborative Forschung und dezentrale Content Production zu fördern. Ergänzende KI-Entwicklungen wie Qwen 2.5 Max und Qwen 3 unterstreichen Alibabas Ambitionen bei der Standardsetzung im KI-Stack.
Ein von einem Major Player und einer Universität veröffentlichtes Open-Source-KI-Videomodell mit disruptivem Potenzial für die automatisierte Content-Produktion im Bereich AdTech und MarTech.
Marktsignale zu Alibaba Group in Echtzeit verfolgen
Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.
Wichtigste Kernpunkte & Evidenz
- Alibaba Group und Zhejiang University veröffentlichen OmniAvatar als Open-Source-Modell für körperanimierte, sprachgesteuerte Videos.
- OmniAvatar generiert Avatar-Videos aus einem einzelnen Bild und einer Audiodatei.
- Das System nutzt wav2vec zur Audio-Extraktion und LoRA-Training für steuerbare Gesten und Emotionen.
- Ein multihierarchisches Audio-Embedding verbessert Lipsync und szenenübergreifende Generalisierung.
- Veröffentlichung auf GitHub zur Förderung kollaborativer Forschung und dezentraler Videoproduktion.
Verknüpfte Unternehmen
1 verknüpfte UnternehmenOntologie & Marktkonzepte
Verwandte Marktsignale & Trends
Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.
Alibaba stellt Qwen-Robot Suite für Embodied AI vor
Alibaba hat die Qwen-Robot Suite angekündigt, eine aus drei Foundation Modellen bestehende Architektur für Embodied AI und Robotersteuerung. Das Portfolio umfasst Qwen-Robot-Nav für räumliches Verständnis und Navigation, Qwen-Robot-World als Videoweltmodell zur Simulation physischer Aktionen sowie Qwen-Robot-Manip für Greif- und Manipulationsaufgaben. Laut Alibaba wurde Qwen-Robot-Manip mit über 38.000 Stunden an Robotik-Datensätzen und menschlichen Videos trainiert. Entwickelt von Alibabas Tongyi Lab, laufen derzeit Pilotversuche mit ausgewählten Unternehmenskunden über Alibaba Cloud. Alibaba positioniert die Veröffentlichung als wichtigen Schritt hin zu intelligenten Systemen, die physische Aufgaben vorhersagen und ausführen können, und konkurriert dabei mit Akteuren wie Nvidia, Google DeepMind sowie verschiedenen Start-ups.
Alibaba bringt Qwen3.5: Open-Weight-LLM mit Agentic- und Multimodal-Fokus
Die Alibaba Group hat Qwen3.5 vorgestellt, eine neue Modellserie großer Sprachmodelle (LLMs), die klassische Textgenerierung mit erweiterten Agentic- und multimodalen Funktionen verknüpft. Neben einer Open-Weight-Version zum Download, Fine-Tuning und Self-Hosting stellt der Konzern das gehostete Modell „Qwen-3.5-Plus“ im Alibaba Cloud Model Studio bereit. Das Open-Weight-Modell umfasst laut Alibaba 397 Milliarden Parameter, unterstützt nativ Text-, Bild- sowie Video-Inputs und deckt 201 Sprachen und Dialekte ab. Zudem bietet Qwen3.5 optimierte Coding- und Agenten-Funktionen und ist mit Open-Source-Agent-Frameworks wie OpenClaw kompatibel. Laut internen Benchmarks beansprucht Alibaba eine Leistung auf Augenhöhe mit führenden Modellen von OpenAI, Anthropic und Google DeepMind. Der Launch erfolgt vor dem Hintergrund intensivierten Wettbewerbs durch chinesische Rivalen wie ByteDance und Zhipu AI sowie des Trends zu KI-Agenten, die etablierte digitale Geschäftsmodelle grundlegend transformieren könnten.
Chinesische Tech-Konzerne stellen neue KI-Modelle für Video und Robotik vor
Chinesische Technologieunternehmen haben eine Reihe neuer KI-Modelle in den Bereichen Robotik, Video Generation und Large Language Models vorgestellt. Alibabas DAMO Academy präsentierte RynnBrain, ein Robotik-Modell mit integriertem Zeit- und Raumverständnis für komplexe Manipulationsaufgaben. ByteDance veröffentlichte Seedance 2.0, einen Text-to-Video-Generator mit hoher Steuerbarkeit, setzte jedoch eine Funktion zur Stimmengenerierung aus Fotos nach Bedenken hinsichtlich des Nutzerkonsenses aus. Kuaishou lancierte Kling 3.0, das Videoclips von bis zu 15 Sekunden mit nativer, mehrsprachiger Audiogenerierung ermöglicht. Parallel dazu veröffentlichte Zhipu AI das Modell GLM-5 mit Fokus auf Coding-Leistung, während MiniMax sein Open-Source-Modell M2.5 mit erweiterten Agent-Tools aktualisierte. Diese Releases verringern den Abstand zu westlichen KI-Anbietern deutlich, werfen jedoch neue Fragen bezüglich Content-Consent und Validierung auf.
Marktsignale & Strategische Shifts in Echtzeit verfolgen
Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.
