Beobachtetes Signal · 3. Juli 2025 · Technical Release · Quelle: OnlineMarketing.de · Relevanz: 3/5 · Sentiment: Positiv

Alibaba stellt OmniAvatar vor: Open-Source-Modell für KI-Ganzkörperavatare

Zusammenfassung des Signals

Die Alibaba Group hat in Zusammenarbeit mit der Zhejiang University OmniAvatar veröffentlicht, ein Open-Source-Modell zur Generierung vollständig körperanimierter, sprachgesteuerter Videos aus einem Einzelbild, Audio und einem Text-Prompt. Im Gegensatz zu reinen Lipsync-Systemen ermöglicht OmniAvatar komplexe Körpersprache, Emotionen und Objektinteraktionen und setzt damit neue Maßstäbe für die automatisierte Videoproduktion. Die Pipeline verknüpft Audiodaten, Bilder und Prompts über ein multimodales System, das Audio mit einem wav2vec-Modell analysiert, Merkmale in einen latenten Raum abbildet und mit Referenz-Visuals kombiniert. LoRA-basiertes Training bietet präzise Kontrolle über Emotionen, Gesten und Blickrichtung bei hoher Effizienz. Ein pixelbasiertes, multihierarchisches Audio-Embedding verbessert die Lipsync-Genauigkeit und die Szenenübergreifende Generalisierung. Das Modell wurde auf GitHub veröffentlicht, um kollaborative Forschung und dezentrale Content Production zu fördern. Ergänzende KI-Entwicklungen wie Qwen 2.5 Max und Qwen 3 unterstreichen Alibabas Ambitionen bei der Standardsetzung im KI-Stack.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Ein von einem Major Player und einer Universität veröffentlichtes Open-Source-KI-Videomodell mit disruptivem Potenzial für die automatisierte Content-Produktion im Bereich AdTech und MarTech.

SIGNAL RADAR

Marktsignale zu Alibaba Group in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • Alibaba Group und Zhejiang University veröffentlichen OmniAvatar als Open-Source-Modell für körperanimierte, sprachgesteuerte Videos.
  • OmniAvatar generiert Avatar-Videos aus einem einzelnen Bild und einer Audiodatei.
  • Das System nutzt wav2vec zur Audio-Extraktion und LoRA-Training für steuerbare Gesten und Emotionen.
  • Ein multihierarchisches Audio-Embedding verbessert Lipsync und szenenübergreifende Generalisierung.
  • Veröffentlichung auf GitHub zur Förderung kollaborativer Forschung und dezentraler Videoproduktion.
Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: OnlineMarketing.de•Veröffentlicht: 3. Juli 2025
Ursprünglicher Berichttitel: “OmniAvatar: So realistisch ist Alibabas neues KI-Videomodell | OnlineMarketing.de”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Embodied AI / Robotics17. Juni 2026

Alibaba stellt Qwen-Robot Suite für Embodied AI vor

Alibaba hat die Qwen-Robot Suite angekündigt, eine aus drei Foundation Modellen bestehende Architektur für Embodied AI und Robotersteuerung. Das Portfolio umfasst Qwen-Robot-Nav für räumliches Verständnis und Navigation, Qwen-Robot-World als Videoweltmodell zur Simulation physischer Aktionen sowie Qwen-Robot-Manip für Greif- und Manipulationsaufgaben. Laut Alibaba wurde Qwen-Robot-Manip mit über 38.000 Stunden an Robotik-Datensätzen und menschlichen Videos trainiert. Entwickelt von Alibabas Tongyi Lab, laufen derzeit Pilotversuche mit ausgewählten Unternehmenskunden über Alibaba Cloud. Alibaba positioniert die Veröffentlichung als wichtigen Schritt hin zu intelligenten Systemen, die physische Aufgaben vorhersagen und ausführen können, und konkurriert dabei mit Akteuren wie Nvidia, Google DeepMind sowie verschiedenen Start-ups.

Signal analysieren
Large Language Models (LLM) & AI17. Feb. 2026

Alibaba bringt Qwen3.5: Open-Weight-LLM mit Agentic- und Multimodal-Fokus

Die Alibaba Group hat Qwen3.5 vorgestellt, eine neue Modellserie großer Sprachmodelle (LLMs), die klassische Textgenerierung mit erweiterten Agentic- und multimodalen Funktionen verknüpft. Neben einer Open-Weight-Version zum Download, Fine-Tuning und Self-Hosting stellt der Konzern das gehostete Modell „Qwen-3.5-Plus“ im Alibaba Cloud Model Studio bereit. Das Open-Weight-Modell umfasst laut Alibaba 397 Milliarden Parameter, unterstützt nativ Text-, Bild- sowie Video-Inputs und deckt 201 Sprachen und Dialekte ab. Zudem bietet Qwen3.5 optimierte Coding- und Agenten-Funktionen und ist mit Open-Source-Agent-Frameworks wie OpenClaw kompatibel. Laut internen Benchmarks beansprucht Alibaba eine Leistung auf Augenhöhe mit führenden Modellen von OpenAI, Anthropic und Google DeepMind. Der Launch erfolgt vor dem Hintergrund intensivierten Wettbewerbs durch chinesische Rivalen wie ByteDance und Zhipu AI sowie des Trends zu KI-Agenten, die etablierte digitale Geschäftsmodelle grundlegend transformieren könnten.

Signal analysieren
Large Language Models & AI14. Feb. 2026

Chinesische Tech-Konzerne stellen neue KI-Modelle für Video und Robotik vor

Chinesische Technologieunternehmen haben eine Reihe neuer KI-Modelle in den Bereichen Robotik, Video Generation und Large Language Models vorgestellt. Alibabas DAMO Academy präsentierte RynnBrain, ein Robotik-Modell mit integriertem Zeit- und Raumverständnis für komplexe Manipulationsaufgaben. ByteDance veröffentlichte Seedance 2.0, einen Text-to-Video-Generator mit hoher Steuerbarkeit, setzte jedoch eine Funktion zur Stimmengenerierung aus Fotos nach Bedenken hinsichtlich des Nutzerkonsenses aus. Kuaishou lancierte Kling 3.0, das Videoclips von bis zu 15 Sekunden mit nativer, mehrsprachiger Audiogenerierung ermöglicht. Parallel dazu veröffentlichte Zhipu AI das Modell GLM-5 mit Fokus auf Coding-Leistung, während MiniMax sein Open-Source-Modell M2.5 mit erweiterten Agent-Tools aktualisierte. Diese Releases verringern den Abstand zu westlichen KI-Anbietern deutlich, werfen jedoch neue Fragen bezüglich Content-Consent und Validierung auf.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.