Beobachtetes Signal · 23. Juli 2026 · Technical Release · Quelle: DEV Community · Relevanz: 3/5 · Sentiment: Positiv

Zustandsbehaftete Videobearbeitung mit Gemini Interactions und Claude Code

Zusammenfassung des Signals

Ein Open-Source-Projekt namens omni-skill-claude verknüpft Googles Modell gemini-omni-flash-preview (Omni Flash) über einen FastMCP-Server und eine Claude Code-Skill, um iterative, zustandsbehaftete Videoerzeugung und -bearbeitung zu ermöglichen. Die Architektur stellt acht MCP-Tools bereit – darunter Generierung, Bearbeitung, Animation, Interpolation, motivbasierte Erstellung, Videostilisierung, YouTube-Upload und Hilfefunktionen. Dabei nutzt das System die Gemini Interactions API, um visuellen Kontext mittels Interaktions-IDs beizubehalten, sodass aufeinanderfolgende Bearbeitungsschritte konsistent bleiben. Das unter der Apache-2.0-Lizenz auf GitHub veröffentlichte Repository erfordert Python 3.10+, einen Gemini API-Key sowie Claude Code. Die Videoerstellung erfolgt synchron und kostenpflichtig, wobei die Ausgabe je nach Dateigröße entweder direkt (Base64) oder über die Google File API erfolgt.

Polaris7 AgentStrategische Einordnung
Hohe Konfidenz

Demonstriert eine praxisnahe, zustandsbehaftete Integration zwischen generativer Video-KI (Gemini Omni Flash), MCP-Tooling und Claude Code, die iterative Kreativ-Workflows und Asset-Pipelines optimieren kann. Es handelt sich hierbei jedoch um einen technischen Release eines Drittanbieters und nicht um eine plattformweite Richtlinienänderung.

SIGNAL RADAR

Marktsignale zu Google in Echtzeit verfolgen

Polaris7 erfasst behördliche Registrierungen, Primärquellen, Führungswechsel und Deal-Aktivitäten rund um die Uhr. Erstellen Sie Ihren kostenlosen Explorer-Workspace, um automatisierte Executive Briefings zu erhalten.

Kostenlos im Explorer starten
Kostenloser Explorer-ZugangKeine Kreditkarte nötigSofortiges Watchlist-Setup

Wichtigste Kernpunkte & Evidenz

  • Das Projekt omni-skill-claude kapselt Googles Modell gemini-omni-flash-preview (Omni Flash) in einem FastMCP-Server und stellt es als Claude Code-Skill bereit.
  • Der Server stellt acht MCP-Tools zur Verfügung, darunter generate_video, edit_video (für zustandsbehaftete Bearbeitungen), animate_image, interpolate_images, generate_with_subjects, edit_user_video, upload_to_youtube und get_help.
  • Die Gemini Interactions API ermöglicht eine zustandsbehaftete Videobearbeitung über gespeicherte Interaktions-IDs (store=True), sodass das Modell den visuellen Kontext über iterative Bearbeitungsschritte hinweg beibehält.
  • Video-Generierungsaufrufe sind synchron und kostenpflichtig; Ausgaben können inline (Base64) oder über die Google File API (uri) zurückgegeben werden – ab rund 4 MB wird die uri-Methode empfohlen.
  • Das Open-Source-Projekt ist auf GitHub (xbill9/omni-skill-claude) unter Apache-2.0 verfügbar und unterstützt die Veröffentlichung von Ergebnissen über die YouTube Data API v3 mittels OAuth.

Verknüpfte Unternehmen

5 verknüpfte Unternehmen
Primäre Quellenbasis & Herkunftsnachweis
Verifizierter Herkunftsnachweis
Primärquelle: DEV Community•Veröffentlicht: 23. Juli 2026
Ursprünglicher Berichttitel: “Teaching Claude Code to Direct: A Stateful Video-Editing Skill Built on Gemini's Interactions API and MCP”

Verwandte Marktsignale & Trends

Aktuelle verifizierte Unternehmensentwicklungen und Deal-Aktivitäten in diesem Marktsegment.

Layer 3: Creation & Asset Management22. Juli 2026

Zustandsbehaftete Bildbearbeitung für Claude Code durch Gemini-Integration

Ein Open-Source-Projekt namens nb2lite-skill-claude verknüpft das Modell gemini-3.1-flash-lite-image über einen FastMCP-Server mit einer Claude Code Skill, um zustandsbehaftete Bilderstellung und iterative Bearbeitung zu ermöglichen. Die Architektur nutzt die Google Interactions API, bei der jede Generierung eine interaction_id zurückgibt. Dies bewahrt den visuellen Kontext serverseitig und erlaubt inkrementelle Änderungen – wie das Hinzufügen von Elementen –, ohne die gesamte Szene neu beschreiben zu müssen. Das Repository stellt einen MCP-Server mit vier zentralen Tools bereit: generate_image, edit_image, edit_local_image und get_help. Für die Installation stehen diverse Wege offen, darunter der Claude Plugin Marketplace, manuelle Klone, Projektinstallationen sowie ein Docker-Container unter der Apache-2.0-Lizenz. Das Projekt demonstriert seine Praxistauglichkeit direkt: Das Titelbild des Artikels wurde mit der Skill selbst generiert.

Signal analysieren
Large Language Models (LLM) & AI20. Mai 2026

Google startet Gemini Omni: KI-Videoediting direkt im Chat

Google hat auf der I/O 2026 Gemini Omni vorgestellt, ein multimodales generatives KI-Videomodell, mit dem Nutzer Videos direkt im Gemini Chat über Spracheingaben bearbeiten, erweitern und remixen können. Das System vereint Text-, Bild-, Audio- und Videoverständnis in einer einzigen Architektur. Das erste Modell, Gemini Omni Flash, wird weltweit für Abonnenten von Google AI Plus, Pro und Ultra über die Gemini App sowie Google Flow ausgerollt und zudem kostenlos in YouTube Shorts und YouTube Create integriert. Entwickler und Unternehmenskunden sollen in den kommenden Wochen API-Zugriff erhalten. Erste Tests und Berichte über Plattformen wie Reddit und TestingCatalog verweisen auf präzise Befehlsausführung und eine verbesserte Audioqualität im Vergleich zu früheren Veo-Modellen. Die Innovation verändert die kreativen Workflows sowie die Toolchains für Creator und Marken im Bereich der Content-Produktion nachhaltig.

Signal analysieren
Generative AI / Creative Production13. Juni 2026

Agentenbasierte generative Video-Pipeline mithilfe von Claude Code entwickelt

Ein Entwickler beschreibt die Erstellung eines zweiminütigen Videos vollständig über eine agentenbasierte Claude Code-Session namens „Simona“, die Bildgenerierung, Text-to-Speech, KI-Video und FFmpeg-Editing verknüpfte. Der Beitrag zeigt als technische Walkthrough-Analyse, wie der Agent iterativ wiederverwendbare Fähigkeiten mit SKILL.md-Dokumentation und CLI-Wrappern aufbaute, die Kosten in einem WORKLOG.md-Ledger trackte und nach einem Git-Fehler mit gelöschten Assets wiederherstellte. Der Autor listet verwendete Modelle und Dienste wie OpenAI gpt-image-2, Google Gemini, Seedance 2.0, Kling, LTX, ElevenLabs und lokale Kokoro-TTS auf, weist Gesamtkosten von 45,26 US-Dollar aus und dokumentiert Engineering-Patterns für die sichere agentengestützte Medienproduktion.

Signal analysieren

Marktsignale & Strategische Shifts in Echtzeit verfolgen

Erstellen Sie benutzerdefinierte Watchlists, um automatisierte, evidenzbasierte Executive Briefings zu erhalten, sobald wesentliche Signale oder Marktverschiebungen auftreten.