Noch in der Entwicklungsphase
Ganze Soundtracks möglich: Google-KI DeepMind erstellt Audio zu Videos
künstliche intelligenz google musikvideo
© Pawel Czerwinski
Der Prozess der Video-zu-Audio-Erstellung kombiniert Videopixel mit Texteingaben, um eine passende Klanglandschaft für das Video zu erzeugen. Durch den Einsatz innovativer Ansätze, die Google in einem Blogbeitrag genauer erläutert, hat Google das Modell nun noch weiter verfeinern können.
Um auch Aufnahmen mit dramatischer Musik, realistischen Soundeffekten oder Dialogen zu erstellen, die gut zu den Charakteren und dem Ton des Videos passen, nutzt Google seine V2A-Technologien in Kombination mit Videogenerierungsmodellen wie Veo. Das Anpassen von Ton, Bild und Timing fällt somit weg.
Soundtracks für Videos
Zudem kann das Modell Soundtracks für traditionelles Filmmaterial aus Archiven, Stummfilmen und anderen Quellen erstellen.
Auch die Audioqualität soll laut Google nicht zu kurz kommen:
"Um eine höhere Audioqualität zu erzeugen, haben wir dem Trainingsprozess weitere Informationen hinzugefügt, darunter KI-generierte Anmerkungen mit detaillierten Klangbeschreibungen und Transkripten von gesprochenen Dialogen"
Durch das Training der KI mit Videos, Audios und zusätzlichen Kommentaren erlernt das Modell neue Assoziationen zu bestimmten visuellen Szenen. Zeitgleich wird das Modell geschult, auf die Informationen in den Kommentaren oder Transkripten zu reagieren.
Abhängig vom Ausgangsmaterial
Google betont, dass das Modell stark abhängig von hochwertigem Videomaterial sei, um ebenso hochwertigen Ton erzeugen zu können. Jegliche Mängel oder Verzerrungen im Video können die Audioqualität erheblich beeinträchtigen.
Darüber hinaus entwickelt Google eine Technologie zur Lippensynchronisation für Videos mit Personen, wobei das Modell momentan noch häufig zu Fehlanpassungen führt. Etwa spricht eine Person, ohne dass ihre Lippenbewegungen exakt dazu passen, wodurch eine unnatürliche Wirkung entsteht.
Weitere Tests nötig
Um gewährleisten zu können, dass die Technologien vor Missbrauch geschützt sind, ist laut Google ein SynthID-Toolkit in die Entwicklung der V2A-Technologie integriert. Das SynthID-Toolkit soll bei der Kennzeichnung und Identifizierung synthetischer Bilder helfen.
Google gab weiterhin an, dass sie ihre V2A-Technologien weiteren Sicherheitsbewertungen und Tests unterzogen werden, bevor sie für die breite Öffentlichkeit zugänglich gemacht werden:
"Wir verpflichten uns, KI-Technologien verantwortungsvoll zu entwickeln und einzusetzen. Um sicherzustellen, dass unsere V2A -Technologien einen positiven Einfluss auf die Kreativ-Community haben können, sammeln wir verschiedene Perspektiven und Erkenntnisse [...] und nutzen dieses wertvolle Feedback, um unsere laufende Forschung und Entwicklung zu unterstützen."
The Guardian berichtet hingegen, dass eine Gruppe aktueller und ehemaliger Mitarbeiter prominenter KI-Unternehmen, darunter auch zwei von Deep Mind, einen offenen Brief verfasst haben, in dem sie vor mangelnder Sicherheit in der Branche warnen und besseren Schutz für Whistleblower fordern.
Ähnliche Themen
KI als Songwriter
Als Teil von Gemini: Google veröffentlicht neues KI-Musiktool Lyria 3
veröffentlicht am 09.03.2026 2
Nicht der erste Fall seiner Art
Krasse Falschinformation von Google-KI kostet Künstler Ashley MacIsaac einen Gig
veröffentlicht am 14.01.2026 3
Wegweiser für die Zukunft
Erster KI-Hit in den deutschen Charts: Butterbro erzielt Erfolg mit "Verknallt in einen Talahon"
veröffentlicht am 15.08.2024 23
KI-Training? Ohne Sony!
Sony Music untersagt KI-Unternehmen die Nutzung von Musikwerken
veröffentlicht am 11.06.2024
Gemeinsames Ziel
Universal und YouTube kooperieren im Bereich Künstliche Intelligenz
veröffentlicht am 28.08.2023