Nach der Bild- die Videorevolution: Neue KI "Make-a-Video" generiert Videos nach Text

// 14:11 Fr, 30. Sep 2022von Thomas Richter

KIs generieren immer bessere Bilder nach Textbeschreibungen und es war klar, was der nächste Schritt sein würde: das Erstellen von Videos. Jetzt hat Meta AI, die KI Forschungsabteilung von Meta (ehemals Facebook) genau einen solchen Algorithmus vorgestellt. Die "Make-a-Video" getaufte Text-to-Video KI ähnelt den Text-zu-Bild KIs DALL-E 2 und Stable Diffusion, die in den letzten Monaten Furore gemacht haben.

Wie diese hat sie anhand Milliarden von Bildern samt Textbeschreibung gelernt, wie die reale Welt aussieht, aus welchen Objekten sie besteht und wie diese von Menschen beschrieben wird. Zusätzlich dazu allerdings wurde das neuronalen Netzwerk mittels zusätzlicher Schichten für die zeitliche Abfolgen von Bildern noch mit rund 20 Millionen Videos trainiert, um zu lernen wie sich verschiedene Objekte typischerweise bewegen.

So kann die Make-a-Video KI jetzt nur anhand von Textbeschreibungen beliebige kurze Videoclips erzeugen, wie zum Beispiel "Ein Teddybär malt ein Porträt" oder "Ein flauschiges Babyfaultier mit einer orangefarbenen Strickmütze, das versucht, einen Laptop zu bedienen, wobei sich in seinem Auge ein detailliertem Studiolichtschirm spiegelt". Ähnlich wie bei den bildgenerierenden KIs kann auch hier der Bildstil (realistisch, surreal, abstrakt, stilisiert, ...) beliebig definiert werden.

Erweckt Bilder zum Leben

Als Input kann anstatt eines Textes aber auch ein Einzelbild verwendet werden (analog zur Image-2-Image Methode bei den Bilder KIs), um dieses zu animieren. Werden zwei Bilder (ein Start- und ein Endbild) definiert, generiert der Make-a-Video Algorithmus dann die Zwischenbilder. Alternativ, quasi per Video-2-Video, kann auch ein Video als Input fungieren, von dem Make-a-Video dann Variationen erzeugt.

Meta AI hat zwar die Forschungsarbeit von Make-a-Video veröffentlicht, allerdings nicht den dazugehörigen Code oder das Modell - es dürften aber bald Versuche folgen, einen darauf basierenden Algorithmus nachzubauen.

// Top-News auf einen Blick:

Die Qualität der erzeugten Videos läßt zwar noch etwas zu wünschen übrig, sie entsprechen eher kleinen Bildanimationen als echtem (komplexen) Video und sind auch nur wenige Sekunden lang, aber Make-a-Video macht deutlich, wohin die Reise geht. Generierung von Videos und objektbasiertes Editing per Text auch für Consumer rückt immer näher.

Phenaki KI erstellt sogar noch längere Videos

Wie schnell die Entwicklung gerade voranschreitet beweist auch die Tatsache, daß zeitgleich mit Metas "Make-a-Video" noch ein weiteres Projekt namens Phenaki eines (noch) anonymen Forscherteams erschienen ist, daß nochmal eine deutlich geringere Auflösung aufweist, aber in einem wichtigen Aspekt sogar noch interessanter ist, weil es es die Generierung mehrminütiger Videos erlaubt. So wurde im folgenden Beispiel anhand einer längeren Textbeschreibung ein beeindruckendes 2 Minuten langes Video erzeugt:

Interessant sind die für zur Generierung des Videos verwendeten Prompts (samt Anweisungen für die virtuellen Kamerabewegungen):

"Viel Verkehr in einer futuristischen Stadt. Ein außerirdisches Raumschiff kommt in der futuristischen Stadt an. Die Kamera geht in das Innere des Raumschiffs der Außerirdischen. Die Kamera bewegt sich vorwärts, bis sie einen Astronauten in einem blauen Raum zeigt. Der Astronaut tippt auf der Tastatur. Die Kamera bewegt sich von dem Astronauten weg. Der Astronaut verlässt die Tastatur und geht nach links. Der Astronaut verlässt die Tastatur und geht weg. Die Kamera bewegt sich über den Astronauten hinaus und blickt auf den Bildschirm. Auf dem Bildschirm hinter dem Astronauten sind Fische zu sehen, die im Meer schwimmen. Crash zoomt auf den blauen Fisch. Wir folgen dem blauen Fisch, wie er im dunklen Ozean schwimmt. Die Kamera zeigt durch das Wasser nach oben in den Himmel. Der Ozean und die Küstenlinie einer futuristischen Stadt. Crash-Zoom in Richtung eines futuristischen Wolkenkratzers. Die Kamera zoomt in eines der vielen Fenster. Wir befinden uns in einem Büroraum mit leeren Schreibtischen. Ein Löwe rennt auf den Schreibtischen herum. Die Kamera zoomt auf das Gesicht des Löwen im Inneren des Büros. Zoom auf den Löwen, der einen dunklen Anzug trägt, in einem Büroraum. Der Löwe im Anzug schaut in die Kamera und lächelt. Die Kamera zoomt langsam auf das Äußere des Wolkenkratzers hinaus. Zeitraffer des Sonnenuntergangs in der modernen Stadt"

Hier finden sich noch viele weitere Beispiele von per Phenaki animierten kurzen Clips. Auffällig ist, daß weder die Beispielclips bei Phenaki noch bei Make-a-Video Menschen beinhalten, zu erklären ist das durch die Schwäche der zugrundeliegenden Blidgenerierungs-KIs mit menschlichen Körpern und Gesichtern (ein Clip, auf dem Menschen zu sehen sind ("ein Paar im Regen") demonstriert diese Schwäche eindrucksvoll). Es bleibt zu hoffen, daß der Sourcecode von Phenaki bald veröffentlicht wird, um der KI Community die Weiterentwicklung zu ermöglichen.

mehr Infos bei
makeavideo.studio

Auf Socials teilen:

Leserkommentare // Neueste

Kommentieren >>

Ähnliche News //

News

Erst Bilder, dann Sounds: Neue Google-KI generiert beliebige Musik nach ...

Forscher von Google haben eine neue KI vorgestellt, die nach einem ähnlichen Muster wie die gerade sehr populären Text-2-Image KIs wie DALL-E 2, Midjourney oder Stable Diffusion .....

// 10:57 Mo, 30. Jan 2023von Thomas Richter

News

Text-zu-Video KI jetzt auch von Google: Imagen Video

Nachdem Meta gerade seine Make-a-Video KI zur Generierung von Videos nach Textbeschreibung vorgestellt hatte, hat Google jetzt nachgezogen und mit Imagen Video auch eine solche KI ...

// 16:48 Do, 6. Okt 2022von Thomas Richter

News

Stockphoto-Portal Shutterstock integriert KI-Bilder und gibt eine Antwort auf die ...

Seit kurzem steht die Frage im Raum, wie Künstler und Stock-Fotodienste überleben können, wenn bildgenerierende KIs wie DALL-E 2, Stable Diffusion oder Midjourney beliebige Bilder ...

// 09:41 Sa, 5. Nov 2022von Thomas Richter

News

Künstler vs KIs: Neues Tool macht Kunstwerke für KIs unverdaulich

Der Boom bildgenerierender KIs, die per Prompt beliebige Bilder erzeugen, hat bei Künstlern große Ängste ausgelöst, kann doch jeder Kunst- oder Künstlerstil - egal ob Malerei, ...

// 19:51 Mo, 20. Feb 2023von Thomas Richter

News

Neue Audio KI generiert neben Musik auch beliebige Soundeffekte

Wie rasant die Entwicklung im Bereich KIs voranschreitet, zeigt sich u.a. gerade im Feld "Text-to-Music", also von KIs, welche per Textbeschreibung beliebige Musik generieren: ...

// 10:26 Do, 2. Feb 2023von Thomas Richter

zur Newsübersicht >

Sony Cinema Line Neue Sony FX3 und FX30 Firmware bringt BIG6-Startbildschirm, RAW-Video per HDMI und ...

Sony hat für seine kompakten Cinema Line Vollformat- bzw. Super35-/APS-C-Kameras FX30, FX3 und FX3 neue Firmware-Versionen veröffentlicht, die eine Reihe interessanter Neuerungen ....

// 13:53 Di, 26. Aug 2025von Thomas Richter

News

Ab sofort vorbestellbar HoverAir Aqua - schwimmfähige Drohne für Wassersportaufnahmen

Die vor zwei Wochen vorgestellte Mini-Drohne HoverAir Aqua kann ab sofort per Crowdfunding vorbestellt werden - ausgeliefert wird sie allerdings erst im Dezember. Die zu 100% ...

// 10:17 So, 24. Aug 2025von Thomas Richter

Wissen

Pro und Contra Layer- vs. Node-basiertes Compositing - Welcher Workflow wann passt

Bei Compositing-Systemen gibt es grundsätzlich zwei unterschiedliche Workflow-Ansätze, den Node-basierten Ansatz sowie das Layer-basierte Arbeiten. Beide Ansätze haben dabei Vor- ...

// 11:32 Fr, 22. Aug 2025von Rudi Schmidts

Test

slashCam Bestenliste Die besten DSLMs für Video 2025: Blackmagic, Sony, Nikon, Canon, Panasonic ...

Mit der Sony FX2, der Canon EOS R5 Mark II sowie der Panasonic S1II, S1RII und GH7 haben wir zahlreiche neue Kameras getestet, die viel Bewegung in unser "Beste DSLM für Video" ...

// 12:34 Mo, 11. Aug 2025von Rob

TOP THEMEN //

zum Forum >>

MEHR NEWS

zum Newsindex >

PASSENDE DISKUSSIONEN

zum Forum >>

Passende Artikel //

Aktuelles

Stoppt Mickey Mouse die KI Kunst Revolution? Künstler protestieren gegen KI Konkurrenz

Die neuen bildgenerierenden KIs stellen eine Revolution dar: sie eröffnen erstmals die Möglichkeit, massenhaft hochqualitative Bilder nach Wunsch zu erzeugen - in beliebiger Menge,...

// 14:21 Di, 3. Jan 2023von Thomas Richter

Aktuelles

Text-zu-Sprache per KI: Ersetzen synthetische Stimmen bald professionelle Sprecher?

Nach Bild- und Text-generierenden KIs gibt es noch weiteres Feld, in welchem gerade per künstlicher Intelligenz enorme Fortschritte gemacht werden und zwar bei der Synthese von ...

// 19:47 Mo, 6. Feb 2023von Thomas Richter

zur Artikelübersicht >

Aktuelle News //

News

Kostenbloser Leitfaden zu neuen Funktionen in Blackmagic Resolve 20.1 und neue Version

Bugfixes und mehr Kostenbloser Leitfaden zu neuen Funktionen in Blackmagic Resolve 20.1 und neue ...

Blackmagic hat nach dem ersten großen Update der im Mai erschienenen Version 20 von Blackmagic DaVinci Resolve (Studio) jetzt ein weiteres Update für sein kostenloses Grading-, ...

// 13:13 So, 31. Aug 2025von Thomas Richter

News

Lumix App Update Panasonic Lumix Lab App 1.6 bringt LUT-Pakete, EXIF-Anzeige & mehr

Panasonic hat die neue Version 1.6 der kostenlosen Lumix Lab App (iOS und Android) für seine spiegellosen Systemkameras veröffentlicht. Die App, mit deren Hilfe Fotos und Videos .....

// 12:16 So, 31. Aug 2025von Thomas Richter

zur Newsübersicht >