KI-AkademieModul 6 — Multimodalität: Bild, Audio, Video

Wissensbasis · UE 67 von 120

Video-Generierung: Sora, Runway und Veo

Modul 6 — Multimodalität: Bild, Audio, Video ca. 12 Min. Lesezeit

Lernziele

Sie können die drei führenden Video-Generierungsmodelle (Sora, Runway Gen-3, Google Veo) anhand ihrer Kernmerkmale und Einsatzbereiche beschreiben.

Sie schreiben einen strukturierten Szenen-Brief, der als Grundlage für die KI-Videogenerierung dient.

Sie erklären die Kennzeichnungspflicht nach EU AI Act Art. 50 für synthetische Videos und wenden sie auf konkrete Szenarien an.

Sie beurteilen realistische Einsatzgrenzen der aktuellen Video-KI (Stand 2026) und setzen entsprechende Erwartungen.

Auf einen Blick

MerkmalDetail
Dauer90 Minuten
NiveauFortgeschritten
MethodenInput, Demo, Einzel- und Gruppenübung
MaterialienLaptop, Internetzugang, ggf. Runway-Account (Freemium)
QuerverweiseUE 68 (Avatare), UE 70 (Marketing), UE 71 (Ethik), UE 72 (Erklär-Clip)

Worum geht es?

Text-zu-Video ist die vielleicht aufregendste — und gleichzeitig häufigst missverstandene — Technologie im Bereich der synthetischen Medien. Aufmerksame Demos auf Konferenzen und in sozialen Netzwerken zeigen beeindruckende Clips von Läuferinnen am Strand, dramatischen Kamerafahrten durch futuristische Stadtlandschaften oder Zeitlupen-Aufnahmen von Wassertropfen. Was gezeigt wird, ist real möglich — aber die Spanne zwischen Demo-Video und produktivem Alltagseinsatz ist noch groß.

Der Stand 2026: Kurze Clips (4–15 Sekunden) mit einfachen, klar beschreibbaren Szenen sind mit hoher Qualität erzeugbar. Komplexe Szenen mit konsistenten Personen über mehrere Clips hinweg, präzise lesbarer Text im Video oder lange Sequenzen (1+ Minuten) sind weiterhin schwierig. Video-KI ist heute ein mächtiges Werkzeug für bestimmte Zwecke — kein universeller Filmstudio-Ersatz.

Diese Einheit gibt Ihnen einen realistischen Überblick: Was können die führenden Systeme heute wirklich leisten, wie beschreiben Sie eine Szene so, dass die KI sie überzeugend umsetzt, und welche rechtlichen Anforderungen gelten für KI-generierte Videos?

Lerntext

Sora — OpenAIs Video-Modell

Sora ist OpenAIs Videogenerierungsmodell und seit Ende 2024 für ChatGPT-Pro-Nutzer zugänglich. Charakteristika:

Zugang: ChatGPT Pro ($200/Monat); begrenzte Beta-Version für Plus

Videolänge: Bis zu mehrere Minuten (fortgeschrittenes Modell); Qualität nimmt bei längeren Clips ab

Stärken: Realistische Bewegungsphysik, atmosphärische Szenen, Kameraführungsanweisungen (Zoom, Pan, Tracking-Shot)

Schwächen: Konsistente Personendarstellung über Szenen hinweg; präzise Textdarstellung im Video; komplexe physikalische Interaktionen

Outputs: MP4, verschiedene Auflösungen bis 1080p

Sora Storyboard: Sora bietet eine Storyboard-Funktion, die die Sequenzierung mehrerer Szenen-Briefs ermöglicht — ein erster Schritt in Richtung strukturierter Video-Produktion.

Runway Gen-3 Alpha — Professionelle Video-KI

Runway ist aktuell die führende professionelle Video-KI-Plattform und wird von Filmemachern und Produzenten aktiv genutzt:

Zugang: Freemium (500 Credits/Monat) bis Pro ($95/Monat, 2250 Credits); $0.05–0.15 pro Sekunde generiertes Video

Funktionen:

  • Text-to-Video: Textbeschreibung → Videoclip
  • Image-to-Video: Standbild als Ausgangspunkt → animierter Clip
  • Motion Brush: Bestimmte Bildbereiche mit Bewegungsanweisung versehen (z. B. „dieser Baum soll sich im Wind bewegen”)
  • Camera Controls: Explizite Kamerabewegungsanweisungen (Dolly in/out, Tilt, Pan)

Videolänge: 4–16 Sekunden pro Generation

Qualität: Bis 1080p, bis 24fps

Diagramm aus der KI-Wissensbasis

Abb. 67.1 — Video-KI Vergleich: Sora · Runway Gen-3 · Google Veo 2 — Szenen-Brief Workflow

Merksatz

Runway Gen-3 ist heute die professionellste zugängliche Video-KI-Plattform. Die Stärke liegt in Kamerabewegungen und atmosphärischen Szenen. Die Schwäche: Clips sind kurz (4–16 Sek), eine konsistente Personendarstellung über Clips hinweg ist nicht zuverlässig möglich.

Google Veo 2 und 3 — Realismus und Bewegungsphysik

Google Veo (im Google DeepMind-Kontext entwickelt) zeichnet sich durch besonders realistische Bewegungsphysik aus. Stand 2026:

Veo 2: Integriert in Google Gemini Ultra und AI Studio; beeindruckende Detailtreue bei Wasserphysik, Stoff, Haaren

Veo 3: Erste Version mit synchroner Audio-Erzeugung (Hintergrundgeräusche, Umgebungssound)

Zugang: Google Workspace / AI Studio; schrittweise Rollout für Enterprise

Stärke: Naturszenen, physikalisch realistische Bewegungen, Detailqualität bei Materialien

Einsatzszenarien: Produkt-Lifestyle-Videos, Naturaufnahmen als B-Roll, atmosphärische Intros

Weitere Plattformen: Kling, Pika, Hailuo

Kling 2.0 (Kuaishou): Besonders stark bei menschlichen Bewegungen und Gesichtsausdrücken; chinesischer Anbieter, Datenschutz beachten

Pika Labs 2.0: Animierter Stil, gut für kreative kurze Clips und Social-Media-Inhalte; Freemium verfügbar

Hailuo (MiniMax): Hohe Bewegungsqualität; ebenfalls chinesischer Anbieter

Merksatz

Was Video-KI 2026 gut kann: kurze atmosphärische Clips, realistische Naturszenen, Kamerafahrten, B-Roll-Material. Was sie nicht kann: konsistente Darsteller über mehrere Szenen, präziser Text im Video, lange Sequenzen, komplexe Handlungen. Setzen Sie Erwartungen entsprechend.

Was geht — was nicht (Stand 2026)

Gut umsetzbar mit aktueller Video-KI: - Atmosphärische Eröffnungsshots (Bürogebäude, Stadtlandschaft, Natur) - Produktvisualisierungen mit einfachen Bewegungen - B-Roll-Material für Erklärvideos (Hände tippen, Kaffeekuche, Ähnliches) - Abstrakte und konzeptionelle Visualisierungen - Zeitlupen und Zeitraffer-Effekte

Herausfordernd bis nicht zuverlässig: - Konstante Personendarstellung über mehrere Shots (unterschiedliche Clips zeigen oft unterschiedlich aussehende Personen) - Lesbarer Text im Video (häufig verzerrt oder falsch) - Komplexe Handlungen mit Objektinteraktion (Hand greift Tasse: Finger-Anomalien) - Videos länger als ca. 30–60 Sekunden ohne Qualitätsverlust

Das Szenen-Brief-Framework

Der Szenen-Brief ist das Video-Äquivalent des strukturierten Bild-Prompts. Er enthält alle Informationen, die das Modell für eine gute Generation braucht:

7 Elemente eines Szenen-Briefs:

ElementBeispiel
SettingModernes Großraumbüro, viel Tageslicht, Glasfronten zur Stadt
ActionZwei Personen am Stehtisch, schauen auf ein Tablet, nicken zustimmend
KameraMedium Shot, leichter Dolly nach vorne, Tiefenunschärfe im Hintergrund
StilCinematic, warme Farben, natürliches Licht
FarbtonWarme Töne, Golden-Hour-Licht durchs Fenster
Dauer6–8 Sekunden
MoodProfessionell, positiv, kollaborativ

Beispiel-Szenen-Brief: „A modern open-plan office with large windows overlooking a city skyline. Two professionals stand at a high desk reviewing a tablet. The camera slowly pushes in from a medium shot. Warm afternoon sunlight streams through the windows. Cinematic color grading, shallow depth of field. Professional, collaborative, optimistic. 8 seconds.”

Kennzeichnung und C2PA

Für KI-generierte Videos gelten die Kennzeichnungspflichten des EU AI Act Art. 50 gleichermaßen wie für Bilder. Zusätzlich bieten Plattformen wie Runway und Tools von Adobe C2PA-Metadaten-Support an, der die KI-Herkunft eines Videos in den Datei-Metadaten verankert.

Praktische Kennzeichnung: - Sichtbarer Hinweis in Videobeschreibungen: „Dieses Video wurde mit KI generiert” - Einblendung im Video (Intro oder Credits) - C2PA-Metadaten beibehalten (nicht entfernen) - Auf sozialen Plattformen: Platform-eigene KI-Labels nutzen

Vertiefung — ROI-Kalkulation und Produktionsrealität

Zeitvergleich traditionelle Produktion vs. KI-Video:

AufgabeTraditionellKI-unterstützt
30-Sek Imagefilm (B-Roll)1 Tag Dreh + Schnitt2–4 Stunden (Briefs + Generation + Auswahl)
60-Sek Produktvideo2–3 Tage4–8 Stunden
Social-Media-Kurzclip (15 Sek)3–4 Stunden30–60 Minuten

Kostenfaktor: Runway Pro ($95/Mo) vs. Kamerateam-Tagesrate (Deutschland: 800–2500€/Tag inkl. Equipment). Für Aufgaben, die mit KI-Video qualitativ ausreichend lösbar sind, ist der Kostenvorteil erheblich.

Produktionsrealität: KI-Video ersetzt keine Imagekampagnen, Mitarbeitervideos mit realen Personen oder aufwändige Produktionen. Es ergänzt das Portfolio für B-Roll, atmosphärische Aufnahmen, schnelle Content-Produktion und Prototyping.

Branchen-Anwendungen

IT-Dienstleistung & Beratung

Beratungsunternehmen nutzen KI-Video vor allem für atmosphärisches Footage in Pitch-Präsentationen und auf der Website. Imagesequenzen, die professionelle Teamarbeit, moderne Büroumgebungen oder abstrakte Technologiekonzepte illustrieren, lassen sich schnell und kostengünstig generieren. Ein Anwendungsfall: Ein Consulting-Team erstellt einen neuen Service-Bereich und braucht innerhalb von zwei Tagen Website-Footage und Social-Media-Material. Mit KI-Video lässt sich das ohne Fototermin realisieren. Wichtig: Für externe Kundenpräsentationen und Websites klare Kennzeichnungspolitik festlegen — entweder im Footer oder in der Bildunterschrift.

Industrie & Fertigung

In der Industrie bietet KI-Video Potenzial für Sicherheitsschulungen, Verfahrensanleitungen und interne Kommunikation. Szenarien wie „Korrekte Nutzung von Schutzausrüstung” oder „Ablauf einer Qualitätsprüfung” können als Kurzclips visualisiert werden, ohne teure Produktionsaufnahmen. Für sicherheitsrelevante Inhalte gilt: KI-generierte Videos müssen von Fachexperten auf inhaltliche Korrektheit geprüft werden — das Modell kann bei technischen Details Fehler produzieren. Als Ergänzung zu Text-und-Bild-Schulungsunterlagen sind kurze KI-Video-Sequenzen wertvolle Aufmerksamkeitsverstärker.

Finanzdienstleistung & Versicherung

Im Finanzbereich bieten sich KI-Videos für interne Kommunikation und Schulungsformate an. Management-Updates, Quartalsbriefings oder Compliance-Informationen können mit atmosphärischen KI-Video-Hintergründen visuell aufgewertet werden. Für nach außen gerichtete Kundenkommunikation gilt erhöhte Sorgfalt: BaFin-regulierte Kommunikation muss klar und nicht irreführend sein; KI-generierte Szenen, die bestimmte Situationen oder Ergebnisse suggerieren, könnten als irreführend bewertet werden. Empfehlung: KI-Video für interne und Schulungszwecke freizügiger nutzen; für Kundenkommunikation strenge Freigabeprozesse einrichten.

Öffentliche Verwaltung

Öffentliche Einrichtungen können KI-Video für Bürgerkommunikation, Ausbildungsvideos und Informationskampagnen nutzen. Erklärvideos zu Verwaltungsdienstleistungen (z. B. „So stellen Sie einen Antrag digital”) profitieren von atmosphärischen Hintergrundclips, die professionell wirken, ohne teure Produktionen zu erfordern. Transparenzgebot: Alle KI-generierten Videos in öffentlicher Kommunikation müssen deutlich als solche gekennzeichnet sein — unabhängig von gesetzlicher Pflicht. Datenschutz: Keine Personendaten oder vertrauliche Verwaltungsinformationen in Prompts eingeben.

Übung 1 — Szenen-Brief schreiben

Übung 1

Aufgabe: Schreiben Sie einen vollständigen Szenen-Brief für einen 8-sekündigen Kurzclip, der für eine interne Präsentation genutzt werden soll.

Kontext: Das Video soll Teamarbeit in einem modernen Büro illustrieren.

Vorgehen: 1. Füllen Sie alle 7 Elemente des Szenen-Brief-Frameworks aus (Setting, Action, Kamera, Stil, Farbton, Dauer, Mood) 2. Schreiben Sie den finalen Prompt als zusammenhängenden englischen Text (Video-KI-Modelle verarbeiten Englisch besser als Deutsch) 3. Falls Runway-Zugang verfügbar: Generieren Sie den Clip 4. Bewerten Sie: Trifft der Clip die Intention? Was würden Sie am Brief ändern?

Zeit: 20 Minuten

Musterlösung / Leitfaden für Trainer:

Ergebnis-Beispiel: „A contemporary open-plan office with floor-to-ceiling windows. Three professionals around a standing desk discussing data on a large screen. Camera starts wide and slowly pushes to medium shot. Warm, diffused natural light. Cinematic look, shallow depth of field, slightly warm color grade. Collaborative, focused, professional atmosphere. 8 seconds.” — Diskutieren Sie: Was hat gut funktioniert? Was ist schwieriger als erwartet (Personenkonsistenz, lesbare Inhalte auf dem Bildschirm)?

Übung 2 — Präziser vs. vager Prompt: Qualitätsvergleich

Übung 2

Aufgabe: Vergleichen Sie die Ergebnisse eines vagen und eines präzisen Video-Prompts.

Prompt A (vage): „Office meeting”

Prompt B (präzise): „A glass-walled conference room on a high floor with city views. Two executives discuss a presentation on a wall-mounted screen. One points at the screen. Camera: slow pan right, medium shot. Natural morning light, cool color temperature, professional. 6 seconds.”

Falls Tool-Zugang vorhanden: Generieren Sie beide Clips auf Runway oder einer anderen Plattform. Falls kein Tool-Zugang: Diskutieren Sie in der Gruppe, welche Unterschiede Sie erwarten würden und warum Präzision im Video-Prompting wichtig ist.

Zeit: 15 Minuten

Musterlösung / Leitfaden für Trainer:

Erwartete Erkenntnis: Vager Prompt = zufälliges, oft generisches Ergebnis ohne Atmosphäre. Präziser Prompt = steuerbares, professionell wirkendes Ergebnis. Parallele zu UE 62 Bild-Prompting ziehen: dasselbe Prinzip gilt für Video.

Prompt-Vorlage

Prompt: Szenen-Brief für KI-Videogenerierung erstellen

Du bist ein Szenenautor für KI-Video-Generierungstools (Sora, Runway Gen-3, Veo).



Erstelle einen vollständigen Szenen-Brief für folgendes Video-Konzept:



Thema / Inhalt: [BESCHREIBUNG DES VIDEOS EINFÜGEN]

Dauer der Szene: [z. B. 5 Sekunden / 10 Sekunden]

Verwendungszweck: [z. B. LinkedIn-Post / Produkt-Teaser / internes Schulungsvideo]



Liefere einen strukturierten Szenen-Brief mit:



**Bildaufbau (Setting):** Ort, Zeit, Licht, Atmosphäre

**Motiv / Hauptelement:** Was steht im Vordergrund? Bewegung oder statisch?

**Kamerabewegung:** z. B. Slow push-in / Static shot / Pan left / Aerial drone shot

**Stilangabe:** Fotorealistisch / Cinematic / Animation / Dokumentarfilm

**Farbstimmung:** z. B. warme Goldtöne / kühle Corporate-Blaus / Schwarz-Weiß

**Negativanweisung:** Was soll explizit NICHT erscheinen?



Formuliere den finalen Prompt in 2–4 präzisen englischsprachigen Sätzen,

geeignet für Sora oder Runway Gen-3.

Anwendung: Verwenden Sie diesen Meta-Prompt um strukturierte Video-Prompts zu entwickeln. Englischsprachige Prompts liefern bei allen Video-KI-Modellen (Sora, Runway, Veo) derzeit bessere Ergebnisse als deutsche Prompts.

Cheatsheet — UE 67

Video-KI Plattform-Entscheid: - Professionell + Kameracontrol → Runway Gen-3 (ab Freemium) - ChatGPT Pro-Nutzer → Sora - Realistische Physik + Google-Ökosystem → Veo 2/3 - Social Media / kreativ → Pika Labs 2.0

7 Elemente Szenen-Brief: Setting · Action · Kamera · Stil · Farbton · Dauer · Mood

Was Video-KI 2026 kann: Kurze Clips · Atmosphäre · B-Roll · Kamerafahrten · Naturszenen Was sie nicht kann: Personen über Clips konsistent · lesbarer Text · Langform-Narrative

EU AI Act Art. 50: KI-Video für die Öffentlichkeit → Kennzeichnung erforderlich. C2PA-Metadaten: Nicht entfernen — sie sichern die Nachverfolgbarkeit der KI-Herkunft.

Reflexionsfragen

Für welche konkreten Video-Produktionsaufgaben in Ihrer Organisation wäre KI-Video heute schon sinnvoll einsetzbar — und für welche nicht?

Wie würden Sie einem Marketingteam erklären, dass KI-Video keine Imagekampagne mit realen Personen ersetzen kann, aber bestimmte B-Roll-Aufgaben deutlich vereinfacht?

Welche internen Freigabeprozesse bräuchten Sie, um KI-generierte Videos in der externen Kommunikation einsetzen zu können?

Wie verändert die Kennzeichnungspflicht nach EU AI Act das Nutzererlebnis — und ist das eher ein Vorteil oder ein Nachteil für Ihr Unternehmen?

Quellen & Weiterlesen

QuelleTypURL
Runway MLPlattformhttps://runwayml.com
OpenAI SoraProduktseitehttps://openai.com/sora
Pika LabsPlattformhttps://pika.art
Google DeepMind VeoForschung/Produkthttps://deepmind.google/technologies/veo
C2PA — Content Provenance StandardStandardhttps://c2pa.org
EU AI Act — Art. 50Gesetzestexthttps://eur-lex.europa.eu/legal-content/DE/TXT/?uri=CELEX:32024R1689

Quelle: KI-Wissensbasis von MindsMachines, Edition Juni 2026. Vollständige Fassung mit Anhängen und Musterlösungen: als PDF anfordern.

Zurück zur Modul-Übersicht

Nächster Schritt

Vom Selbststudium zur Schulung im Team.

Diese Einheit stammt aus unserer Wissensbasis mit 120 Unterrichtseinheiten. Als KI-Schulung vermitteln wir die Inhalte praxisnah an Ihren eigenen Use Cases, EU-AI-Act-konform dokumentiert.

Die Plattform

OneMachine: Ihre KI, in Ihrem System.

Produktive KI, die sicher in Ihrer Organisation läuft: mit eigenen Daten, Rechten und Freigaben. Aus echter Projektpraxis zum lizenzierbaren Produkt verdichtet.

OneMachine ansehen