Lernziele
Sie können die drei führenden Video-Generierungsmodelle (Sora, Runway Gen-3, Google Veo) anhand ihrer Kernmerkmale und Einsatzbereiche beschreiben.
Sie schreiben einen strukturierten Szenen-Brief, der als Grundlage für die KI-Videogenerierung dient.
Sie erklären die Kennzeichnungspflicht nach EU AI Act Art. 50 für synthetische Videos und wenden sie auf konkrete Szenarien an.
Sie beurteilen realistische Einsatzgrenzen der aktuellen Video-KI (Stand 2026) und setzen entsprechende Erwartungen.
Auf einen Blick
| Merkmal | Detail |
| Dauer | 90 Minuten |
| Niveau | Fortgeschritten |
| Methoden | Input, Demo, Einzel- und Gruppenübung |
| Materialien | Laptop, Internetzugang, ggf. Runway-Account (Freemium) |
| Querverweise | UE 68 (Avatare), UE 70 (Marketing), UE 71 (Ethik), UE 72 (Erklär-Clip) |
Worum geht es?
Text-zu-Video ist die vielleicht aufregendste — und gleichzeitig häufigst missverstandene — Technologie im Bereich der synthetischen Medien. Aufmerksame Demos auf Konferenzen und in sozialen Netzwerken zeigen beeindruckende Clips von Läuferinnen am Strand, dramatischen Kamerafahrten durch futuristische Stadtlandschaften oder Zeitlupen-Aufnahmen von Wassertropfen. Was gezeigt wird, ist real möglich — aber die Spanne zwischen Demo-Video und produktivem Alltagseinsatz ist noch groß.
Der Stand 2026: Kurze Clips (4–15 Sekunden) mit einfachen, klar beschreibbaren Szenen sind mit hoher Qualität erzeugbar. Komplexe Szenen mit konsistenten Personen über mehrere Clips hinweg, präzise lesbarer Text im Video oder lange Sequenzen (1+ Minuten) sind weiterhin schwierig. Video-KI ist heute ein mächtiges Werkzeug für bestimmte Zwecke — kein universeller Filmstudio-Ersatz.
Diese Einheit gibt Ihnen einen realistischen Überblick: Was können die führenden Systeme heute wirklich leisten, wie beschreiben Sie eine Szene so, dass die KI sie überzeugend umsetzt, und welche rechtlichen Anforderungen gelten für KI-generierte Videos?
Lerntext
Sora — OpenAIs Video-Modell
Sora ist OpenAIs Videogenerierungsmodell und seit Ende 2024 für ChatGPT-Pro-Nutzer zugänglich. Charakteristika:
Zugang: ChatGPT Pro ($200/Monat); begrenzte Beta-Version für Plus
Videolänge: Bis zu mehrere Minuten (fortgeschrittenes Modell); Qualität nimmt bei längeren Clips ab
Stärken: Realistische Bewegungsphysik, atmosphärische Szenen, Kameraführungsanweisungen (Zoom, Pan, Tracking-Shot)
Schwächen: Konsistente Personendarstellung über Szenen hinweg; präzise Textdarstellung im Video; komplexe physikalische Interaktionen
Outputs: MP4, verschiedene Auflösungen bis 1080p
Sora Storyboard: Sora bietet eine Storyboard-Funktion, die die Sequenzierung mehrerer Szenen-Briefs ermöglicht — ein erster Schritt in Richtung strukturierter Video-Produktion.
Runway Gen-3 Alpha — Professionelle Video-KI
Runway ist aktuell die führende professionelle Video-KI-Plattform und wird von Filmemachern und Produzenten aktiv genutzt:
Zugang: Freemium (500 Credits/Monat) bis Pro ($95/Monat, 2250 Credits); $0.05–0.15 pro Sekunde generiertes Video
Funktionen:
- Text-to-Video: Textbeschreibung → Videoclip
- Image-to-Video: Standbild als Ausgangspunkt → animierter Clip
- Motion Brush: Bestimmte Bildbereiche mit Bewegungsanweisung versehen (z. B. „dieser Baum soll sich im Wind bewegen”)
- Camera Controls: Explizite Kamerabewegungsanweisungen (Dolly in/out, Tilt, Pan)
Videolänge: 4–16 Sekunden pro Generation
Qualität: Bis 1080p, bis 24fps

Abb. 67.1 — Video-KI Vergleich: Sora · Runway Gen-3 · Google Veo 2 — Szenen-Brief Workflow
Merksatz
Runway Gen-3 ist heute die professionellste zugängliche Video-KI-Plattform. Die Stärke liegt in Kamerabewegungen und atmosphärischen Szenen. Die Schwäche: Clips sind kurz (4–16 Sek), eine konsistente Personendarstellung über Clips hinweg ist nicht zuverlässig möglich.
Google Veo 2 und 3 — Realismus und Bewegungsphysik
Google Veo (im Google DeepMind-Kontext entwickelt) zeichnet sich durch besonders realistische Bewegungsphysik aus. Stand 2026:
Veo 2: Integriert in Google Gemini Ultra und AI Studio; beeindruckende Detailtreue bei Wasserphysik, Stoff, Haaren
Veo 3: Erste Version mit synchroner Audio-Erzeugung (Hintergrundgeräusche, Umgebungssound)
Zugang: Google Workspace / AI Studio; schrittweise Rollout für Enterprise
Stärke: Naturszenen, physikalisch realistische Bewegungen, Detailqualität bei Materialien
Einsatzszenarien: Produkt-Lifestyle-Videos, Naturaufnahmen als B-Roll, atmosphärische Intros
Weitere Plattformen: Kling, Pika, Hailuo
Kling 2.0 (Kuaishou): Besonders stark bei menschlichen Bewegungen und Gesichtsausdrücken; chinesischer Anbieter, Datenschutz beachten
Pika Labs 2.0: Animierter Stil, gut für kreative kurze Clips und Social-Media-Inhalte; Freemium verfügbar
Hailuo (MiniMax): Hohe Bewegungsqualität; ebenfalls chinesischer Anbieter
Merksatz
Was Video-KI 2026 gut kann: kurze atmosphärische Clips, realistische Naturszenen, Kamerafahrten, B-Roll-Material. Was sie nicht kann: konsistente Darsteller über mehrere Szenen, präziser Text im Video, lange Sequenzen, komplexe Handlungen. Setzen Sie Erwartungen entsprechend.
Was geht — was nicht (Stand 2026)
Gut umsetzbar mit aktueller Video-KI: - Atmosphärische Eröffnungsshots (Bürogebäude, Stadtlandschaft, Natur) - Produktvisualisierungen mit einfachen Bewegungen - B-Roll-Material für Erklärvideos (Hände tippen, Kaffeekuche, Ähnliches) - Abstrakte und konzeptionelle Visualisierungen - Zeitlupen und Zeitraffer-Effekte
Herausfordernd bis nicht zuverlässig: - Konstante Personendarstellung über mehrere Shots (unterschiedliche Clips zeigen oft unterschiedlich aussehende Personen) - Lesbarer Text im Video (häufig verzerrt oder falsch) - Komplexe Handlungen mit Objektinteraktion (Hand greift Tasse: Finger-Anomalien) - Videos länger als ca. 30–60 Sekunden ohne Qualitätsverlust
Das Szenen-Brief-Framework
Der Szenen-Brief ist das Video-Äquivalent des strukturierten Bild-Prompts. Er enthält alle Informationen, die das Modell für eine gute Generation braucht:
7 Elemente eines Szenen-Briefs:
| Element | Beispiel |
| Setting | Modernes Großraumbüro, viel Tageslicht, Glasfronten zur Stadt |
| Action | Zwei Personen am Stehtisch, schauen auf ein Tablet, nicken zustimmend |
| Kamera | Medium Shot, leichter Dolly nach vorne, Tiefenunschärfe im Hintergrund |
| Stil | Cinematic, warme Farben, natürliches Licht |
| Farbton | Warme Töne, Golden-Hour-Licht durchs Fenster |
| Dauer | 6–8 Sekunden |
| Mood | Professionell, positiv, kollaborativ |
Beispiel-Szenen-Brief: „A modern open-plan office with large windows overlooking a city skyline. Two professionals stand at a high desk reviewing a tablet. The camera slowly pushes in from a medium shot. Warm afternoon sunlight streams through the windows. Cinematic color grading, shallow depth of field. Professional, collaborative, optimistic. 8 seconds.”
Kennzeichnung und C2PA
Für KI-generierte Videos gelten die Kennzeichnungspflichten des EU AI Act Art. 50 gleichermaßen wie für Bilder. Zusätzlich bieten Plattformen wie Runway und Tools von Adobe C2PA-Metadaten-Support an, der die KI-Herkunft eines Videos in den Datei-Metadaten verankert.
Praktische Kennzeichnung: - Sichtbarer Hinweis in Videobeschreibungen: „Dieses Video wurde mit KI generiert” - Einblendung im Video (Intro oder Credits) - C2PA-Metadaten beibehalten (nicht entfernen) - Auf sozialen Plattformen: Platform-eigene KI-Labels nutzen
Vertiefung — ROI-Kalkulation und Produktionsrealität
Zeitvergleich traditionelle Produktion vs. KI-Video:
| Aufgabe | Traditionell | KI-unterstützt |
| 30-Sek Imagefilm (B-Roll) | 1 Tag Dreh + Schnitt | 2–4 Stunden (Briefs + Generation + Auswahl) |
| 60-Sek Produktvideo | 2–3 Tage | 4–8 Stunden |
| Social-Media-Kurzclip (15 Sek) | 3–4 Stunden | 30–60 Minuten |
Kostenfaktor: Runway Pro ($95/Mo) vs. Kamerateam-Tagesrate (Deutschland: 800–2500€/Tag inkl. Equipment). Für Aufgaben, die mit KI-Video qualitativ ausreichend lösbar sind, ist der Kostenvorteil erheblich.
Produktionsrealität: KI-Video ersetzt keine Imagekampagnen, Mitarbeitervideos mit realen Personen oder aufwändige Produktionen. Es ergänzt das Portfolio für B-Roll, atmosphärische Aufnahmen, schnelle Content-Produktion und Prototyping.
Branchen-Anwendungen
IT-Dienstleistung & Beratung
Beratungsunternehmen nutzen KI-Video vor allem für atmosphärisches Footage in Pitch-Präsentationen und auf der Website. Imagesequenzen, die professionelle Teamarbeit, moderne Büroumgebungen oder abstrakte Technologiekonzepte illustrieren, lassen sich schnell und kostengünstig generieren. Ein Anwendungsfall: Ein Consulting-Team erstellt einen neuen Service-Bereich und braucht innerhalb von zwei Tagen Website-Footage und Social-Media-Material. Mit KI-Video lässt sich das ohne Fototermin realisieren. Wichtig: Für externe Kundenpräsentationen und Websites klare Kennzeichnungspolitik festlegen — entweder im Footer oder in der Bildunterschrift.
Industrie & Fertigung
In der Industrie bietet KI-Video Potenzial für Sicherheitsschulungen, Verfahrensanleitungen und interne Kommunikation. Szenarien wie „Korrekte Nutzung von Schutzausrüstung” oder „Ablauf einer Qualitätsprüfung” können als Kurzclips visualisiert werden, ohne teure Produktionsaufnahmen. Für sicherheitsrelevante Inhalte gilt: KI-generierte Videos müssen von Fachexperten auf inhaltliche Korrektheit geprüft werden — das Modell kann bei technischen Details Fehler produzieren. Als Ergänzung zu Text-und-Bild-Schulungsunterlagen sind kurze KI-Video-Sequenzen wertvolle Aufmerksamkeitsverstärker.
Finanzdienstleistung & Versicherung
Im Finanzbereich bieten sich KI-Videos für interne Kommunikation und Schulungsformate an. Management-Updates, Quartalsbriefings oder Compliance-Informationen können mit atmosphärischen KI-Video-Hintergründen visuell aufgewertet werden. Für nach außen gerichtete Kundenkommunikation gilt erhöhte Sorgfalt: BaFin-regulierte Kommunikation muss klar und nicht irreführend sein; KI-generierte Szenen, die bestimmte Situationen oder Ergebnisse suggerieren, könnten als irreführend bewertet werden. Empfehlung: KI-Video für interne und Schulungszwecke freizügiger nutzen; für Kundenkommunikation strenge Freigabeprozesse einrichten.
Öffentliche Verwaltung
Öffentliche Einrichtungen können KI-Video für Bürgerkommunikation, Ausbildungsvideos und Informationskampagnen nutzen. Erklärvideos zu Verwaltungsdienstleistungen (z. B. „So stellen Sie einen Antrag digital”) profitieren von atmosphärischen Hintergrundclips, die professionell wirken, ohne teure Produktionen zu erfordern. Transparenzgebot: Alle KI-generierten Videos in öffentlicher Kommunikation müssen deutlich als solche gekennzeichnet sein — unabhängig von gesetzlicher Pflicht. Datenschutz: Keine Personendaten oder vertrauliche Verwaltungsinformationen in Prompts eingeben.
Übung 1 — Szenen-Brief schreiben
Übung 1
Aufgabe: Schreiben Sie einen vollständigen Szenen-Brief für einen 8-sekündigen Kurzclip, der für eine interne Präsentation genutzt werden soll.
Kontext: Das Video soll Teamarbeit in einem modernen Büro illustrieren.
Vorgehen: 1. Füllen Sie alle 7 Elemente des Szenen-Brief-Frameworks aus (Setting, Action, Kamera, Stil, Farbton, Dauer, Mood) 2. Schreiben Sie den finalen Prompt als zusammenhängenden englischen Text (Video-KI-Modelle verarbeiten Englisch besser als Deutsch) 3. Falls Runway-Zugang verfügbar: Generieren Sie den Clip 4. Bewerten Sie: Trifft der Clip die Intention? Was würden Sie am Brief ändern?
Zeit: 20 Minuten
Musterlösung / Leitfaden für Trainer:
Ergebnis-Beispiel: „A contemporary open-plan office with floor-to-ceiling windows. Three professionals around a standing desk discussing data on a large screen. Camera starts wide and slowly pushes to medium shot. Warm, diffused natural light. Cinematic look, shallow depth of field, slightly warm color grade. Collaborative, focused, professional atmosphere. 8 seconds.” — Diskutieren Sie: Was hat gut funktioniert? Was ist schwieriger als erwartet (Personenkonsistenz, lesbare Inhalte auf dem Bildschirm)?
Übung 2 — Präziser vs. vager Prompt: Qualitätsvergleich
Übung 2
Aufgabe: Vergleichen Sie die Ergebnisse eines vagen und eines präzisen Video-Prompts.
Prompt A (vage): „Office meeting”
Prompt B (präzise): „A glass-walled conference room on a high floor with city views. Two executives discuss a presentation on a wall-mounted screen. One points at the screen. Camera: slow pan right, medium shot. Natural morning light, cool color temperature, professional. 6 seconds.”
Falls Tool-Zugang vorhanden: Generieren Sie beide Clips auf Runway oder einer anderen Plattform. Falls kein Tool-Zugang: Diskutieren Sie in der Gruppe, welche Unterschiede Sie erwarten würden und warum Präzision im Video-Prompting wichtig ist.
Zeit: 15 Minuten
Musterlösung / Leitfaden für Trainer:
Erwartete Erkenntnis: Vager Prompt = zufälliges, oft generisches Ergebnis ohne Atmosphäre. Präziser Prompt = steuerbares, professionell wirkendes Ergebnis. Parallele zu UE 62 Bild-Prompting ziehen: dasselbe Prinzip gilt für Video.
Prompt-Vorlage
Prompt: Szenen-Brief für KI-Videogenerierung erstellen
Du bist ein Szenenautor für KI-Video-Generierungstools (Sora, Runway Gen-3, Veo).
Erstelle einen vollständigen Szenen-Brief für folgendes Video-Konzept:
Thema / Inhalt: [BESCHREIBUNG DES VIDEOS EINFÜGEN]
Dauer der Szene: [z. B. 5 Sekunden / 10 Sekunden]
Verwendungszweck: [z. B. LinkedIn-Post / Produkt-Teaser / internes Schulungsvideo]
Liefere einen strukturierten Szenen-Brief mit:
**Bildaufbau (Setting):** Ort, Zeit, Licht, Atmosphäre
**Motiv / Hauptelement:** Was steht im Vordergrund? Bewegung oder statisch?
**Kamerabewegung:** z. B. Slow push-in / Static shot / Pan left / Aerial drone shot
**Stilangabe:** Fotorealistisch / Cinematic / Animation / Dokumentarfilm
**Farbstimmung:** z. B. warme Goldtöne / kühle Corporate-Blaus / Schwarz-Weiß
**Negativanweisung:** Was soll explizit NICHT erscheinen?
Formuliere den finalen Prompt in 2–4 präzisen englischsprachigen Sätzen,
geeignet für Sora oder Runway Gen-3.
Anwendung: Verwenden Sie diesen Meta-Prompt um strukturierte Video-Prompts zu entwickeln. Englischsprachige Prompts liefern bei allen Video-KI-Modellen (Sora, Runway, Veo) derzeit bessere Ergebnisse als deutsche Prompts.
Cheatsheet — UE 67
Video-KI Plattform-Entscheid: - Professionell + Kameracontrol → Runway Gen-3 (ab Freemium) - ChatGPT Pro-Nutzer → Sora - Realistische Physik + Google-Ökosystem → Veo 2/3 - Social Media / kreativ → Pika Labs 2.0
7 Elemente Szenen-Brief: Setting · Action · Kamera · Stil · Farbton · Dauer · Mood
Was Video-KI 2026 kann: Kurze Clips · Atmosphäre · B-Roll · Kamerafahrten · Naturszenen Was sie nicht kann: Personen über Clips konsistent · lesbarer Text · Langform-Narrative
EU AI Act Art. 50: KI-Video für die Öffentlichkeit → Kennzeichnung erforderlich. C2PA-Metadaten: Nicht entfernen — sie sichern die Nachverfolgbarkeit der KI-Herkunft.
Reflexionsfragen
Für welche konkreten Video-Produktionsaufgaben in Ihrer Organisation wäre KI-Video heute schon sinnvoll einsetzbar — und für welche nicht?
Wie würden Sie einem Marketingteam erklären, dass KI-Video keine Imagekampagne mit realen Personen ersetzen kann, aber bestimmte B-Roll-Aufgaben deutlich vereinfacht?
Welche internen Freigabeprozesse bräuchten Sie, um KI-generierte Videos in der externen Kommunikation einsetzen zu können?
Wie verändert die Kennzeichnungspflicht nach EU AI Act das Nutzererlebnis — und ist das eher ein Vorteil oder ein Nachteil für Ihr Unternehmen?
Quellen & Weiterlesen
| Quelle | Typ | URL |
| Runway ML | Plattform | https://runwayml.com |
| OpenAI Sora | Produktseite | https://openai.com/sora |
| Pika Labs | Plattform | https://pika.art |
| Google DeepMind Veo | Forschung/Produkt | https://deepmind.google/technologies/veo |
| C2PA — Content Provenance Standard | Standard | https://c2pa.org |
| EU AI Act — Art. 50 | Gesetzestext | https://eur-lex.europa.eu/legal-content/DE/TXT/?uri=CELEX:32024R1689 |
Quelle: KI-Wissensbasis von MindsMachines, Edition Juni 2026. Vollständige Fassung mit Anhängen und Musterlösungen: als PDF anfordern.
Zurück zur Modul-Übersicht