KI-AkademieWissensbasis

Aus Modul 6 · ca. 3 Min.

Modul 6 — Multimodalität: Bild, Audio, Video

Zur Modul-Seite

Visualisierung: Multimodalitäts-Rad mit vier Segmenten: Text (Zentrum), Bild, Audio, Video — mit Doppelpfeilen, die die wechselseitige Übersetzbarkeit darstellen. Beschriftung: „Text → Bild”, „Bild → Text”, „Audio → Text” usw.

Diagramm aus der KI-Wissensbasis

Modul-Lernziele

Sie erklären, was multimodale KI-Systeme von textbasierten Sprachmodellen unterscheidet.

Sie beschreiben die wichtigsten Anwendungsfelder von Bildgenerierung, Bildanalyse, Audio-Transkription und Videogenerierung.

Sie formulieren Bild-Prompts (Image Prompts) nach strukturierten Methoden und bewerten die Ergebnisse.

Sie erkennen rechtliche und ethische Risiken beim Einsatz generativer Bild- und Audiomodelle (Urheberrecht, Deepfakes, Persönlichkeitsrechte).

Sie benennen geeignete Anwendungsfälle für multimodale KI im beruflichen Kontext und grenzen diese von ungeeigneten ab.

Sie bewerten die Qualität von KI-generierten Bildern, Audios und Videos anhand definierter Kriterien.

Modul-Übersicht

UETitel
UE 61Multimodale KI: Grundbegriffe und Systemtypen
UE 62Bildgenerierung: Funktionsprinzipien (Diffusionsmodelle)
UE 63Bild-Prompts formulieren: Methoden und Stilparameter
UE 64Bildanalyse und Bildbeschreibung mit KI
UE 65KI-generierte Bilder im beruflichen Kontext: Anwendungsfälle
UE 66Audio-Transkription und Sprache-zu-Text
UE 67KI-Stimmsynthese: Möglichkeiten und Risiken
UE 68Video-KI: Analyse, Untertitelung, Kurzform-Generierung
UE 69Urheberrecht und Persönlichkeitsrechte bei generativen Medien
UE 70Deepfakes erkennen und damit umgehen
UE 71Multimodale KI in der Praxis: Fallstudien aus verschiedenen Branchen
UE 72Modul 6 — Zusammenfassung, Wiederholung, Ausblick auf Modul 7

Didaktische Verortung

Modul 6 erweitert den Kompetenzbereich von Text auf andere Modalitäten. Es behandelt ein Themenfeld, das in der öffentlichen Wahrnehmung oft von Extremen dominiert wird — entweder begeisterter Adoption oder tiefer Skepsis. Didaktisches Ziel ist ein ausgewogenes, sachkundiges Verständnis: Was können diese Systeme tatsächlich, was sind ihre Grenzen, und welche Risiken entstehen durch ihren unkritischen Einsatz?

Besonderes Gewicht haben UE 69 (Urheberrecht) und UE 70 (Deepfakes): Diese Einheiten verbinden das Modul mit dem rechtlichen Rahmen aus Modul 2 und bereiten auf die Sicherheitsthemen in Modul 9 vor. Trainerinnen und Trainer sollten bei diesen Einheiten auf aktuelle Beispiele aus der Berichterstattung zurückgreifen, weil sich das Feld schnell entwickelt.

Die Prompt-Boxen in Modul 6 konzentrieren sich auf Image-Prompting-Methoden, die sich strukturell von Text-Prompts unterscheiden und eigene Lernkurven haben.

Verzahnung mit anderen Modulen

Modul 6 setzt Modul 1 (Grundverständnis) und Modul 3 (Prompting-Grundlagen) voraus. Es hat rechtliche Querverbindungen zu Modul 2. Multimodale Ausgaben werden in Modul 7 (Agenten, die Bilder erzeugen oder analysieren) und Modul 8 (multimodale Inhalte in Kommunikation und Marketing) weitergeführt.

Kompetenzziel auf der AI-Act-Kompetenz-Skala: Anwendungskompetenz (Stufe 3), mit Teilbereichen Risiko-Bewusstsein (UE 69, 70).

Empfohlene Reihenfolge: Nach Modul 5 oder parallel dazu. Modul 6 kann auch als eigenständiges Kompaktmodul eingesetzt werden, wenn eine Kursgruppe spezifisch multimodale KI-Kompetenz aufbauen möchte.

Trainer-Wissensbasis v2 · Unterrichtseinheiten 61–72 · Alle Rechte vorbehalten

Quelle: KI-Wissensbasis von MindsMachines, Edition Juni 2026. Vollständige Fassung als PDF anfordern.

Nächster Schritt

Vom Selbststudium zur Schulung im Team.

Diese Einheit stammt aus unserer Wissensbasis mit 120 Unterrichtseinheiten. Als KI-Schulung vermitteln wir die Inhalte praxisnah an Ihren eigenen Use Cases, EU-AI-Act-konform dokumentiert.

Die Plattform

OneMachine: Ihre KI, in Ihrem System.

Produktive KI, die sicher in Ihrer Organisation läuft: mit eigenen Daten, Rechten und Freigaben. Aus echter Projektpraxis zum lizenzierbaren Produkt verdichtet.

OneMachine ansehen