Visualisierung: Multimodalitäts-Rad mit vier Segmenten: Text (Zentrum), Bild, Audio, Video — mit Doppelpfeilen, die die wechselseitige Übersetzbarkeit darstellen. Beschriftung: „Text → Bild”, „Bild → Text”, „Audio → Text” usw.

Modul-Lernziele
Sie erklären, was multimodale KI-Systeme von textbasierten Sprachmodellen unterscheidet.
Sie beschreiben die wichtigsten Anwendungsfelder von Bildgenerierung, Bildanalyse, Audio-Transkription und Videogenerierung.
Sie formulieren Bild-Prompts (Image Prompts) nach strukturierten Methoden und bewerten die Ergebnisse.
Sie erkennen rechtliche und ethische Risiken beim Einsatz generativer Bild- und Audiomodelle (Urheberrecht, Deepfakes, Persönlichkeitsrechte).
Sie benennen geeignete Anwendungsfälle für multimodale KI im beruflichen Kontext und grenzen diese von ungeeigneten ab.
Sie bewerten die Qualität von KI-generierten Bildern, Audios und Videos anhand definierter Kriterien.
Modul-Übersicht
| UE | Titel |
| UE 61 | Multimodale KI: Grundbegriffe und Systemtypen |
| UE 62 | Bildgenerierung: Funktionsprinzipien (Diffusionsmodelle) |
| UE 63 | Bild-Prompts formulieren: Methoden und Stilparameter |
| UE 64 | Bildanalyse und Bildbeschreibung mit KI |
| UE 65 | KI-generierte Bilder im beruflichen Kontext: Anwendungsfälle |
| UE 66 | Audio-Transkription und Sprache-zu-Text |
| UE 67 | KI-Stimmsynthese: Möglichkeiten und Risiken |
| UE 68 | Video-KI: Analyse, Untertitelung, Kurzform-Generierung |
| UE 69 | Urheberrecht und Persönlichkeitsrechte bei generativen Medien |
| UE 70 | Deepfakes erkennen und damit umgehen |
| UE 71 | Multimodale KI in der Praxis: Fallstudien aus verschiedenen Branchen |
| UE 72 | Modul 6 — Zusammenfassung, Wiederholung, Ausblick auf Modul 7 |
Didaktische Verortung
Modul 6 erweitert den Kompetenzbereich von Text auf andere Modalitäten. Es behandelt ein Themenfeld, das in der öffentlichen Wahrnehmung oft von Extremen dominiert wird — entweder begeisterter Adoption oder tiefer Skepsis. Didaktisches Ziel ist ein ausgewogenes, sachkundiges Verständnis: Was können diese Systeme tatsächlich, was sind ihre Grenzen, und welche Risiken entstehen durch ihren unkritischen Einsatz?
Besonderes Gewicht haben UE 69 (Urheberrecht) und UE 70 (Deepfakes): Diese Einheiten verbinden das Modul mit dem rechtlichen Rahmen aus Modul 2 und bereiten auf die Sicherheitsthemen in Modul 9 vor. Trainerinnen und Trainer sollten bei diesen Einheiten auf aktuelle Beispiele aus der Berichterstattung zurückgreifen, weil sich das Feld schnell entwickelt.
Die Prompt-Boxen in Modul 6 konzentrieren sich auf Image-Prompting-Methoden, die sich strukturell von Text-Prompts unterscheiden und eigene Lernkurven haben.
Verzahnung mit anderen Modulen
Modul 6 setzt Modul 1 (Grundverständnis) und Modul 3 (Prompting-Grundlagen) voraus. Es hat rechtliche Querverbindungen zu Modul 2. Multimodale Ausgaben werden in Modul 7 (Agenten, die Bilder erzeugen oder analysieren) und Modul 8 (multimodale Inhalte in Kommunikation und Marketing) weitergeführt.
Kompetenzziel auf der AI-Act-Kompetenz-Skala: Anwendungskompetenz (Stufe 3), mit Teilbereichen Risiko-Bewusstsein (UE 69, 70).
Empfohlene Reihenfolge: Nach Modul 5 oder parallel dazu. Modul 6 kann auch als eigenständiges Kompaktmodul eingesetzt werden, wenn eine Kursgruppe spezifisch multimodale KI-Kompetenz aufbauen möchte.
Trainer-Wissensbasis v2 · Unterrichtseinheiten 61–72 · Alle Rechte vorbehalten
Quelle: KI-Wissensbasis von MindsMachines, Edition Juni 2026. Vollständige Fassung als PDF anfordern.