KI-AkademieWissensbasis

Aus Modul 6 · ca. 5 Min.

GLOSSAR — Modul 6: Bild-, Audio- und Video-KI

Zur Modul-Seite

Für Teilnehmende als Nachschlagewerk:

Alt-Text: Alternativer Text für Bilder in HTML; für Barrierefreiheit und SEO wichtig; beschreibt den Bildinhalt für nicht-visuelle Nutzer.

AssemblyAI: Spezialisierter Speech-to-Text-Dienst mit erweiterten Analysefunktionen (Speaker Diarization, Sentiment Analysis, PII Redaction).

Avatar (KI-Avatar): Eine digitale menschliche Figur, die per Text-to-Speech und Lippensynchronisation beliebigen Text sprechen kann; erzeugt aus einer Videoaufnahme oder einem vorgefertigten Bibliotheks-Avatar.

Batch-Verarbeitung: Die automatisierte Verarbeitung mehrerer Bilder, Audiodateien oder Videos in einem Durchlauf ohne manuelle Einzelbearbeitung.

C2PA: Coalition for Content Provenance and Authenticity; technischer Standard für Medien-Herkunftsmetadaten; ermöglicht Nachweis, ob ein Medium echt oder KI-generiert ist.

CEO-Fraud: Betrugsmasche, bei der Kriminelle die Identität einer Führungsperson imitieren (oft per gefälschtem Telefonanruf oder Sprachnachricht), um Mitarbeitende zu betrügerischen Überweisungen zu veranlassen.

CLIP: Contrastive Language–Image Pre-Training; OpenAI-Modell, das Text und Bilder in einem gemeinsamen mathematischen Raum repräsentiert; Grundlage für Text-zu-Bild-Generierung.

ComfyUI: Node-basiertes Interface für Stable Diffusion; ermöglicht komplexe, visuell gestaltete Workflows; für fortgeschrittene Nutzer.

ControlNet: Stable-Diffusion-Erweiterung, die präzise Kontrolle über Pose, Komposition, Tiefe und Stil ermöglicht.

DALL·E 3: OpenAIs Bildgenerierungsmodell, integriert in ChatGPT Plus und Teams; nutzt Textprompts für Bildgenerierung.

Deepfake: Synthetisches Medium, das eine reale Person imitiert oder eine nicht stattgefundene Situation täuschend echt darstellt; umfasst Video Face Swap, Audio Voice Clone und verwandte Techniken.

Diffusionsmodell: Klasse von KI-Modellen, die lernen, aus zufälligem Rauschen ein kohärentes Bild zu erzeugen (Umkehr eines Verrauschungsprozesses); Grundlage für DALL·E 3, Stable Diffusion, Midjourney, Flux.

DSGVO: Datenschutz-Grundverordnung der EU (GDPR); regelt Erhebung, Verarbeitung und Speicherung personenbezogener Daten.

ElevenLabs: Führende Text-to-Speech-Plattform mit 3.000+ Stimmen, Voice Cloning und Multilingual v2-Modell.

EU AI Act: Verordnung der EU zur Regulierung von KI-Systemen; klassifiziert KI nach Risikostufen; Art. 50 regelt Kennzeichnungspflichten für synthetische Medien; vollständig anwendbar ab August 2026.

Fireflies.ai: KI-Meeting-Assistent; verbindet sich mit Kalender, transkribiert Meetings automatisch, erstellt Zusammenfassungen und Action Items.

Flux: Open-Source-Bildgenerierungsmodell von Black Forest Labs; vielfach als Stable-Diffusion-Nachfolger bezeichnet.

Generative Fill: Adobe Photoshop-Funktion, powered by Adobe Firefly; ermöglicht Inpainting und Outpainting per Textprompt.

GAN: Generative Adversarial Network; ältere Klasse von generativen KI-Modellen; heute weitgehend durch Diffusionsmodelle verdrängt.

HeyGen: Führende Avatar-Video-Plattform; 200+ Avatare, Personal Avatar-Erstellung, Video-Übersetzung in 35+ Sprachen mit Lippensynchronisation.

Inpainting: KI-gestütztes Ersetzen oder Ergänzen ausgewählter Bildbereiche innerhalb eines bestehenden Bildes.

IP-Entschädigungsklausel: Vertragsklausel, bei der der Anbieter (z. B. Adobe für Firefly Enterprise) im Fall von Urheberrechtsklagen die Haftung übernimmt.

LMS: Learning Management System; Software-Plattform für die Verwaltung und Bereitstellung von E-Learning-Inhalten (z. B. Moodle, Cornerstone, SAP SuccessFactors).

LoRA: Low-Rank Adaptation; Technik zum effizienten Fine-Tuning eines Basismodells mit wenigen Beispielen; erzeugt kleine Dateien (50–150 MB) mit spezifischen Stil- oder Personenergebnissen.

LUFS: Loudness Units relative to Full Scale; Standard-Maß für Lautstärke-Normalisierung in Audioproduktion; Streaming-Standard: -14 LUFS.

Midjourney: Führende kommerzielle Bildgenerierungsplattform; Discord-basiert (Web-App in Beta); bekannt für hohe ästhetische Qualität; ab Standard-Plan für kommerzielle Nutzung.

Motion Brush: Runway-Funktion, die es ermöglicht, bestimmten Bildbereichen Bewegungsanweisungen zuzuweisen.

Outpainting: KI-gestützte Erweiterung eines Bildes über seine ursprünglichen Grenzen hinaus.

PII Redaction: Automatisches Entfernen oder Schwärzen personenbezogener Informationen (Personally Identifiable Information) aus Texten oder Transkripten.

Real-ESRGAN: Open-Source KI-Upscaling-Modell; läuft lokal; verschiedene Varianten für Fotos, Illustrationen und animierte Inhalte.

Remove.bg: Webbasiertes Tool zur automatischen Hintergrundentfernung aus Bildern.

Runway Gen-3 Alpha: Führende professionelle Video-KI-Plattform; Text-to-Video, Image-to-Video, Motion Brush, Camera Controls.

SCORM: Sharable Content Object Reference Model; technischer Standard für E-Learning-Inhalte; ermöglicht Tracking und LMS-Integration.

Sora: OpenAIs Video-Generierungsmodell; für ChatGPT Pro-Nutzer verfügbar; ermöglicht multiminütige Video-Generierung mit Kameraführungsanweisungen.

Speaker Diarization: Automatische Erkennung und Trennung verschiedener Sprecher in einer Audio-Aufnahme.

Stable Diffusion: Open-Source Bildgenerierungsmodell von Stability AI; läuft lokal oder über Plattformen wie Leonardo.ai; maximale Datenschutzkontrolle.

STT: Speech-to-Text; Technologie zur Umwandlung gesprochener Sprache in Text.

Synthesia: Enterprise-Avatar-Video-Plattform; ISO 27001 zertifiziert, DSGVO-konform, SCORM-Export-Unterstützung.

Topaz Gigapixel AI: Spezialisiertes KI-Upscaling-Tool; beste Qualität für Foto-Upscaling bis 6×; lokale Verarbeitung.

TTS: Text-to-Speech; Technologie zur Umwandlung von Text in gesprochene Sprache.

Upscaling: KI-gestützte Vergrößerung eines Bildes unter Beibehaltung oder Verbesserung der Qualität.

Veo 2/3: Googles Video-Generierungsmodell; bekannt für realistische Bewegungsphysik; Veo 3 mit integrierter Audio-Generierung.

Voice Cloning: Erstellung einer synthetischen Stimme, die einer realen Person klingt, basierend auf wenigen Minuten Audiomaterial; rechtlich: nur mit Einwilligung der betreffenden Person zulässig.

Whisper: OpenAIs Open-Source Speech-to-Text-Modell; trainiert auf 680.000 Stunden mehrsprachiger Audiodaten; verschiedene Modellgrößen von tiny bis large.

WER: Word Error Rate; Maß für die Genauigkeit von STT-Systemen; Prozentsatz der falsch transkribierten Wörter.

Ende des Zusatz-Inhalts — Integration in handout_ue_061_072_v2.md

Quelle: KI-Wissensbasis von MindsMachines, Edition Juni 2026. Vollständige Fassung als PDF anfordern.

Nächster Schritt

Vom Selbststudium zur Schulung im Team.

Diese Einheit stammt aus unserer Wissensbasis mit 120 Unterrichtseinheiten. Als KI-Schulung vermitteln wir die Inhalte praxisnah an Ihren eigenen Use Cases, EU-AI-Act-konform dokumentiert.

Die Plattform

OneMachine: Ihre KI, in Ihrem System.

Produktive KI, die sicher in Ihrer Organisation läuft: mit eigenen Daten, Rechten und Freigaben. Aus echter Projektpraxis zum lizenzierbaren Produkt verdichtet.

OneMachine ansehen