Dieser Abschnitt enthält erweiterte Schritt-für-Schritt-Anleitungen für ausgewählte Werkzeuge aus Modul 6. Sie sind als Trainer-Referenz gedacht und können bei Bedarf als Teilnehmer-Handout ausgegeben werden.
Anleitung A: DALL·E 3 — Vom einfachen zum professionellen Prompt
Ziel: Einen qualitativ hochwertigen, berufsfeldbezogenen Bild-Prompt in 5 Schritten aufbauen.
Voraussetzungen: ChatGPT-Konto (Free oder Plus), Zugriff auf DALL·E 3 via ChatGPT-Interface.
Schritt 1 — Basisidee formulieren (1 Satz)
Beginnen Sie mit dem einfachsten möglichen Prompt: Was soll das Bild zeigen? Beispiel: „Ein Techniker repariert eine Maschine in einer Fabrik.”
Generieren Sie das Bild und bewerten Sie das Ergebnis anhand von drei Fragen: Stimmt das Motiv? Stimmt der Stil? Stimmt die Stimmung?
Schritt 2 — Stil und Medium ergänzen
Fügen Sie einen Stil-Parameter hinzu. Entscheiden Sie sich für eine Kategorie: Fotorealistisch, Illustration, technische Zeichnung, 3D-Render, Gemälde, Skizze. Beispiel: „Ein Techniker repariert eine Maschine in einer Fabrik. Fotorealistisch, DSLR-Aufnahme.”
Schritt 3 — Kamera und Licht definieren
Fügen Sie Kamera-Metadaten hinzu. Wählen Sie Brennweite (weitwinklig = 24 mm für Raum, Porträt = 85 mm für Person), Perspektive (Augenhöhe, Vogelperspektive, Froschperspektive) und Lichtquelle (natürlich, Studio, dramatisch, golden hour). Beispiel: „… Canon EOS R5, 35 mm, natürliches Seitenlicht durch Hallenfenster, leichter Dunst.”
Schritt 4 — Stimmung und Kontext präzisieren
Fügen Sie Stimmungs- und Kontext-Parameter hinzu. Was soll das Bild kommunizieren? Kompetenz, Fürsorge, Innovation, Vertrauen? Beispiel: „… Der Techniker wirkt konzentriert und professionell. Moderne, aufgeräumte Produktionshalle im Hintergrund, Tageslicht.”
Schritt 5 — Negative Parameter setzen
Formulieren Sie, was das Bild nicht enthalten soll. Beispiel: „Nicht: Unordnung, veraltete Maschinen, schlechtes Licht, unscharfer Vordergrund.”
Vollständiger Prompt (Ergebnis):
„Fotorealistisches DSLR-Foto eines konzentrierten, professionell gekleideten Technikers, der an einer modernen CNC-Maschine in einer aufgeräumten, hellen Produktionshalle arbeitet. Canon EOS R5, 35 mm Brennweite, natürliches Seitenlicht durch große Hallenfenster, leichter industrieller Dunst im Hintergrund. Der Techniker wirkt kompetent und sorgfältig, kein Chaos, keine veralteten Maschinen. Hochauflösend, tack-sharp.”
Anleitung B: Whisper — Lokale Installation und erste Transkription
Ziel: Whisper lokal installieren und eine erste Audiodatei transkribieren.
Voraussetzungen: Python 3.9+, pip, ffmpeg installiert. Terminal-Grundkenntnisse.
Schritt 1 — Installation
Öffnen Sie das Terminal und führen Sie aus:
pip install openai-whisper
Installation von ffmpeg (falls nicht vorhanden): - Windows: winget install ffmpeg - macOS: brew install ffmpeg - Ubuntu/Debian: sudo apt install ffmpeg
Schritt 2 — Modell-Wahl
Whisper bietet fünf Modellgrößen: tiny (39 M Parameter, schnell, geringere Qualität), base (74 M), small (244 M), medium (769 M), large (1,5 B Parameter, langsam, höchste Qualität). Für den Unterrichtsstart empfiehlt sich small als gutes Gleichgewicht.
Schritt 3 — Erste Transkription
whisper meine_aufnahme.mp3 --model small --language German --output_format txt
Das Ergebnis wird als .txt-Datei im selben Ordner gespeichert.
Schritt 4 — Mit Zeitstempeln
whisper meine_aufnahme.mp3 --model small --language German --output_format srt
Das SRT-Format enthält Zeitstempel und ist direkt in Videoschnittprogramme importierbar.
Schritt 5 — Qualitätsprüfung
Prüfen Sie das Transkript auf: Eigennamen (werden oft falsch erkannt), Fachbegriffe (branchenspezifisches Vokabular kann abweichen), Zahlen und Datumsangaben (immer manuell prüfen).
Anleitung C: ElevenLabs — Text-to-Speech für Unternehmenskommunikation
Ziel: Einen professionellen Voiceover für ein Schulungsvideo erstellen.
Voraussetzungen: ElevenLabs-Konto (Free Tier: 10.000 Zeichen/Monat).
Schritt 1 — Stimme wählen
Navigieren Sie zu Voice Library. Filtern Sie nach: Sprache (Deutsch), Einsatzzweck (professional, narration), Geschlecht (nach Bedarf). Hören Sie mindestens 5 Stimmen an, bevor Sie sich entscheiden. Achten Sie besonders auf: Natürlichkeit der Pausen, Betonung von Schlüsselwörtern, Emotionstiefe.
Schritt 2 — SSML-Markup verwenden
Für professionelle Ergebnisse nutzen Sie SSML-Tags:
<speak>
Willkommen zu unserem Schulungsmodul.
<break time="500ms"/>
In dieser Einheit lernen Sie,
<emphasis level="moderate">wie KI-Werkzeuge Ihre Arbeit unterstützen können.</emphasis>
<break time="300ms"/>
Bitte nehmen Sie sich einen Moment Zeit.
</speak>
Schritt 3 — Geschwindigkeit und Stil anpassen
Passen Sie Stability (0,7–0,8 für natürlichere Variation) und Clarity (0,75 für Klarheit ohne Artifakte) an. Similarity Boost auf 0,85 für konsistente Stimme über längere Texte.
Schritt 4 — Export und Integration
Exportieren Sie als MP3 (320 kbps für Produktion) oder WAV (für Videoschnitt). Für Video-Integration: Importieren Sie die Audiodatei in Ihr Schnittprogramm und synchronisieren Sie manuell oder nutzen Sie den automatischen Sync von DaVinci Resolve.
Schritt 5 — Qualitätsprüfung
Hören Sie den vollständigen Voiceover ab (nicht nur den Anfang). Prüfen Sie: Klingen Fachbegriffe natürlich? Sind Pausen an den richtigen Stellen? Ist die Lautstärke konsistent?
Anleitung D: HeyGen — Personal Avatar erstellen (Übersicht)
Ziel: Einen Personal Avatar für Schulungsvideos erstellen (konzeptionelle Übersicht).
Voraussetzungen: HeyGen-Konto (Creator Plan oder höher für Custom Avatars).
Schritt 1 — Video-Aufnahme vorbereiten
Aufnahmedauer: Mindestens 2 Minuten ununterbrochenes Sprechen. Setting: Neutraler Hintergrund (weiß, grau oder professionell), gute Beleuchtung (kein Gegenlicht). Kleidung: Professionell, einfarbig (keine Muster, keine stark gemusterten Hemden). Kamera: Augenhöhe, stabil (Stativ empfohlen), Mindestauflösung 1080p.
Schritt 2 — Upload und Consent
Hochladen der Videodatei über HeyGen Dashboard. Akzeptieren Sie die Consent-Erklärung — HeyGen verarbeitet Ihr biometrisches Profil gemäß DSGVO. Lesen Sie die Consent-Erklärung vollständig, bevor Sie zustimmen.
Schritt 3 — Avatar-Verarbeitung
Verarbeitungszeit: 24–72 Stunden. Sie erhalten eine E-Mail-Benachrichtigung. Nach der Verarbeitung erscheint Ihr Avatar in der Avatar-Bibliothek.
Schritt 4 — Erstes Video erstellen
Wählen Sie Ihren Avatar, geben Sie einen Text ein (oder importieren Sie ein Skript), wählen Sie die Sprache und starten Sie die Generierung. Qualitätsprüfung: Überprüfen Sie Lippensynchronisierung, natürliche Augenbewegungen, Kopfbewegungen.
Schritt 5 — Export und Nutzung
Export: MP4, 1080p. Für LMS-Integration: Prüfen Sie SCORM-Exportoptionen (Synthesia bietet dies, HeyGen derzeit eingeschränkt). Für interne Kommunikation: Direkter Upload in SharePoint, Teams oder Intranet.
Quelle: KI-Wissensbasis von MindsMachines, Edition Juni 2026. Vollständige Fassung als PDF anfordern.