KI-AkademieModul 6 — Multimodalität: Bild, Audio, Video

Wissensbasis · UE 66 von 120

Text-to-Speech und synthetische Stimmen

Modul 6 — Multimodalität: Bild, Audio, Video ca. 12 Min. Lesezeit

Lernziele

Sie kennen die führenden Text-to-Speech-Plattformen und deren Einsatzbereiche.

Sie durchlaufen einen vollständigen TTS-Produktions-Workflow von Skript bis zur fertigen Audiodatei.

Sie erklären die Rechtslage zu Voice Cloning und unterscheiden legitime von unzulässigen Anwendungen.

Sie beurteilen, für welche Kommunikationsaufgaben synthetische Stimmen eine echte Sprechstimme sinnvoll ergänzen oder ersetzen können.

Auf einen Blick

MerkmalDetail
Dauer90 Minuten
NiveauEinsteiger – Fortgeschritten
MethodenInput, Demo, Einzelübung, Ethik-Diskussion
MaterialienLaptop, Internetzugang, ElevenLabs-Account (Freemium)
QuerverweiseUE 65 (STT), UE 68 (Avatare), UE 69 (Deepfakes), UE 72 (Erklär-Clip)

Worum geht es?

Synthetische Stimmen haben in den letzten Jahren eine Qualitätsrevolution erlebt. Was früher nach Roboter klang, klingt heute in vielen Fällen nicht mehr von einer menschlichen Stimme zu unterscheiden. Diese Entwicklung eröffnet enorme Möglichkeiten: Voiceover für Videos und Schulungen ohne teure Sprecherstudio-Buchungen; mehrsprachige Audioinhalte auf Knopfdruck; barrierefreie Audiodeskriptionen; personalisierte Sprachausgaben in Apps.

Gleichzeitig entstehen durch Voice Cloning — das Erzeugen einer täuschend echten Kopie einer realen Stimme — erhebliche Missbrauchspotentiale: Telefonbetrug, gefälschte Anweisungen, manipulierte Audiodokumente. Diese Dualität macht Text-to-Speech zu einem der technologisch spannendsten, aber auch ethisch und rechtlich sensibelsten Bereiche der synthetischen Medien.

In dieser Einheit lernen Sie die Möglichkeiten professionell kennen und mit offenem Blick auf die Grenzen umgehen.

Lerntext

Klassische vs. neuronale TTS

Die erste Generation von Text-to-Speech (Concatenative Synthesis, Ende 1990er bis 2010er) funktionierte durch das Aneinanderreihen vorher aufgenommener Phonem-Fragmente. Das Ergebnis war erkennbar maschinell, monoton, ohne Prosodie.

Neuronale TTS (ab ca. 2017, Durchbruch mit WaveNet von DeepMind) lernt stattdessen, Audiowellen direkt aus Text zu erzeugen, basierend auf tiefen neuronalen Netzwerken. Die Qualität übertrifft menschliche Sprache in Konsistenz und Reproduzierbarkeit; in Natürlichkeit nähert sie sich zunehmend menschlicher Qualität an.

ElevenLabs — Referenz für hochwertige TTS

ElevenLabs ist die aktuell führende Plattform für hochwertige, expressive synthetische Stimmen:

Bibliothek: 3.000+ Stimmen in verschiedenen Sprachen und Sprechstilen

Sprachsteuerung: Drei Parameter — Stability (Konsistenz der Stimme), Similarity (Nähe zur Originalstimme), Style (Ausdrucksstärke/Expressivität)

Sprachen: Multilingual v2 Modell mit über 30 Sprachen; Deutsch gut abgedeckt

Voice Cloning: Mit nur 1–3 Minuten eigener Aufnahme kann eine hochwertige Klon-Stimme erzeugt werden

Preise: Creator ab $5/Monat (100.000 Zeichen), Professional und höher für gewerbliche Nutzung

Audio-Formate: MP3 (128/192 kbps), PCM, FLAC, OGG; verschiedene Sampling-Raten je nach Qualitätsanforderung

Diagramm aus der KI-Wissensbasis

Abb. 66.1 — TTS Workflow: Skript → Stimm-Auswahl → Parameter → Export → Integration

Merksatz

ElevenLabs’ Stability-Parameter steuert, wie konsistent die Stimme klingt. Niedrige Stability = mehr Expressivität, mehr Variation — menschlicher, aber weniger reproduzierbar. Hohe Stability = gleichmäßig und stabil — ideal für Informationstexte, weniger für dramatische Inhalte.

OpenAI TTS — Integration und Skalierung

Die OpenAI Text-to-Speech-API bietet sechs Basisstimmen: - Alloy: Neutral, ausgewogen - Echo: Maskulin, ruhig - Fable: Wärmer, erzählerisch - Onyx: Tief, autoritär - Nova: Weiblich, klar - Shimmer: Sanft, freundlich

Preise: $0.015/1000 Zeichen (tts-1, optimiert für Echtzeit) bis $0.030/1000 Zeichen (tts-1-hd, optimiert für Qualität)

Stärke: Einfache API-Integration in eigene Anwendungen; kein separater Account nötig (OpenAI-Account genügt); gut für automatisierte Workflows

Voice Cloning — Was ist erlaubt, was nicht?

Voice Cloning erzeugt auf Basis weniger Minuten echten Audiomaterials eine synthetische Version einer Stimme. Die rechtliche Einordnung ist klar:

Legitim: - Klonen der eigenen Stimme (z. B. für Videos, in denen man selbst nicht immer vor der Kamera stehen möchte) - Klonen einer fremden Stimme mit ausdrücklicher, informierter Einwilligung der betreffenden Person

Nicht zulässig: - Klonen einer fremden Stimme ohne Einwilligung (§823 BGB — Recht am eigenen Bild/eigener Stimme; Persönlichkeitsrecht Art. 2 GG) - Verwendung einer geklonten Stimme zur Täuschung oder für Betrug (§263 StGB — Betrug; §269 StGB — Fälschung beweiserheblicher Daten; §187 StGB — Verleumdung) - Einsatz für CEO-Fraud oder Phishing-Angriffe (§263a StGB)

EU AI Act Art. 50: Synthetisch erzeugte Audioinhalte, die eine reale Person imitieren, müssen für die Öffentlichkeit als KI-generiert erkennbar gemacht werden.

Merksatz

Voice Cloning der eigenen Stimme ist legitim und produktiv. Voice Cloning fremder Stimmen ohne Einwilligung ist in Deutschland strafbar (Persönlichkeitsrecht, Betrug) und verstößt gegen den EU AI Act. Es gibt keine Grauzone: ohne Einwilligung = nicht erlaubt.

Weitere TTS-Plattformen im Überblick

PlattformStärkePreis (ca.)Besonderheit
ElevenLabsQualität, ExpressivitätAb $5/MoVoice Cloning, 3000+ Stimmen
OpenAI TTSAPI-Integration$0.015–0.030/1K Zeichen6 Stimmen, einfache API
Azure Neural TTSEnterprise, SSMLIm Azure-AboMicrosoft-Ökosystem, deutsch gut
Google Cloud TTSBreite SprachauswahlAb $4/1M ZeichenWaveNet-Stimmen
Murf.aiStudio-InterfaceAb $19/MoDrag-and-Drop Voiceover-Studio
PlayHTQualität und KlonierungAb $31/MoAPI + Studio, schnell

SSML — Speech Synthesis Markup Language: SSML ist ein XML-Standard, der präzise Steuerung der Sprachausgabe ermöglicht: Pausen (<break time="500ms"/>), Betonungen (<emphasis>), Sprechtempo (<prosody rate="slow">). Für professionelle Produktionen ist SSML unverzichtbar, um natürliche Sprachrhythmen zu erzeugen.

Vertiefung — Voiceover-Workflow und Stimm-Design

Vollständiger Voiceover-Produktions-Workflow:

Skript optimieren: Text für gesprochene Sprache anpassen (kurze Sätze, keine Klammern, Zahlen ausschreiben). Gesprochenes Deutsch ist nicht identisch mit geschriebenem Deutsch.

Stimme auswählen: Demos auf der Plattform anhören; auf Tonfall, Tempo und Charakter achten. Passt die Stimme zur Marke und zum Inhalt?

Parameter einstellen: Bei ElevenLabs: Stability 50–70% für informative Inhalte; Similarity hoch; Style-Exaggeration gering (zu viel klingt unnatürlich)

Probegeneration: Erste 30 Sekunden generieren und auditiv prüfen

Vollständige Generierung: Kompletten Text generieren; ggf. in Abschnitte aufteilen für mehr Kontrolle

Format wählen: MP3/192kbps für Web und Video; WAV/PCM für Nachbearbeitung in DAW; FLAC für Archivierung

Nachbearbeitung (optional): Stille kürzen, Lautstärke normalisieren (-14 LUFS für Streaming; -3 dBFS Peak-Maximum), Raumklang hinzufügen

Stimm-Design als Kommunikationsstrategie: Die Stimme ist ein Markenasset, das bewusst gewählt werden sollte. Fragen zur Orientierung: - Welche Emotion soll die Stimme transportieren? (Vertrauen, Kompetenz, Wärme, Dynamik) - Wer ist die Zielgruppe? (Technische Fachleute vs. Endkunden vs. Management) - In welchem Kontext wird die Stimme gehört? (Schulung, Marketing, Navigation, Kundenservice) - Ist Konsistenz über Monate und Jahre gewünscht? → Eine festgelegte Stimme als Markenstandard einrichten

Branchen-Anwendungen

IT-Dienstleistung & Beratung

Beratungsunternehmen nutzen TTS zunehmend für E-Learning-Inhalte und Schulungsmaterialien, die intern oder für Kunden produziert werden. Statt für jede Aktualisierung eines Erklärvideos einen Sprecher zu buchen, wird der geänderte Skriptabschnitt einfach neu generiert. Das spart erhebliche Zeit und Kosten — besonders bei Compliance-Trainings, die jährlich aktualisiert werden müssen. Für interne Wissensmanagement-Plattformen können Artikel und Dokumentationen automatisch als Audiodateien bereitgestellt werden, was den Zugang für Mobile-first-Nutzende verbessert.

Industrie & Fertigung

In der Fertigung sind Sprachausgaben für Sicherheitsanweisungen, Maschinenführung und Qualitätsprüfungs-Workflows wertvoll. Mehrsprachige Produktionsstätten profitieren besonders: Eine Sicherheitseinweisung einmal auf Deutsch erstellt, dann in 10 Sprachen per TTS übersetzt und voicert — in einem Bruchteil der Zeit und Kosten einer professionellen Studionachvertonung. ElevenLabs’ Multilingual v2 Modell liefert dabei für die meisten EU-Sprachen akzeptable bis sehr gute Qualität.

Finanzdienstleistung & Versicherung

Für Banken und Versicherungen ist TTS in zwei Bereichen besonders relevant: Erstens barrierefreie Kommunikation — Dokumente und Webseiten als Audiodateien für sehbeeinträchtigte Personen (Pflicht nach BITV 2.0 für öffentliche Stellen; Best Practice für alle). Zweitens automatisierte Kundenservice-Sprachausgaben für IVR-Systeme (Interactive Voice Response), die mit neuronaler TTS deutlich natürlicher klingen als mit klassischer Computerstimme. Datenschutzhinweis: Keine Kundendaten in TTS-Prompts eingeben, wenn Cloud-Verarbeitung genutzt wird.

Öffentliche Verwaltung

Öffentliche Einrichtungen nutzen TTS vor allem für Barrierefreiheit und mehrsprachige Bürgerkommunikation. Behördeninformationen, Formulare und Bescheide in Audioform — automatisch aus vorhandenen Textinhalten generiert — verbessern die Zugänglichkeit für Menschen mit Lesebeeinträchtigungen. Für mehrsprachige Zielgruppen (z. B. in Kommunen mit hohem Migrationsanteil) können Informationsmaterialien kostengünstig in verschiedene Sprachen übersetzt und vertont werden. Wichtig: Qualitätsprüfung durch muttersprachige Personen vor dem Einsatz; TTS-Fehler in amtlicher Kommunikation können zu Missverständnissen führen.

Übung 1 — Erklärtext vertonen mit ElevenLabs

Übung 1

Aufgabe: Vertonen Sie einen kurzen Erklärtext mit ElevenLabs und bewerten Sie das Ergebnis.

Vorgehen: 1. Registrieren Sie sich kostenlos auf elevenlabs.io (Freemium: 10.000 Zeichen/Monat) 2. Schreiben Sie einen 100–150 Wörter langen Erklärtext zu einem beruflichen Thema Ihrer Wahl 3. Wählen Sie eine passende Stimme aus der Bibliothek (Tipp: suchen Sie nach „German” oder testen Sie englische Stimmen) 4. Passen Sie Stability und Similarity an und generieren Sie den Text 5. Hören Sie das Ergebnis kritisch ab: Was klingt natürlich? Was klingt mechanisch? Was würden Sie am Skript ändern?

Reflexionsfrage: Für welche konkreten Anwendungen in Ihrer Organisation wäre TTS produktiv einsetzbar?

Zeit: 20 Minuten

Musterlösung / Leitfaden für Trainer:

Häufige Beobachtungen: Akzent bei deutschen Texten manchmal leicht englisch beeinflusst; sehr langer Sätze klingen holprig; kurze, klare Sätze klingen natürlicher. Empfehlen Sie, das Skript laut vorzulesen vor der Generierung — wenn es sich komisch anfühlt gesprochen, klingt es auch in TTS komisch.

Übung 2 — Voice Cloning Ethik-Fallanalyse

Übung 2

Aufgabe: Ordnen Sie drei Voice-Cloning-Szenarien rechtlich und ethisch ein.

Szenario A: Ein Produktmanager erstellt einen Klon seiner eigenen Stimme in ElevenLabs, um Produktdemo-Videos mit seiner Stimme zu vertonen, ohne jedes Mal selbst sprechen zu müssen. Er kennzeichnet alle Videos als KI-vertont.

Szenario B: Ein Unternehmen möchte Schulungsvideos mit der Stimme einer bekannten internen Trainerin vertonen. Die Trainerin ist damit einverstanden, hat eine schriftliche Einwilligung gegeben und erhält eine Vergütung für die Nutzung ihrer Stimme.

Szenario C: Ein Mitarbeiter erstellt unbemerkt einen Stimmklon des Geschäftsführers und versendet eine gefälschte Sprachnachricht an das Finanzteam mit der Aufforderung, eine Überweisung durchzuführen.

Diskutieren Sie: Zulässig / eingeschränkt zulässig / nicht zulässig? Begründung? Welche Straftatbestände sind in Szenario C erfüllt?

Zeit: 15 Minuten

Musterlösung / Leitfaden für Trainer:

Szenario A: Legitim und vorbildlich (eigene Stimme, Kennzeichnung). Szenario B: Legitim mit Einwilligung und fairer Vergütung. Szenario C: Strafbar (§263 Betrug, §269 Fälschung, §823 BGB Persönlichkeitsrecht, ggf. §263a Computerbetrug). Verknüpfen Sie mit UE 69 (Deepfakes): CEO-Fraud ist eine reale Bedrohung.

Prompt-Vorlage

Prompt: Text für TTS-Voiceover optimieren

Du bist ein Redakteur für gesprochene Sprache. Überarbeite den folgenden Text

so, dass er für eine Text-to-Speech-Vertonung (z. B. mit ElevenLabs) optimiert ist.



Originaltext:

[TEXT EINFÜGEN]



Optimierungsregeln:

1. Kurze, klare Sätze (max. 20 Wörter pro Satz)

2. Keine Klammern, keine Fußnoten, keine Abkürzungen

3. Zahlen und Einheiten ausschreiben (z. B. "fünfzehn Prozent" statt "15%")

4. Fremdwörter mit schwieriger Aussprache durch deutsche Entsprechungen ersetzen

oder phonetische Hinweise in eckigen Klammern ergänzen [Aussprache: ...]

5. Keine verschachtelten Nebensätze

6. Markiere natürliche Sprechpausen mit dem Tag <pause> an Satzenden oder bei

Aufzählungen



Tonalität: [professionell / freundlich / sachlich / emotional — bitte wählen]

Zielgruppe: [ZIELGRUPPE EINFÜGEN]

Ungefähre Dauer: [z. B. 60 Sekunden = ca. 130 Wörter]



Gib nur den überarbeiteten Text aus, keine Erklärungen.

Anwendung: Nutzen Sie diesen Prompt, bevor Sie Texte in ElevenLabs, OpenAI TTS oder Azure Neural TTS eingeben. Gut vorbereitete Skripte klingen deutlich natürlicher und erfordern weniger Nachbearbeitung.

Cheatsheet — UE 66

TTS-Tool-Auswahl: - Beste Qualität + Expressivität → ElevenLabs (ab $5/Mo) - API-Integration + OpenAI-Ökosystem → OpenAI TTS ($0.015–0.030/1K Zeichen) - Enterprise + Microsoft → Azure Neural TTS - Studio-Interface für Nicht-Techniker → Murf.ai

Voiceover-Workflow-Kurzanleitung: 1. Skript für gesprochene Sprache optimieren (kurze Sätze, Zahlen ausschreiben) 2. Stimme auswählen (Demo vorab anhören) 3. Parameter: Stability 50–70%, Similarity hoch 4. Probegeneration (erste 30 Sek) 5. Export als MP3/192kbps (Web) oder WAV (Nachbearbeitung)

Voice Cloning — Daumenregel: - Eigene Stimme → erlaubt - Fremde Stimme mit Einwilligung → erlaubt - Fremde Stimme ohne Einwilligung → STRAFBAR

EU AI Act Art. 50: KI-Audioinhalte mit realer Stimmimitation → Kennzeichnung Pflicht.

Reflexionsfragen

Für welche Kommunikationsaufgaben in Ihrer Praxis wäre TTS sofort einsetzbar — und was würde Sie bisher davon abhalten?

Wo ist eine menschliche Sprechstimme unverzichtbar, weil TTS an ihre Grenzen stößt?

Wie würden Sie intern kommunizieren, wenn Ihr Team Schulungsvideos künftig mit einer festen TTS-Stimme produziert — auch wenn diese Stimme KI-generiert ist?

Welche Richtlinien für Voice Cloning würden Sie in einer Unternehmens-KI-Policy festlegen?

Quellen & Weiterlesen

QuelleTypURL
ElevenLabsPlattformhttps://elevenlabs.io
OpenAI TTS DokumentationOffizielle Docshttps://platform.openai.com/docs/guides/text-to-speech
Murf.aiPlattformhttps://murf.ai
Azure Neural TTSMicrosoft Docshttps://learn.microsoft.com/de-de/azure/cognitive-services/speech-service/text-to-speech
BfDI — Orientierungshilfe SprachassistentenBehördehttps://www.bfdi.bund.de
EU AI Act — Art. 50Gesetzestexthttps://eur-lex.europa.eu/legal-content/DE/TXT/?uri=CELEX:32024R1689

Quelle: KI-Wissensbasis von MindsMachines, Edition Juni 2026. Vollständige Fassung mit Anhängen und Musterlösungen: als PDF anfordern.

Zurück zur Modul-Übersicht

Nächster Schritt

Vom Selbststudium zur Schulung im Team.

Diese Einheit stammt aus unserer Wissensbasis mit 120 Unterrichtseinheiten. Als KI-Schulung vermitteln wir die Inhalte praxisnah an Ihren eigenen Use Cases, EU-AI-Act-konform dokumentiert.

Die Plattform

OneMachine: Ihre KI, in Ihrem System.

Produktive KI, die sicher in Ihrer Organisation läuft: mit eigenen Daten, Rechten und Freigaben. Aus echter Projektpraxis zum lizenzierbaren Produkt verdichtet.

OneMachine ansehen