Lernziele
Sie kennen die führenden Text-to-Speech-Plattformen und deren Einsatzbereiche.
Sie durchlaufen einen vollständigen TTS-Produktions-Workflow von Skript bis zur fertigen Audiodatei.
Sie erklären die Rechtslage zu Voice Cloning und unterscheiden legitime von unzulässigen Anwendungen.
Sie beurteilen, für welche Kommunikationsaufgaben synthetische Stimmen eine echte Sprechstimme sinnvoll ergänzen oder ersetzen können.
Auf einen Blick
| Merkmal | Detail |
| Dauer | 90 Minuten |
| Niveau | Einsteiger – Fortgeschritten |
| Methoden | Input, Demo, Einzelübung, Ethik-Diskussion |
| Materialien | Laptop, Internetzugang, ElevenLabs-Account (Freemium) |
| Querverweise | UE 65 (STT), UE 68 (Avatare), UE 69 (Deepfakes), UE 72 (Erklär-Clip) |
Worum geht es?
Synthetische Stimmen haben in den letzten Jahren eine Qualitätsrevolution erlebt. Was früher nach Roboter klang, klingt heute in vielen Fällen nicht mehr von einer menschlichen Stimme zu unterscheiden. Diese Entwicklung eröffnet enorme Möglichkeiten: Voiceover für Videos und Schulungen ohne teure Sprecherstudio-Buchungen; mehrsprachige Audioinhalte auf Knopfdruck; barrierefreie Audiodeskriptionen; personalisierte Sprachausgaben in Apps.
Gleichzeitig entstehen durch Voice Cloning — das Erzeugen einer täuschend echten Kopie einer realen Stimme — erhebliche Missbrauchspotentiale: Telefonbetrug, gefälschte Anweisungen, manipulierte Audiodokumente. Diese Dualität macht Text-to-Speech zu einem der technologisch spannendsten, aber auch ethisch und rechtlich sensibelsten Bereiche der synthetischen Medien.
In dieser Einheit lernen Sie die Möglichkeiten professionell kennen und mit offenem Blick auf die Grenzen umgehen.
Lerntext
Klassische vs. neuronale TTS
Die erste Generation von Text-to-Speech (Concatenative Synthesis, Ende 1990er bis 2010er) funktionierte durch das Aneinanderreihen vorher aufgenommener Phonem-Fragmente. Das Ergebnis war erkennbar maschinell, monoton, ohne Prosodie.
Neuronale TTS (ab ca. 2017, Durchbruch mit WaveNet von DeepMind) lernt stattdessen, Audiowellen direkt aus Text zu erzeugen, basierend auf tiefen neuronalen Netzwerken. Die Qualität übertrifft menschliche Sprache in Konsistenz und Reproduzierbarkeit; in Natürlichkeit nähert sie sich zunehmend menschlicher Qualität an.
ElevenLabs — Referenz für hochwertige TTS
ElevenLabs ist die aktuell führende Plattform für hochwertige, expressive synthetische Stimmen:
Bibliothek: 3.000+ Stimmen in verschiedenen Sprachen und Sprechstilen
Sprachsteuerung: Drei Parameter — Stability (Konsistenz der Stimme), Similarity (Nähe zur Originalstimme), Style (Ausdrucksstärke/Expressivität)
Sprachen: Multilingual v2 Modell mit über 30 Sprachen; Deutsch gut abgedeckt
Voice Cloning: Mit nur 1–3 Minuten eigener Aufnahme kann eine hochwertige Klon-Stimme erzeugt werden
Preise: Creator ab $5/Monat (100.000 Zeichen), Professional und höher für gewerbliche Nutzung
Audio-Formate: MP3 (128/192 kbps), PCM, FLAC, OGG; verschiedene Sampling-Raten je nach Qualitätsanforderung

Abb. 66.1 — TTS Workflow: Skript → Stimm-Auswahl → Parameter → Export → Integration
Merksatz
ElevenLabs’ Stability-Parameter steuert, wie konsistent die Stimme klingt. Niedrige Stability = mehr Expressivität, mehr Variation — menschlicher, aber weniger reproduzierbar. Hohe Stability = gleichmäßig und stabil — ideal für Informationstexte, weniger für dramatische Inhalte.
OpenAI TTS — Integration und Skalierung
Die OpenAI Text-to-Speech-API bietet sechs Basisstimmen: - Alloy: Neutral, ausgewogen - Echo: Maskulin, ruhig - Fable: Wärmer, erzählerisch - Onyx: Tief, autoritär - Nova: Weiblich, klar - Shimmer: Sanft, freundlich
Preise: $0.015/1000 Zeichen (tts-1, optimiert für Echtzeit) bis $0.030/1000 Zeichen (tts-1-hd, optimiert für Qualität)
Stärke: Einfache API-Integration in eigene Anwendungen; kein separater Account nötig (OpenAI-Account genügt); gut für automatisierte Workflows
Voice Cloning — Was ist erlaubt, was nicht?
Voice Cloning erzeugt auf Basis weniger Minuten echten Audiomaterials eine synthetische Version einer Stimme. Die rechtliche Einordnung ist klar:
Legitim: - Klonen der eigenen Stimme (z. B. für Videos, in denen man selbst nicht immer vor der Kamera stehen möchte) - Klonen einer fremden Stimme mit ausdrücklicher, informierter Einwilligung der betreffenden Person
Nicht zulässig: - Klonen einer fremden Stimme ohne Einwilligung (§823 BGB — Recht am eigenen Bild/eigener Stimme; Persönlichkeitsrecht Art. 2 GG) - Verwendung einer geklonten Stimme zur Täuschung oder für Betrug (§263 StGB — Betrug; §269 StGB — Fälschung beweiserheblicher Daten; §187 StGB — Verleumdung) - Einsatz für CEO-Fraud oder Phishing-Angriffe (§263a StGB)
EU AI Act Art. 50: Synthetisch erzeugte Audioinhalte, die eine reale Person imitieren, müssen für die Öffentlichkeit als KI-generiert erkennbar gemacht werden.
Merksatz
Voice Cloning der eigenen Stimme ist legitim und produktiv. Voice Cloning fremder Stimmen ohne Einwilligung ist in Deutschland strafbar (Persönlichkeitsrecht, Betrug) und verstößt gegen den EU AI Act. Es gibt keine Grauzone: ohne Einwilligung = nicht erlaubt.
Weitere TTS-Plattformen im Überblick
| Plattform | Stärke | Preis (ca.) | Besonderheit |
| ElevenLabs | Qualität, Expressivität | Ab $5/Mo | Voice Cloning, 3000+ Stimmen |
| OpenAI TTS | API-Integration | $0.015–0.030/1K Zeichen | 6 Stimmen, einfache API |
| Azure Neural TTS | Enterprise, SSML | Im Azure-Abo | Microsoft-Ökosystem, deutsch gut |
| Google Cloud TTS | Breite Sprachauswahl | Ab $4/1M Zeichen | WaveNet-Stimmen |
| Murf.ai | Studio-Interface | Ab $19/Mo | Drag-and-Drop Voiceover-Studio |
| PlayHT | Qualität und Klonierung | Ab $31/Mo | API + Studio, schnell |
SSML — Speech Synthesis Markup Language: SSML ist ein XML-Standard, der präzise Steuerung der Sprachausgabe ermöglicht: Pausen (<break time="500ms"/>), Betonungen (<emphasis>), Sprechtempo (<prosody rate="slow">). Für professionelle Produktionen ist SSML unverzichtbar, um natürliche Sprachrhythmen zu erzeugen.
Vertiefung — Voiceover-Workflow und Stimm-Design
Vollständiger Voiceover-Produktions-Workflow:
Skript optimieren: Text für gesprochene Sprache anpassen (kurze Sätze, keine Klammern, Zahlen ausschreiben). Gesprochenes Deutsch ist nicht identisch mit geschriebenem Deutsch.
Stimme auswählen: Demos auf der Plattform anhören; auf Tonfall, Tempo und Charakter achten. Passt die Stimme zur Marke und zum Inhalt?
Parameter einstellen: Bei ElevenLabs: Stability 50–70% für informative Inhalte; Similarity hoch; Style-Exaggeration gering (zu viel klingt unnatürlich)
Probegeneration: Erste 30 Sekunden generieren und auditiv prüfen
Vollständige Generierung: Kompletten Text generieren; ggf. in Abschnitte aufteilen für mehr Kontrolle
Format wählen: MP3/192kbps für Web und Video; WAV/PCM für Nachbearbeitung in DAW; FLAC für Archivierung
Nachbearbeitung (optional): Stille kürzen, Lautstärke normalisieren (-14 LUFS für Streaming; -3 dBFS Peak-Maximum), Raumklang hinzufügen
Stimm-Design als Kommunikationsstrategie: Die Stimme ist ein Markenasset, das bewusst gewählt werden sollte. Fragen zur Orientierung: - Welche Emotion soll die Stimme transportieren? (Vertrauen, Kompetenz, Wärme, Dynamik) - Wer ist die Zielgruppe? (Technische Fachleute vs. Endkunden vs. Management) - In welchem Kontext wird die Stimme gehört? (Schulung, Marketing, Navigation, Kundenservice) - Ist Konsistenz über Monate und Jahre gewünscht? → Eine festgelegte Stimme als Markenstandard einrichten
Branchen-Anwendungen
IT-Dienstleistung & Beratung
Beratungsunternehmen nutzen TTS zunehmend für E-Learning-Inhalte und Schulungsmaterialien, die intern oder für Kunden produziert werden. Statt für jede Aktualisierung eines Erklärvideos einen Sprecher zu buchen, wird der geänderte Skriptabschnitt einfach neu generiert. Das spart erhebliche Zeit und Kosten — besonders bei Compliance-Trainings, die jährlich aktualisiert werden müssen. Für interne Wissensmanagement-Plattformen können Artikel und Dokumentationen automatisch als Audiodateien bereitgestellt werden, was den Zugang für Mobile-first-Nutzende verbessert.
Industrie & Fertigung
In der Fertigung sind Sprachausgaben für Sicherheitsanweisungen, Maschinenführung und Qualitätsprüfungs-Workflows wertvoll. Mehrsprachige Produktionsstätten profitieren besonders: Eine Sicherheitseinweisung einmal auf Deutsch erstellt, dann in 10 Sprachen per TTS übersetzt und voicert — in einem Bruchteil der Zeit und Kosten einer professionellen Studionachvertonung. ElevenLabs’ Multilingual v2 Modell liefert dabei für die meisten EU-Sprachen akzeptable bis sehr gute Qualität.
Finanzdienstleistung & Versicherung
Für Banken und Versicherungen ist TTS in zwei Bereichen besonders relevant: Erstens barrierefreie Kommunikation — Dokumente und Webseiten als Audiodateien für sehbeeinträchtigte Personen (Pflicht nach BITV 2.0 für öffentliche Stellen; Best Practice für alle). Zweitens automatisierte Kundenservice-Sprachausgaben für IVR-Systeme (Interactive Voice Response), die mit neuronaler TTS deutlich natürlicher klingen als mit klassischer Computerstimme. Datenschutzhinweis: Keine Kundendaten in TTS-Prompts eingeben, wenn Cloud-Verarbeitung genutzt wird.
Öffentliche Verwaltung
Öffentliche Einrichtungen nutzen TTS vor allem für Barrierefreiheit und mehrsprachige Bürgerkommunikation. Behördeninformationen, Formulare und Bescheide in Audioform — automatisch aus vorhandenen Textinhalten generiert — verbessern die Zugänglichkeit für Menschen mit Lesebeeinträchtigungen. Für mehrsprachige Zielgruppen (z. B. in Kommunen mit hohem Migrationsanteil) können Informationsmaterialien kostengünstig in verschiedene Sprachen übersetzt und vertont werden. Wichtig: Qualitätsprüfung durch muttersprachige Personen vor dem Einsatz; TTS-Fehler in amtlicher Kommunikation können zu Missverständnissen führen.
Übung 1 — Erklärtext vertonen mit ElevenLabs
Übung 1
Aufgabe: Vertonen Sie einen kurzen Erklärtext mit ElevenLabs und bewerten Sie das Ergebnis.
Vorgehen: 1. Registrieren Sie sich kostenlos auf elevenlabs.io (Freemium: 10.000 Zeichen/Monat) 2. Schreiben Sie einen 100–150 Wörter langen Erklärtext zu einem beruflichen Thema Ihrer Wahl 3. Wählen Sie eine passende Stimme aus der Bibliothek (Tipp: suchen Sie nach „German” oder testen Sie englische Stimmen) 4. Passen Sie Stability und Similarity an und generieren Sie den Text 5. Hören Sie das Ergebnis kritisch ab: Was klingt natürlich? Was klingt mechanisch? Was würden Sie am Skript ändern?
Reflexionsfrage: Für welche konkreten Anwendungen in Ihrer Organisation wäre TTS produktiv einsetzbar?
Zeit: 20 Minuten
Musterlösung / Leitfaden für Trainer:
Häufige Beobachtungen: Akzent bei deutschen Texten manchmal leicht englisch beeinflusst; sehr langer Sätze klingen holprig; kurze, klare Sätze klingen natürlicher. Empfehlen Sie, das Skript laut vorzulesen vor der Generierung — wenn es sich komisch anfühlt gesprochen, klingt es auch in TTS komisch.
Übung 2 — Voice Cloning Ethik-Fallanalyse
Übung 2
Aufgabe: Ordnen Sie drei Voice-Cloning-Szenarien rechtlich und ethisch ein.
Szenario A: Ein Produktmanager erstellt einen Klon seiner eigenen Stimme in ElevenLabs, um Produktdemo-Videos mit seiner Stimme zu vertonen, ohne jedes Mal selbst sprechen zu müssen. Er kennzeichnet alle Videos als KI-vertont.
Szenario B: Ein Unternehmen möchte Schulungsvideos mit der Stimme einer bekannten internen Trainerin vertonen. Die Trainerin ist damit einverstanden, hat eine schriftliche Einwilligung gegeben und erhält eine Vergütung für die Nutzung ihrer Stimme.
Szenario C: Ein Mitarbeiter erstellt unbemerkt einen Stimmklon des Geschäftsführers und versendet eine gefälschte Sprachnachricht an das Finanzteam mit der Aufforderung, eine Überweisung durchzuführen.
Diskutieren Sie: Zulässig / eingeschränkt zulässig / nicht zulässig? Begründung? Welche Straftatbestände sind in Szenario C erfüllt?
Zeit: 15 Minuten
Musterlösung / Leitfaden für Trainer:
Szenario A: Legitim und vorbildlich (eigene Stimme, Kennzeichnung). Szenario B: Legitim mit Einwilligung und fairer Vergütung. Szenario C: Strafbar (§263 Betrug, §269 Fälschung, §823 BGB Persönlichkeitsrecht, ggf. §263a Computerbetrug). Verknüpfen Sie mit UE 69 (Deepfakes): CEO-Fraud ist eine reale Bedrohung.
Prompt-Vorlage
Prompt: Text für TTS-Voiceover optimieren
Du bist ein Redakteur für gesprochene Sprache. Überarbeite den folgenden Text
so, dass er für eine Text-to-Speech-Vertonung (z. B. mit ElevenLabs) optimiert ist.
Originaltext:
[TEXT EINFÜGEN]
Optimierungsregeln:
1. Kurze, klare Sätze (max. 20 Wörter pro Satz)
2. Keine Klammern, keine Fußnoten, keine Abkürzungen
3. Zahlen und Einheiten ausschreiben (z. B. "fünfzehn Prozent" statt "15%")
4. Fremdwörter mit schwieriger Aussprache durch deutsche Entsprechungen ersetzen
oder phonetische Hinweise in eckigen Klammern ergänzen [Aussprache: ...]
5. Keine verschachtelten Nebensätze
6. Markiere natürliche Sprechpausen mit dem Tag <pause> an Satzenden oder bei
Aufzählungen
Tonalität: [professionell / freundlich / sachlich / emotional — bitte wählen]
Zielgruppe: [ZIELGRUPPE EINFÜGEN]
Ungefähre Dauer: [z. B. 60 Sekunden = ca. 130 Wörter]
Gib nur den überarbeiteten Text aus, keine Erklärungen.
Anwendung: Nutzen Sie diesen Prompt, bevor Sie Texte in ElevenLabs, OpenAI TTS oder Azure Neural TTS eingeben. Gut vorbereitete Skripte klingen deutlich natürlicher und erfordern weniger Nachbearbeitung.
Cheatsheet — UE 66
TTS-Tool-Auswahl: - Beste Qualität + Expressivität → ElevenLabs (ab $5/Mo) - API-Integration + OpenAI-Ökosystem → OpenAI TTS ($0.015–0.030/1K Zeichen) - Enterprise + Microsoft → Azure Neural TTS - Studio-Interface für Nicht-Techniker → Murf.ai
Voiceover-Workflow-Kurzanleitung: 1. Skript für gesprochene Sprache optimieren (kurze Sätze, Zahlen ausschreiben) 2. Stimme auswählen (Demo vorab anhören) 3. Parameter: Stability 50–70%, Similarity hoch 4. Probegeneration (erste 30 Sek) 5. Export als MP3/192kbps (Web) oder WAV (Nachbearbeitung)
Voice Cloning — Daumenregel: - Eigene Stimme → erlaubt - Fremde Stimme mit Einwilligung → erlaubt - Fremde Stimme ohne Einwilligung → STRAFBAR
EU AI Act Art. 50: KI-Audioinhalte mit realer Stimmimitation → Kennzeichnung Pflicht.
Reflexionsfragen
Für welche Kommunikationsaufgaben in Ihrer Praxis wäre TTS sofort einsetzbar — und was würde Sie bisher davon abhalten?
Wo ist eine menschliche Sprechstimme unverzichtbar, weil TTS an ihre Grenzen stößt?
Wie würden Sie intern kommunizieren, wenn Ihr Team Schulungsvideos künftig mit einer festen TTS-Stimme produziert — auch wenn diese Stimme KI-generiert ist?
Welche Richtlinien für Voice Cloning würden Sie in einer Unternehmens-KI-Policy festlegen?
Quellen & Weiterlesen
| Quelle | Typ | URL |
| ElevenLabs | Plattform | https://elevenlabs.io |
| OpenAI TTS Dokumentation | Offizielle Docs | https://platform.openai.com/docs/guides/text-to-speech |
| Murf.ai | Plattform | https://murf.ai |
| Azure Neural TTS | Microsoft Docs | https://learn.microsoft.com/de-de/azure/cognitive-services/speech-service/text-to-speech |
| BfDI — Orientierungshilfe Sprachassistenten | Behörde | https://www.bfdi.bund.de |
| EU AI Act — Art. 50 | Gesetzestext | https://eur-lex.europa.eu/legal-content/DE/TXT/?uri=CELEX:32024R1689 |
Quelle: KI-Wissensbasis von MindsMachines, Edition Juni 2026. Vollständige Fassung mit Anhängen und Musterlösungen: als PDF anfordern.
Zurück zur Modul-Übersicht