Technologiegeschichte der Bildgenerierung — Kurzüberblick für Trainer
Um Teilnehmenden einen zeitlichen Kontext zu geben, ist folgendes Hintergrundwissen nützlich. Die KI-Bildgenerierung hat sich in erstaunlich kurzer Zeit entwickelt:
2014 — Generative Adversarial Networks (GANs): Ian Goodfellow und Kollegen publizierten das GAN-Konzept: Zwei neuronale Netzwerke (Generator und Diskriminator) trainieren sich gegenseitig. Der Generator produziert Bilder, der Diskriminator versucht echte von gefälschten zu unterscheiden. Die Qualität stieg von anfänglich verrauschten MNIST-Ziffern bis zu realistischen Gesichtern (StyleGAN 2019).
2021 — CLIP von OpenAI: CLIP verband Text und Bild in einem gemeinsamen Lernraum. Mit CLIP konnte ein Text-Prompt direkt in einen „Bildraum-Punkt” übersetzt werden — der Grundstein für Text-zu-Bild-Generierung.
2022 — Das Durchbruchjahr: Drei Ereignisse veränderten alles: - Januar: DALL·E 2 von OpenAI (noch nicht öffentlich zugänglich) - April: Midjourney Beta-Zugang (öffentlich auf Discord) - August: Stable Diffusion 1.4 (Open Source, sofort öffentlich downloadbar) Innerhalb weniger Monate konnte jeder mit Internet-Zugang Bilder mit Text-Prompts erzeugen.
2023–2024 — Qualitätssprung und Kommerzialisierung: - DALL·E 3 in ChatGPT integriert (niedrigschwelligster Einstieg) - Midjourney v5/v6 mit dramatisch verbesserter Qualität - Adobe Firefly mit lizenzrechtlichem Ansatz - Flux als Open-Source-Alternative der nächsten Generation
Was Teilnehmende verstehen sollten: Diese Entwicklung ist keine lineare Verbesserung — sie ist ein Paradigmenwechsel. Was vor fünf Jahren Science Fiction war, ist heute Werkzeug. Und was heute beeindruckend aussieht, wird in zwei Jahren Standard sein.
Häufige Missverständnisse und wie Trainer sie adressieren
Missverständnis 1: „KI versteht, was ich meine” KI-Bildgeneratoren „verstehen” keine Bedeutung im menschlichen Sinne. Sie statistisch interpolieren zwischen erlernten Mustern. Der Satz „ein Mann, der glücklich ist, weil er seinen Bruder lange nicht gesehen hat” überfordert das System, weil es keine Beziehungslogik kennt — es kennt nur visuelle Muster zu Wörtern wie „Mann”, „glücklich”, „Begegnung”.
Missverständnis 2: „KI-Bilder sind immer urheberrechtsfrei” Urheberrechtsfrei ≠ ohne Einschränkungen. KI-Bilder sind nicht durch das Urheberrecht des Nutzers geschützt, aber die Nutzungsrechte werden durch die Plattform-AGB geregelt. Auf dem falschen Tarif = keine kommerzielle Nutzung erlaubt, auch wenn das Bild „urheberrechtsfrei” erscheint.
Missverständnis 3: „Lokal bedeutet gratis” Lokale KI-Modelle sind im laufenden Betrieb gratis — aber die Hardware kostet (RTX 4070: ~400–500 EUR), die Einrichtungszeit kostet und Updates und Modell-Downloads erfordern regelmäßige Wartung. Für Low-Volume-Nutzer kann Cloud günstiger sein als lokal.
Missverständnis 4: „Das Bild ist dann meins” Im Sinne des Urheberrechts: Nein. Im Sinne vertraglicher Nutzungsrechte: Je nach Plattform und Tarif ja. Der Unterschied ist praktisch bedeutsam: Urheberrechte können vererbt und über Jahrzehnte geltend gemacht werden; vertragliche Nutzungsrechte enden, wenn die AGB sich ändern oder das Abo gekündigt wird.
Vertiefende Tabelle — Plattform-Detailvergleich 2026
Für Teilnehmende mit fortgeschrittenem Interesse bietet diese erweiterte Vergleichstabelle mehr Detailtiefe:
| Kriterium | DALL·E 3 | Midjourney v6.1 | SD / Flux lokal | Adobe Firefly | Ideogram 2.0 |
| Auflösung max. | 1792×1024 px | 2048px (Upscale: 4x) | Unbegrenzt (VRAM) | 3072×3072 px | 2048×2048 px |
| Aspekt-Kontrolle | 3 Optionen | Frei (–ar) | Frei (VAE) | Mehrere | Frei |
| Prompt-Sprache | Deutsch OK | Englisch besser | Englisch besser | Englisch besser | Englisch besser |
| Bildkonsistenz | Mittel | Hoch (–cref) | Sehr hoch (LoRA) | Mittel | Mittel |
| Text im Bild | Gut | Mittel | Schlecht | Sehr gut | Sehr gut |
| Produktfoto | Gut | Sehr gut | Sehr gut | Sehr gut | Gut |
| Portrait | Gut | Exzellent | Sehr gut | Gut | Gut |
| Abstrakt/Illustration | Gut | Sehr gut | Exzellent | Gut | Gut |
| Video-Integration | Sora (separat) | Nein | AnimateDiff | Nein | Nein |
| API verfügbar? | Ja | Ja (Beta) | Ja (A1111 API) | Ja | Ja |
| EU-Daten-Hosting | Nein (OpenAI US) | Nein (US) | Lokal: Ja | Nein (US/EU gemischt) | Nein |
Hinweis für Trainer: Diese Tabelle veraltet schnell. Empfehlen Sie Teilnehmenden, für aktuelle Vergleiche aitools.fyi oder futuretools.io zu konsultieren.
Quelle: KI-Wissensbasis von MindsMachines, Edition Juni 2026. Vollständige Fassung als PDF anfordern.