KI-AkademieModul 6 — Multimodalität: Bild, Audio, Video

Wissensbasis · UE 61 von 120

Bildgenerierung: Midjourney, DALL·E und Stable Diffusion

Modul 6 — Multimodalität: Bild, Audio, Video ca. 15 Min. Lesezeit

Lernziele

Sie können die drei führenden Bildgenerierungs-Plattformen (DALL·E 3, Midjourney, Stable Diffusion) anhand ihrer Kernmerkmale unterscheiden und situationsgerecht empfehlen.

Sie formulieren eigenständig einfache Text-zu-Bild-Prompts und beurteilen die erzielten Ergebnisse kritisch.

Sie ordnen die erzeugten Bilder hinsichtlich Nutzungsrechten und Datenschutzerfordernissen ein.

Sie vergleichen Cloud-basierte und lokal betriebene Generierungsmodelle und benennen die jeweiligen Vor- und Nachteile.

Auf einen Blick

MerkmalDetail
Dauer90 Minuten
NiveauEinsteiger – Fortgeschritten
MethodenInput, Tool-Demo, Einzel- und Partnerübung
MaterialienLaptop/Tablet, Internetzugang, ggf. API-Zugang
QuerverweiseUE 62 (Prompt-Technik), UE 63 (Bildbearbeitung), UE 64 (Recht)

Worum geht es?

Generative Bildmodelle haben sich in den letzten Jahren von Laborexperimenten zu produktionsreifen Werkzeugen entwickelt. Wo früher ein Grafik-Briefing, eine Agentur und mehrere Feedbackrunden nötig waren, reicht heute ein präziser Textprompt, um in Sekunden ein professionell wirkendes Motiv zu erzeugen. Diese Entwicklung verändert nicht nur kreative Berufe, sondern betrifft alle Organisationen, die Bilder für Kommunikation, Marketing, Schulungen oder Produktpräsentation einsetzen.

Gleichzeitig entstehen neue Fragen: Wem gehören die generierten Bilder? Was passiert mit den eingegebenen Daten in der Cloud? Darf ich ein KI-Bild auf einem Firmenpräsentation oder der Website verwenden? Diese Fragen lassen sich nicht pauschal beantworten – sie hängen von der gewählten Plattform, dem Tarif und dem konkreten Verwendungszweck ab.

In dieser Unterrichtseinheit lernen Sie drei grundlegend verschiedene Ansätze kennen: DALL·E 3, das tief in ChatGPT integriert ist und einen niedrigschwelligen Einstieg bietet; Midjourney, das in seiner visuellen Qualität bei vielen Anwendern als Referenz gilt; und Stable Diffusion als Open-Source-Alternative, die sowohl lokal als auch über kommerzielle Frontends genutzt werden kann. Daneben wird betrachtet Adobe Firefly, das für lizenzrechtlich sichere kommerzielle Nutzung konzipiert wurde, sowie aufstrebende Alternativen wie Ideogram und Flux.

Das Ziel ist kein vollständiger Technikvergleich, sondern ein handlungsorientiertier Überblick: Am Ende dieser Einheit wissen Sie, welches Werkzeug für welchen Zweck geeignet ist, wie Sie erste Prompts formulieren und worauf Sie rechtlich achten müssen.

Lerntext

Wie funktionieren Bildgenerierungsmodelle?

Moderne KI-Bildgeneratoren basieren überwiegend auf sogenannten Diffusionsmodellen. Das Prinzip ist zunächst kontraintuitiv: Das Modell lernt nicht, Bilder zu malen, sondern lernt, aus zufälligem Bildrauschen schrittweise ein kohärentes Bild herauszuarbeiten. Während des Trainings werden echte Bilder durch zunehmende Rauschzufügung „zerstört”, und das Modell lernt, diesen Prozess umzukehren.

Ein zweites Schlüsselelement ist CLIP (Contrastive Language–Image Pre-Training), ein Modell, das Text- und Bildinhalte in einem gemeinsamen mathematischen Raum repräsentiert. Durch CLIP „versteht” der Generator, was ein Textprompt inhaltlich bedeutet, und kann den Diffusionsprozess entsprechend steuern. Das Zusammenspiel von Diffusionsmodell und Text-Encoder ermöglicht die scheinbar magische Übersetzung von Sprache in Bilder.

Diagramm aus der KI-Wissensbasis

Abb. 61.1 — Vergleich: DALL·E 3 · Midjourney · Stable Diffusion — Ausgaben desselben Prompts nebeneinander

Merksatz

Diffusionsmodelle lernen, Rauschen in Bilder umzukehren. Ein Text-Encoder (CLIP) verbindet den Sprachprompt mit dem visuellen Raum. Qualität und Stil des Ergebnisses hängen entscheidend von den Trainingsdaten und der Modellarchitektur ab.

DALL·E 3 — Der ChatGPT-integrierte Einstieg

DALL·E 3 ist das Bildgenerierungsmodell von OpenAI und seit 2023 direkt in ChatGPT Plus und Teams integriert. Die wichtigsten Eckdaten:

Auflösung: 1024 × 1024 px (quadratisch), 1792 × 1024 px (Querformat) und 1024 × 1792 px (Hochformat)

Zugang: ChatGPT Plus/Teams/Enterprise, OpenAI API ($0.04–0.08 pro Bild)

Besonderheit: ChatGPT übersetzt unscharfe Nutzerprompts automatisch in präzisere interne Prompts — der Nutzer muss weniger Prompt-Handwerk beherrschen

Nutzungsrechte: OpenAI gewährt kommerzielle Rechte an generierten Bildern; Weiterverkauf oder Retraining ist untersagt

Datenschutz: Verarbeitung erfolgt auf OpenAI-Servern (USA); für vertrauliche Inhalte ggf. Enterprise-Kontrakt erforderlich

DALL·E 3 eignet sich besonders gut für Teams, die bereits ChatGPT verwenden und ohne Mehraufwand Bilder generieren möchten. Die Qualität ist stark, die Stärken liegen bei Text-in-Bild-Rendering und konzeptionellen Illustrationen.

Midjourney — Der visuelle Qualitätsmaßstab

Midjourney gilt unter kreativen Nutzern als Referenz für ästhetische Bildqualität. Die Plattform ist über Discord zugänglich (eigene Web-App in der Beta). Zentrale Eigenschaften:

Modellversionen: v6.1 (Stand 2026) bietet deutlich verbesserte Prompt-Folgsamkeit und realistische Details

Seitenverhältnis: --ar 16:9, --ar 1:1, --ar 4:5 etc.

Stilparameter: --style raw (weniger KI-Interpretation), --stylize (0–1000, Grad der künstlerischen Stilisierung)

Preismodell: Ab ca. 10 USD/Monat (Basic); kommerzielle Nutzung ab Standard-Plan; Stealth-Modus (verhindert öffentliche Sichtbarkeit) ab Pro-Plan

Datenschutz: Alle Bilder sind im Basic/Standard-Plan standardmäßig öffentlich; Stealth-Modus nötig für vertrauliche Inhalte

Stärken: Atmosphärische und künstlerisch hochwertige Bilder, Produktvisualisierungen, Portrait-Stilisierungen

Für professionelle Kommunikation und Marketing ist Midjourney oft die erste Wahl, wenn visuelle Qualität Priorität hat.

Stable Diffusion — Open Source und lokale Kontrolle

Stable Diffusion ist das bedeutendste Open-Source-Bildgenerierungsmodell und wird von Stability AI entwickelt. Es kann vollständig lokal auf einem eigenen Rechner (GPU erforderlich) oder über kommerzielle Plattformen betrieben werden.

Lokale Frontends: - AUTOMATIC1111: Das meistgenutzte lokale Interface, mit umfangreichem Erweiterungs-Ökosystem (ControlNet, LoRA-Training) - ComfyUI: Node-basierter Workflow-Editor für fortgeschrittene Nutzer - Forge: Optimierte AUTOMATIC1111-Variante mit besserer Performance auf Consumer-GPUs

Kommerzielle Plattformen: - Leonardo.ai: Benutzerfreundliches Interface, eigene Modell-Varianten, Freemium-Modell - DreamStudio: Offizielle Stability-AI-Plattform

Vorteile der lokalen Installation: - Keine Datenweitergabe an externe Server — datenschutzrechtlich optimal - Unbegrenzte Bildgenerierung ohne laufende Kosten (nach einmaliger Hardware-Investition) - Vollständige Anpassbarkeit: eigene LoRA-Modelle, ControlNet-Posenkontrolle, Inpainting

Nachteile: - Technischer Einrichtungsaufwand (Python, CUDA, Modelldownloads) - Hardwareanforderungen (mindestens 8 GB VRAM empfohlen) - Keine garantierten Nutzungsrechte — abhängig von den Lizenzen der genutzten Checkpoint-Modelle

Merksatz

Die Wahl zwischen DALL·E 3, Midjourney und Stable Diffusion ist keine Qualitätsfrage allein. Entscheidend sind: Datenschutzanforderungen, Nutzungsrechte, Budget, technische Kompetenz im Team und Volumen der benötigten Bilder. Für sensible Unternehmensdaten empfiehlt sich immer die lokale oder On-Premises-Variante.

Adobe Firefly und weitere Alternativen

Adobe Firefly verfolgt einen gezielt lizenzrechtlich sicheren Ansatz: Das Modell wurde ausschließlich auf Adobe Stock-Inhalten, Creative Commons-lizenzierten Materialien und gemeinfreien Werken trainiert. Adobe bietet Enterprise-Nutzern eine IP-Entschädigungsklausel, die bei Rechtsverletzungen durch generierte Inhalte greift.

Zugang: Creative Cloud-Abonnement, Freemium-Web-App unter firefly.adobe.com

Stärken: Tiefe Integration in Photoshop (Generative Fill), Illustrator, Express; konsistente Markenstilistik

Zielgruppe: Unternehmen mit bestehenden Adobe-Lizenzen und hohem rechtlichen Sicherheitsbedarf

Weitere Plattformen: - Ideogram: Besonders stark bei Text-in-Bild-Aufgaben (Typografie in generierten Bildern) - Flux (Black Forest Labs): Open-Source-Modell der nächsten Generation, oft als Stable-Diffusion-Nachfolger gehandelt; sehr hohe Bildqualität, schnell wachsendes Ökosystem

Plattformvergleich auf einen Blick

PlattformZugangPreis (ca.)KommerziellLokalStärke
DALL·E 3ChatGPT / APIAb $20/Mo (Plus)JaNeinNiedrigschwellig, Text-in-Bild
MidjourneyDiscord / WebAb $10/MoAb StandardNeinÄsthetik, Atmosphäre
Stable DiffusionLokal / Leonardo.aiGratis – $10/MoModellabhängigJaDatenschutz, Flexibilität
Adobe FireflyCreative Cloud / WebIm CC-AboJa + IP-SchutzNeinRechtssicherheit, Adobe-Integration
IdeogramWebFreemiumJaNeinTypografie in Bildern
FluxLokal / PlattformenGratis (OS)ModellabhängigJaQualität, Tempo

Vertiefung — Modell-Generationen und Qualitätsentwicklung

Die Entwicklung der Bildgenerierung verläuft in einem Tempo, das in der Softwarebranche seinesgleichen sucht. Was 2022 mit DALL·E 2 und dem ersten öffentlichen Zugang zu Stable Diffusion begann, hat sich innerhalb weniger Jahre zu einer reifen Technologie entwickelt.

Generationensprünge: Jede neue Modellgeneration bringt typischerweise drei Verbesserungen: erstens bessere Prompt-Folgsamkeit (das Modell setzt Anweisungen präziser um), zweitens höhere Bildkohärenz (weniger anatomische Fehler, konsistentere Beleuchtung) und drittens schnellere Inferenzzeiten. Midjourney v6.1 etwa zeigt gegenüber v4 deutlich weniger Finger-Anomalien und versteht komplexere Szenenkomposition.

Spezialisierte Modelle: Neben General-Purpose-Modellen entstehen zunehmend spezialisierte Varianten — etwa für Architekturvisualisierung, Produktfotografie-Stile, medizinische Illustration oder Fahrzeugdesign. Diese Spezialisierung ermöglicht es Unternehmen, konsistentere und branchenspezifisch passendere Ergebnisse zu erzielen.

LoRA-Technologie: Low-Rank Adaptation (LoRA) erlaubt das Fine-Tuning eines Basismodells mit sehr wenigen Beispielbildern (typisch: 15–50 Bilder). Unternehmen können damit eigene Markenstile, Produktdesigns oder Mitarbeiter-Avatare als reproduzierbaren Stil eintrainieren, ohne das Basismodell vollständig neu zu trainieren. Die LoRA-Modellgröße beträgt oft nur 50–150 MB, was Distribution und Versionsverwaltung vereinfacht.

Qualitätsmetrik: Was macht ein „gutes” KI-Bild aus? Professionelle Nutzer bewerten generierte Bilder nach folgenden Kriterien: (1) Prompt-Treue (wird das Gewünschte dargestellt?), (2) technische Qualität (Schärfe, Rauschfreiheit, Auflösung), (3) ästhetische Kohärenz (stimmige Beleuchtung, korrekte Perspektive, plausible Anatomie), (4) Verwendbarkeit (geeignetes Format, kein störendes Artefakt).

Ein häufiger Anfängerfehler: zu viele konkurrierende Elemente im Prompt. Das Modell versucht, alles gleichzeitig umzusetzen, was zu visueller Überfüllung führt. Profis denken in Schichten: Erst Hauptmotiv, dann Kontext, dann Stil.

Branchen-Anwendungen

IT-Dienstleistung & Beratung

IT-Dienstleister und Beratungshäuser nutzen KI-Bildgenerierung zunehmend für die interne und externe Kommunikation. Präsentationen für Kundenprojekte benötigen regelmäßig maßgeschneiderte Titelbilder, Infografik-Hintergründe oder Personas-Visualisierungen — Aufgaben, für die bislang Stock-Foto-Lizenzen oder Grafikdesign-Aufträge nötig waren. Ein typisches Szenario: Das Projektteam erstellt für ein Beratungsangebot zur digitalen Transformation ein Titelbild, das exakt die Branche und Unternehmenskultur des Kunden widerspiegelt. Mit DALL·E 3 und einem präzisen Prompt dauert das wenige Minuten. Für größere Teams mit regelmäßigem Bedarf empfiehlt sich ein gemeinsamer Midjourney-Pro-Account mit aktiviertem Stealth-Modus, um Kundendaten und strategische Visualisierungen aus dem öffentlichen Feed herauszuhalten. Adobe Firefly bietet für Unternehmen mit bestehenden Creative-Cloud-Lizenzen die rechtssicherste Lösung — gerade wenn generierte Bilder in Kundenlieferables oder auf Websites erscheinen sollen.

Industrie & Fertigung

In Industrie und Fertigung eröffnet KI-Bildgenerierung vor allem im Bereich Produktkommunikation und Schulungsunterlagen neue Möglichkeiten. Technische Illustrationen, die früher aufwendige 3D-Renderings oder Fotografien erforderten, lassen sich für interne Präsentationen und Schulungsmaterialien mit deutlich geringerem Aufwand erzeugen. Typische Anwendungen: Visualisierung von Produktvarianten für interne Reviewmeetings, Erstellung von Schulungsbildern für Sicherheitsunterweisungen (z. B. korrekte Schutzausrüstung in verschiedenen Szenarien) oder Konzeptbilder für Produktentwicklungs-Workshops. Für externe Kommunikation und Markenmaterialien gilt Vorsicht: Produktfotos müssen die tatsächlichen Spezifikationen korrekt abbilden — hier ersetzt KI-Bildgenerierung keine technische Produktfotografie, kann aber als Mockup-Vorstufe dienen. Lokal betriebene Stable-Diffusion-Instanzen bieten den Vorteil, dass sensible Produktdesign-Informationen das Unternehmensnetz nicht verlassen.

Finanzdienstleistung & Versicherung

Banken, Versicherungen und Finanzdienstleister operieren in einem regulierten Umfeld mit hohen Anforderungen an Bildkommunikation. KI-Bildgenerierung findet hier zunächst in internen Bereichen Anklang: Schulungsmaterialien für Compliance-Trainings, Präsentationsbilder für Management-Reportings oder Illustrationen für interne Newsletters. Adobe Firefly mit seiner IP-Entschädigungsklausel ist für diese Branche besonders attraktiv, da Rechtsabteilungen klare Haftungsregelungen fordern. Für nach außen gerichtete Kommunikation — Websites, Kundenbroschüren, Werbematerialien — empfehlen sich interne Review-Prozesse mit Rechts- und Compliance-Abteilung, bevor KI-generierte Bilder freigegeben werden. Personenbilder in Finanzmarketingmaterialien unterliegen zusätzlich dem Recht am eigenen Bild und müssen klar als KI-generiert gekennzeichnet sein, wenn sie realistisch wirkende Personen darstellen.

Öffentliche Verwaltung

Behörden und öffentliche Einrichtungen können KI-Bildgenerierung für Bürgerkommunikation, Schulungsmaterialien und interne Präsentationen nutzen — mit besonderen Anforderungen an Neutralität, Barrierefreiheit und Datenschutz. Sinnvolle Einsatzgebiete umfassen illustrative Bilder für Informationsmaterialien (z. B. Erklärungen zu Verwaltungsverfahren), Lernbilder für digitale Schulungsplattformen oder Konzeptdarstellungen für strategische Planungsdokumente. Wichtig: Die öffentliche Hand steht unter erhöhtem Transparenzgebot. KI-generierte Bilder sollten in offiziellen Publikationen klar als solche gekennzeichnet sein, auch wo dies rechtlich noch nicht zwingend vorgeschrieben ist. Für personenbezogene Szenen (z. B. Bilder von Bürger-Service-Situationen) gilt besondere Sorgfalt: keine erkennbar realen Personen ohne explizite Kennzeichnung. Lokal betriebene Lösungen bieten den höchsten Datenschutzstandard und sind für datensensible Anwendungen vorzuziehen.

Übung 1 — Plattformvergleich: Dasselbe Motiv, drei Werkzeuge

Übung 1

Aufgabe: Generieren Sie dasselbe Motiv auf zwei unterschiedlichen Plattformen (z. B. DALL·E 3 über ChatGPT und Midjourney oder Leonardo.ai) und vergleichen Sie die Ergebnisse.

Prompt-Vorschlag: „A professional office meeting room with natural light, modern furniture, four people collaborating around a table, photorealistic, 16:9”

Vorgehen: 1. Geben Sie den Prompt unverändert auf Plattform A ein. 2. Verwenden Sie denselben Prompt auf Plattform B. 3. Notieren Sie: Stil, Qualität, Prompt-Treue, Auffälligkeiten. 4. Diskutieren Sie in Zweiergruppen: Welche Plattform würden Sie für welchen Zweck wählen?

Zeit: 20 Minuten (inkl. Diskussion)

Musterlösung / Leitfaden für Trainer:

Typische Beobachtungen der Teilnehmenden: - DALL·E 3 folgt dem Prompt sehr präzise, das Bild wirkt oft „sauber” aber weniger atmosphärisch - Midjourney erzeugt visuell eindrucksvollere Bilder, weicht aber manchmal vom genauen Prompt ab (z. B. andere Personenzahl) - Qualitätsunterschiede sind oft subtil und kontextabhängig — „besser” ist relativ

Wichtige Diskussionspunkte: Nutzungsrechte der jeweiligen Plattform im konkreten Nutzungskontext; Datenschutz bei Verwendung von Firmeninformationen im Prompt; Reproduzierbarkeit (derselbe Prompt erzeugt nicht dasselbe Bild).

Übung 2 — Persona visualisieren

Übung 2

Aufgabe: Erstellen Sie eine visuelle Persona für ein fiktives Kundenprojekt Ihrer Wahl.

Vorgehen: 1. Definieren Sie eine Persona: Rolle, Alter, Branche, Kontext (2–3 Sätze). 2. Formulieren Sie einen Bildprompt, der diese Persona als Porträt darstellt. 3. Generieren Sie das Bild (DALL·E 3 oder Midjourney empfohlen). 4. Bewerten Sie: Trifft das Bild die gewünschte Wirkung? Was würden Sie am Prompt ändern?

Wichtiger Hinweis: Verwenden Sie ausschließlich generierte Personen, keine realen Personen. Halten Sie in Ihrer Notiz fest, auf welcher Plattform das Bild erstellt wurde und welche Nutzungsrechte gelten.

Zeit: 15 Minuten

Musterlösung / Leitfaden für Trainer:

Besprechen Sie nach der Übung: Wozu dienen visuelle Personas in der Kommunikation? Warum ist die Plattformwahl bei Bildern, die in Kundenpräsentationen erscheinen, rechtlich relevant? Verweisen Sie auf UE 64 (Rechtliche Aspekte) für die vertiefte Behandlung der Nutzungsrechte.

Prompt-Vorlage

Prompt: Produktfoto für Webshop beschreiben (JSON-Ausgabe)

Du bist ein erfahrener E-Commerce-Redakteur. Beschreibe das folgende Produktfoto in maschinell-strukturiertem JSON für einen Webshop.



Produkt: [PRODUKTNAME]

Abgebildete Eigenschaften: Farbe, Material, Form, Besonderheiten, Stimmung des Bildes



Ausgabeformat:

{

"produktname": "...",

"hauptfarbe": "...",

"material_sichtbar": "...",

"bildkomposition": "...",

"hintergrund": "...",

"zielgruppe_impression": "...",

"alt_text_seo": "...",

"schlagwoerter": ["...", "...", "..."]

}



Sprache: Deutsch. Keine Floskeln. Präzise Beschreibungen.

Anwendung: Laden Sie ein Produktbild hoch (ChatGPT 4o, Claude 3.5 Sonnet oder Gemini Pro) und verwenden Sie diesen Prompt. Die JSON-Ausgabe kann direkt in Produktdatenbanken oder PIM-Systeme übernommen werden.

Cheatsheet — UE 61

Plattform-Kurzentscheid: - Schnell + integriert in ChatGPT → DALL·E 3 - Höchste visuelle Qualität, Kreativprojekte → Midjourney (ab Standard-Plan für kommerzielle Nutzung) - Datenschutz + lokale Kontrolle → Stable Diffusion lokal (AUTOMATIC1111 / ComfyUI) - Rechtssicher + Adobe-Ökosystem → Adobe Firefly - Text in Bild gefragt → Ideogram

Datenschutz-Daumenregel: Cloud = Daten verlassen die Organisation. Keine vertraulichen Inhalte in Prompts bei kostenlosen/Standard-Tarifen.

Nutzungsrechte: Immer Nutzungsbedingungen der Plattform prüfen — Tarifabhängig. Kostenpflichtige Pläne erlauben meist kommerzielle Nutzung, kostenlose oft nicht.

Promptlänge: Weniger ist oft mehr. Zuerst Hauptmotiv, dann Kontext, dann Stilangaben.

Reflexionsfragen

In welchem Kontext Ihrer täglichen Arbeit könnten Sie KI-generierte Bilder sinnvoll einsetzen — und in welchem explizit nicht?

Was spricht in Ihrem Organisationskontext für Cloud-Plattformen, was für eine lokale Lösung?

Wie würden Sie Kolleginnen und Kollegen erklären, warum „kostenlose” KI-Bildtools nicht immer die günstigste Wahl sind?

Welche internen Freigabeprozesse bräuchte es, bevor ein KI-generiertes Bild in einer externen Publikation erscheint?

Quellen & Weiterlesen

QuelleTypURL
OpenAI DALL·E DokumentationOffizielle Docshttps://platform.openai.com/docs/guides/images
Midjourney DokumentationOffizielle Docshttps://docs.midjourney.com
Leonardo.aiPlattformhttps://leonardo.ai
Adobe FireflyPlattformhttps://www.adobe.com/de/products/firefly.html
Hugging Face – Stability AI ModelleRepositoryhttps://huggingface.co/stabilityai
IdeogramPlattformhttps://ideogram.ai
Black Forest Labs (Flux)Forschung/Modellhttps://blackforestlabs.ai

Quelle: KI-Wissensbasis von MindsMachines, Edition Juni 2026. Vollständige Fassung mit Anhängen und Musterlösungen: als PDF anfordern.

Zurück zur Modul-Übersicht

Nächster Schritt

Vom Selbststudium zur Schulung im Team.

Diese Einheit stammt aus unserer Wissensbasis mit 120 Unterrichtseinheiten. Als KI-Schulung vermitteln wir die Inhalte praxisnah an Ihren eigenen Use Cases, EU-AI-Act-konform dokumentiert.

Die Plattform

OneMachine: Ihre KI, in Ihrem System.

Produktive KI, die sicher in Ihrer Organisation läuft: mit eigenen Daten, Rechten und Freigaben. Aus echter Projektpraxis zum lizenzierbaren Produkt verdichtet.

OneMachine ansehen