Vom digitalen Rauschen zum Meisterwerk: Wie Computer lernen, zu malen.
Kurz & bündig
Das Prinzip „Wolkenraten“ (Diffusion)
Um ein verbreitetes Verfahren moderner Bild-KIs zu verstehen, stell dir vor, du liegst im Gras und schaust in den Himmel.
Du siehst eine Wolke. Mit etwas Fantasie erkennst du darin einen Hasen. Du sagst zu einem Freund: „Schau mal, da ist ein Ohr, und da die Nase.“ Je länger ihr draufschaut und die Wolke sich verändert, desto klarer wird der Hase für euch.
Das Wolkenraten ist ein Vergleich für Diffusion (Zerstreuung). Dabei findet die KI keinen schon versteckten Hasen, sondern erzeugt Bildstrukturen mit gelernten Mustern. Es gibt auch andere Verfahren für Bild-KIs.
1. Das Training (Lernen): Vereinfacht gesagt wird ein klares Foto (z.B. ein Hund) mit unterschiedlich starkem digitalen Rauschen überlagert. Die KI übt, dieses Rauschen zu verringern. Bei manchen Verfahren geschieht das in einer komprimierten Darstellung des Bildes. Das graue „Schneegestöber“ ist dafür ein anschaulicher Vergleich.2. Das Generieren (Malen): Wenn du einem solchen Diffusionsmodell sagst „Male einen Hund“, kann die Bilderzeugung mit zufälligem Rauschen beginnen. Mit den im Training gelernten Mustern und deiner Vorgabe verändert es die Darstellung Schritt für Schritt, bis ein Hundebild entsteht. Bildbearbeitung mit einer Vorlage kann anders starten.

Die Grafik veranschaulicht Diffusion. Der Hase ist nicht schon im Rauschen versteckt: Das Modell erzeugt die Strukturen mithilfe gelernter Muster. Nicht jede Bild-KI arbeitet nach diesem Verfahren.
Der Pinsel ist deine Sprache (Prompting)
Mit Worten kannst du der KI beschreiben, welches Bild sie erzeugen soll. Das nennt man Prompting. Viele Systeme können zusätzlich Bilder als Vorlage verarbeiten.
Es ist wie bei einem Phantombild-Zeichner bei der Polizei: Eine genaue Beschreibung („männlich, narbiges Gesicht, Hut, düstere Stimmung“) kann helfen, deine Vorstellung zu treffen. Eine Garantie ist das nicht. Sagst du nur „Mann“, bleiben viele Einzelheiten dem Modell überlassen.
Die Gefahr: Deepfakes und Illusionen
KI-generierte und KI-bearbeitete Bilder können täuschend echt wirken. So kann ein Bild den Papst in einer Daunenjacke oder die angebliche Verhaftung eines Politikers zeigen, ohne dass die dargestellte Szene stattgefunden hat.
Manche Fälschungen lassen sich an unpassenden Übergängen oder anderen Bildfehlern erkennen – auch KI-Bilder. Solche „Nähte“ waren aber nie ein zuverlässiger Test für alle Photoshop-Bearbeitungen, und fehlende Bildfehler beweisen keine Echtheit. Wir müssen lernen, Bildern nicht mehr blind zu vertrauen.
Auch wenn die Bilder perfekt wirken, können Details falsch sein. Welche Fehler auftreten, hängt vom Modell und der Aufgabe ab:
- Hände: Eine Hand kann beispielsweise 6 Finger haben. Solche Darstellungsfehler sind möglich, aber kein verlässliches Erkennungszeichen für jedes KI-Bild.
- Schrift: Text auf Schildern kann fehlerhaft oder unleserlich sein. Neuere Modelle erzeugen auch gut lesbare Schrift; genau hinzusehen bleibt sinnvoll.
- Physik: Schatten fallen manchmal in die falsche Richtung.

Der Roboterarm ist ein Symbolbild. Diffusionsmodelle setzen nicht einen Pixel nach dem anderen: Sie verändern viele Bildwerte gemeinsam, häufig in einer komprimierten Darstellung. Dass ein Bild neu berechnet wird, schließt die Wiedergabe eines Trainingsbildes nicht sicher aus.
Fazit: Eine neue Ära der Kreativität (und Skepsis)
Diese Technologie ist ein mächtiges Werkzeug. Menschen, die nicht zeichnen können, können plötzlich ihre Ideen visualisieren. Architekten können damit schnell Bildideen für neue Häuser entwerfen. Das ersetzt keine geprüfte Bauplanung.
Doch für uns als Betrachter gilt: Ein echt wirkendes Bild allein beweist nicht, dass die gezeigte Szene stattgefunden hat. Wir müssen lernen, den Kontext zu prüfen (Wer sendet das Bild?), statt nur dem Auge zu trauen.
Glossar: Bild-KI verstehen
| Begriff | Erklärung |
|---|---|
| Diffusion Model | Ein verbreitetes Verfahren für Bild-KIs. Es erzeugt Bilder durch schrittweises Verringern von Rauschen, teils in einer komprimierten Bilddarstellung. |
| Text-to-Image | „Vom Text zum Bild“. Systeme, die geschriebene Beschreibungen in visuelle Grafiken umwandeln. |
| Deepfake | Mit KI erzeugte oder veränderte Bilder, Videos oder Tonaufnahmen, die täuschend echt wirken und zum Beispiel eine reale Person etwas tun oder sagen lassen, das sie nie getan oder gesagt hat. |
| Midjourney / DALL-E | Bekannte Namen aus der KI-Bilderzeugung. Midjourney ist weiterhin ein Bilddienst. DALL-E ist eine ältere Modellreihe von OpenAI. OpenAI kündigte an, den offiziellen DALL-E-GPT in ChatGPT am 30. August 2026 einzustellen, und verwies als Alternative auf ChatGPT Images. |

Kommentar