Diffusionsmodelle lernen, künstlich hinzugefügtes Rauschen schrittweise wieder zu entfernen. Bei der Generierung wird dieser Prozess genutzt, um aus einem zufälligen Ausgangszustand ein zur Eingabe passendes Bild entstehen zu lassen.
Grundprinzip
Im Training werden Bilder stufenweise verrauscht. Das Modell lernt den umgekehrten Weg: Es schätzt, wie sich Rauschen entfernen lässt, ohne die semantische Struktur zu verlieren.
Latenter Raum
Viele Systeme arbeiten nicht direkt mit jedem einzelnen Pixel, sondern mit einer komprimierten Bildrepräsentation. Das reduziert Rechenaufwand und erleichtert die Steuerung durch Text.
Steuerungsmöglichkeiten
- Textkonditionierung
- Referenzbilder
- Masken und Inpainting
- Struktur- oder Tiefenvorgaben
- mehrere Generations- und Auswahlrunden
Grenzen
Der genaue Entstehungsweg ist stochastisch. Derselbe Prompt kann mehrere unterschiedliche Ergebnisse liefern. Reproduzierbarkeit erfordert feste Parameter, Referenzen und dokumentierte Einstellungen.
Quellen und Prüfstand
- Denoising Diffusion Probabilistic Models
- High-Resolution Image Synthesis with Latent Diffusion Models
Prüfstand: 28.07.2026. Produktfunktionen, Nutzungsbedingungen und Rechte können sich ändern und müssen vor einer Veröffentlichung beim jeweiligen Anbieter geprüft werden.