Stable Diffusion is een open-source tekst-naar-beeld model dat gebruikmaakt van deep learning om gedetailleerde afbeeldingen te genereren op basis van tekstuele prompts. Het model zet natuurlijke taal om in visuele representaties door patronen uit enorme hoeveelheden trainingsdata te combineren.
Technische werking
- Tekstverwerking: Een encoder zet de tekstprompt om in een numerieke vector die het model kan begrijpen.
- Ruis toevoegen: Het model begint met een afbeelding die volledig uit willekeurige pixels (ruis) bestaat.
- Iteratieve verwijdering: Via een latent diffusion model voorspelt het systeem welke ruis weggehaald moet worden om de gewenste vorm te benaderen.
- Upscaling: De resulterende weergave in de latent space wordt door een decoder omgezet naar een zichtbare afbeelding met hoge resolutie.
Belangrijke begrippen
- Model weights: De opgeslagen parameters die bepalen hoe het model reageert op specifieke woorden.
- Prompt: De tekstuele instructie die beschrijft wat er op de afbeelding moet verschijnen.
- Checkpoint: Een specifiek bestand met getrainde gewichten dat een bepaalde stijl of onderwerp benadrukt.
- Negative prompt: Een lijst met elementen die expliciet niet in de afbeelding mogen voorkomen.


