modul nr 13

AI som gör bilder

En bildmodell målar inte. Den börjar med brus och tar bort lite i taget, tills det som finns kvar passar texten.

Agenter och säkerhet

Laddar modulen …

Efteråt vet du
Hur en bildmodell går från brus till bild steg för steg, varför de stora formerna kommer först, och varför samma text ger olika bilder.
Du provar själv
Välj text och startbrus och dra i stegen från brus till färdig bild.

En bildmodell målar inte som en människa. Den börjar med brus, alltså slumpade prickar i alla färger, och en text som säger vad bilden ska visa. I varje steg gissar modellen vilket brus som inte passar texten och tar bort en del av det. Efter tjugo till femtio steg finns en bild kvar. Det kallas en diffusionsmodell.

De stora formerna kommer först: var himlen är, var marken är, var det ljusa och mörka ligger. Detaljerna kommer sist. Texten styr vad modellen letar fram, och startbruset avgör resten. Därför ger samma text en ny bild varje gång, om du inte återanvänder samma startbrus.

Modellen har lärt sig genom att se miljontals bilder med beskrivningar. Under träningen lades brus på bilderna, och modellen övade på att gissa vilket brus som lagts till.

Filmen visar

  • Hur en bild växer fram ur brus, steg för steg.
  • Varför de stora formerna syns före detaljerna.
  • Hur texten och startbruset påverkar vilken bild det blir.
  • Hur träningen går åt andra hållet: från bild till brus.

Du provar själv

Välj text och startbrus och dra i stegen. Se vad som syns först, och vad som ändras med ett nytt startbrus.

Vad vi förenklar här

  • I modulen finns bilden redan gömd i koden och visas fram. En riktig modell har ingen färdig bild, utan gissar i varje steg vilket brus som ska bort utifrån det den lärt sig.
  • Bilden är 48 × 36 pixlar och vi tar 20 steg. Riktiga modeller gör bilder med miljontals pixlar, och arbetar ofta på en mindre, komprimerad version av bilden.
  • Att det grova kommer först visar vi med oskärpa. I riktiga modeller blir det så av sig självt, för brus döljer detaljerna innan det döljer de stora formerna.
  • Bilderna en modell gör speglar bilderna den tränats på, med deras brister och upphovsrätt.

Testa dig själv

4 frågor. Två om grunderna, en där du använder det du lärt dig och en där du förutsäger vad som händer.

  1. Fråga 1 av 4 · FörståVad börjar en bildmodell som Stable Diffusion med?
  2. Fråga 2 av 4 · FörståHur har modellen lärt sig att ta bort brus?
  3. Fråga 3 av 4 · AnvändDu har fått en bild du gillar och vill göra en nästan likadan med en liten ändring i texten. Vad hjälper?
  4. Fråga 4 av 4 · FörutsägDu stoppar modellen halvvägs, efter 10 av 20 steg. Hur ser bilden ut?

Nästa: Datorseende →