DALL-E
DALL-E er OpenAIs generative AI-model til tekst-til-billede-generering, som omdanner en skriftlig beskrivelse til et nyt, computergenereret billede. Modellen er integreret direkte i ChatGPT, hvor man skriver sin billedbeskrivelse i en almindelig samtale i stedet for at bruge et separat program. Navnet er en sammensmeltning af den surrealistiske maler Salvador Dalí og Pixar-figuren WALL-E, hvilket antyder den kreative og til tider drømmeagtige stil i modellens output.
Skriver man for eksempel en prompt som “en astronaut der rider på en hest, malet i akvarelstil” ind i ChatGPT, tolker DALL-E teksten og genererer et helt nyt billede, der matcher beskrivelsen, uden at billedet har eksisteret nogen steder i forvejen. Det gør DALL-E til et konkret eksempel på tekst-til-billede AI som teknologi — men hvor det generelle begreb dækker over hele kategorien af systemer, der oversætter tekst til billeder, er DALL-E OpenAIs specifikke produkt inden for netop denne kategori.
DALL-E som eksempel på tekst-til-billede AI
Tekst-til-billede AI er en overordnet betegnelse for enhver AI-model, der kan generere billeder ud fra en tekstbeskrivelse. DALL-E er én implementering af denne teknologi, ligesom Midjourney er en anden. Forskellen mellem det generelle begreb og DALL-E som produkt ligger primært i, hvor og hvordan modellen bruges: DALL-E er bygget ind i ChatGPT og trækker på den samme sprogforståelse som chatbotten, mens andre tekst-til-billede-værktøjer ofte kører som selvstændige platforme med deres egen brugerflade. DALL-E hører desuden til den bredere kategori af generativ AI, altså AI-systemer der skaber nyt indhold frem for blot at analysere eksisterende data.
Fra DALL-E 1 til DALL-E 3 – kort historik
Den første udgave af DALL-E blev præsenteret som en forskningspræview og byggede på en transformer-arkitektur, hvor billeder blev behandlet som en sekvens af tokens på samme måde som tekst i en sprogmodel. Den efterfølgende udgave, DALL-E 2, skiftede til en diffusionsbaseret tilgang, hvor modellen starter med tilfældig støj og gradvist forfiner den hen imod et billede, der passer til prompten. Denne metode gav generelt skarpere og mere detaljerede resultater. Et vigtigt element i udviklingen var også CLIP, en model fra OpenAI der lærer sammenhænge mellem billeder og tekstbeskrivelser, og som blev brugt til at vurdere hvor godt et genereret billede matchede den oprindelige prompt. Med DALL-E 3 blev modellen tættere koblet til GPT-arkitekturen, hvilket forbedrede evnen til at følge komplekse, flerleddede beskrivelser.
DALL-E integreret i ChatGPT
Den tætte kobling til ChatGPT er det, der adskiller DALL-E mest tydeligt fra mange andre billedgeneratorer. I stedet for at skulle formulere en teknisk optimeret prompt kan man beskrive et billede i almindeligt sprog og bede om justeringer undervejs, for eksempel en ændret farve, en anden vinkel eller et nyt element i billedet. Fordi samtalen foregår i samme grænseflade som resten af ChatGPT, kan modellen i mange tilfælde trække på kontekst fra tidligere i dialogen. OpenAI har løbende videreudviklet sine billedmodeller, og nyere, mere integrerede multimodale modeller har efterhånden overtaget en del af den billedgenerering, der tidligere lå hos DALL-E 3 i ChatGPT — men princippet om at generere billeder direkte i en samtale stammer fra DALL-E-integrationen.
Styrker og begrænsninger
DALL-E har generelt vist sig stærk til at forstå naturligt sprog, kombinere umulige eller usædvanlige begreber og redigere billeder gennem en løbende samtale frem for at skulle starte forfra. Modellen har desuden indbyggede filtre, der begrænser generering af visse typer indhold. Samtidig har især de tidlige versioner haft svært ved detaljer som hænder, fingre og præcis tekst inde i billeder, hvor bogstaver kan fremstå forvrængede eller stavet forkert. Sådanne unøjagtigheder er ikke unikke for DALL-E, men går igen i flere modeller inden for tekst-til-billede AI generelt, og de er blevet gradvist reduceret med nyere modelversioner.
DALL-E sammenlignet med andre billedgeneratorer
Sammenlignet med Midjourney, der ofte fremhæves for sit stærke, kunstneriske udtryk, lægger DALL-E typisk mere vægt på tilgængelighed og nem betjening via ChatGPT-samtalen. Midjourney kører traditionelt via en separat platform og kræver mere øvelse i at formulere prompter for at opnå et bestemt visuelt udtryk, mens DALL-E er designet til at fungere godt selv med almindelige, hverdagsagtige beskrivelser. Valget mellem de to afhænger derfor typisk af, om man prioriterer et bestemt kunstnerisk resultat eller en hurtig, samtalebaseret arbejdsgang.