Hop til indhold
Kunstig intelligens og data

DALL-E

DALL-E er OpenAIs generative AI-model til tekst-til-billede-generering, som omdanner en skriftlig beskrivelse til et nyt, computergenereret billede. Modellen er integreret direkte i ChatGPT, hvor man skriver sin billedbeskrivelse i en almindelig samtale i stedet for at bruge et separat program. Navnet er en sammensmeltning af den surrealistiske maler Salvador Dalí og Pixar-figuren WALL-E, hvilket antyder den kreative og til tider drømmeagtige stil i modellens output.

Skriver man for eksempel en prompt som “en astronaut der rider på en hest, malet i akvarelstil” ind i ChatGPT, tolker DALL-E teksten og genererer et helt nyt billede, der matcher beskrivelsen, uden at billedet har eksisteret nogen steder i forvejen. Det gør DALL-E til et konkret eksempel på tekst-til-billede AI som teknologi — men hvor det generelle begreb dækker over hele kategorien af systemer, der oversætter tekst til billeder, er DALL-E OpenAIs specifikke produkt inden for netop denne kategori.

DALL-E som eksempel på tekst-til-billede AI

Tekst-til-billede AI er en overordnet betegnelse for enhver AI-model, der kan generere billeder ud fra en tekstbeskrivelse. DALL-E er én implementering af denne teknologi, ligesom Midjourney er en anden. Forskellen mellem det generelle begreb og DALL-E som produkt ligger primært i, hvor og hvordan modellen bruges: DALL-E er bygget ind i ChatGPT og trækker på den samme sprogforståelse som chatbotten, mens andre tekst-til-billede-værktøjer ofte kører som selvstændige platforme med deres egen brugerflade. DALL-E hører desuden til den bredere kategori af generativ AI, altså AI-systemer der skaber nyt indhold frem for blot at analysere eksisterende data.

Fra DALL-E 1 til DALL-E 3 – kort historik

Den første udgave af DALL-E blev præsenteret som en forskningspræview og byggede på en transformer-arkitektur, hvor billeder blev behandlet som en sekvens af tokens på samme måde som tekst i en sprogmodel. Den efterfølgende udgave, DALL-E 2, skiftede til en diffusionsbaseret tilgang, hvor modellen starter med tilfældig støj og gradvist forfiner den hen imod et billede, der passer til prompten. Denne metode gav generelt skarpere og mere detaljerede resultater. Et vigtigt element i udviklingen var også CLIP, en model fra OpenAI der lærer sammenhænge mellem billeder og tekstbeskrivelser, og som blev brugt til at vurdere hvor godt et genereret billede matchede den oprindelige prompt. Med DALL-E 3 blev modellen tættere koblet til GPT-arkitekturen, hvilket forbedrede evnen til at følge komplekse, flerleddede beskrivelser.

DALL-E integreret i ChatGPT

Den tætte kobling til ChatGPT er det, der adskiller DALL-E mest tydeligt fra mange andre billedgeneratorer. I stedet for at skulle formulere en teknisk optimeret prompt kan man beskrive et billede i almindeligt sprog og bede om justeringer undervejs, for eksempel en ændret farve, en anden vinkel eller et nyt element i billedet. Fordi samtalen foregår i samme grænseflade som resten af ChatGPT, kan modellen i mange tilfælde trække på kontekst fra tidligere i dialogen. OpenAI har løbende videreudviklet sine billedmodeller, og nyere, mere integrerede multimodale modeller har efterhånden overtaget en del af den billedgenerering, der tidligere lå hos DALL-E 3 i ChatGPT — men princippet om at generere billeder direkte i en samtale stammer fra DALL-E-integrationen.

Styrker og begrænsninger

DALL-E har generelt vist sig stærk til at forstå naturligt sprog, kombinere umulige eller usædvanlige begreber og redigere billeder gennem en løbende samtale frem for at skulle starte forfra. Modellen har desuden indbyggede filtre, der begrænser generering af visse typer indhold. Samtidig har især de tidlige versioner haft svært ved detaljer som hænder, fingre og præcis tekst inde i billeder, hvor bogstaver kan fremstå forvrængede eller stavet forkert. Sådanne unøjagtigheder er ikke unikke for DALL-E, men går igen i flere modeller inden for tekst-til-billede AI generelt, og de er blevet gradvist reduceret med nyere modelversioner.

DALL-E sammenlignet med andre billedgeneratorer

Sammenlignet med Midjourney, der ofte fremhæves for sit stærke, kunstneriske udtryk, lægger DALL-E typisk mere vægt på tilgængelighed og nem betjening via ChatGPT-samtalen. Midjourney kører traditionelt via en separat platform og kræver mere øvelse i at formulere prompter for at opnå et bestemt visuelt udtryk, mens DALL-E er designet til at fungere godt selv med almindelige, hverdagsagtige beskrivelser. Valget mellem de to afhænger derfor typisk af, om man prioriterer et bestemt kunstnerisk resultat eller en hurtig, samtalebaseret arbejdsgang.

Eksempel
En bruger skriver i ChatGPT: "Lav et billede af en rødhåret kat, der spiller violin, i stil med et akvarelmaleri" — og DALL-E genererer et unikt billede ud fra beskrivelsen.
Ofte stillede spørgsmål
Hvornår blev DALL-E lanceret første gang?
Den første version af DALL-E blev offentliggjort som en forskningspræview i januar 2021 og kunne generere billeder ud fra korte tekstbeskrivelser.
Hvad betyder navnet DALL-E?
Navnet er en sammensmeltning af maleren Salvador Dalís efternavn og Pixar-figuren WALL-E, hvilket hentyder til modellens kreative og til tider surrealistiske billedstil.
Er DALL-E i ChatGPT gratis at bruge?
Adgangen afhænger af abonnement: den gratis udgave af ChatGPT tilbyder typisk et begrænset antal billedgenereringer, mens betalte abonnementer giver flere. Udviklere kan også tilgå billedgenerering via OpenAIs API mod betaling pr. billede.
Hvordan adskiller DALL-E sig fra Midjourney?
DALL-E er tæt integreret i ChatGPT og fungerer via almindelige samtaler, mens Midjourney kører som en mere selvstændig platform, der ofte kræver mere prompt-øvelse for at opnå et bestemt kunstnerisk udtryk.
Kan DALL-E redigere et billede, den allerede har genereret?
Ja, i ChatGPT kan man bede om justeringer af et allerede genereret billede, for eksempel ændre farver, tilføje elementer eller skifte stil, uden at skulle skrive en helt ny prompt fra bunden.
Vil du se hvordan DALL-Es tætte ChatGPT-integration adskiller sig fra en mere kunstnerisk, standalone tilgang til AI-billeder?
Midjourney →