Hop til indhold
Kunstig intelligens og data

Whisper (OpenAI)

Whisper er en talegenkendelsesmodel udviklet af OpenAI, der omdanner talt sprog til skreven tekst ved hjælp af en neural netværksarkitektur kaldet en transformer. Modellen er trænet til at genkende tale på tværs af mange sprog og kan desuden oversætte tale direkte til engelsk. Whisper er gjort tilgængelig som open source, hvilket betyder at udviklere frit kan bruge den og bygge videre på den i egne systemer.

Et konkret eksempel kunne være en journalist, der optager et interview på sin telefon og bagefter lader Whisper transskribere lydfilen til tekst, som derefter kan redigeres og bruges direkte i en artikel, uden at interviewet først skal skrives ned ord for ord manuelt. Samme princip ligger bag den stemmefunktion, mange kender fra ChatGPT, hvor det talte input først skal omsættes til tekst, før sprogmodellen kan forstå og svare på det.

Sådan fungerer Whisper

Modellen bygger på en encoder-decoder-arkitektur, hvor den ene del af netværket (encoderen) behandler lydinputtet, mens den anden del (decoderen) genererer tekstoutputtet. I praksis sker det ved, at lydoptagelsen deles op i mindre stykker og omdannes til såkaldte log-mel-spektrogrammer, der viser frekvens over tid. Herefter omdanner encoderen spektrogrammerne til vektorrepræsentationer, kaldet embeddings, hvorefter decoderen bruger disse embeddings til at generere den færdige tekst.

Whisper deler den grundlæggende transformer-teknologi med sprogmodeller som GPT, men hvor GPT primært er bygget til at generere sammenhængende tekst ud fra tekst, er Whisper trænet specifikt til at omsætte lyd til tekst. Selve trænings-metoden hører under det bredere felt deep learning, hvor modellen lærer mønstre i store mængder data frem for at følge håndskrevne regler.

Whisper i ChatGPTs stemmefunktion

Når en bruger taler ind i ChatGPTs stemmefunktion i stedet for at skrive, er det Whisper (eller en videreudvikling af samme teknologi), der omdanner den indtalte lyd til tekst. Denne tekst sendes derefter videre til den underliggende sprogmodel, som genererer et svar, der til sidst kan læses højt af en talesyntese-funktion. På den måde fungerer Whisper som bindeleddet, der gør stemmebaseret dialog med en chatbot mulig, uden at brugeren selv skal skrive noget. Samme princip om at kombinere flere AI-komponenter til én samlet oplevelse ses også, når man opsætter en Custom GPT tilpasset en bestemt opgave eller virksomhed.

Modelstørrelser og nøjagtighed

OpenAI har offentliggjort Whisper i seks forskellige modelstørrelser med varierende hastighed og nøjagtighed: tiny, base, small, medium, large og turbo. Valget mellem dem afhænger typisk af, hvor mange computerressourcer man har til rådighed, og hvor stor vægt man lægger på hastighed frem for præcision, da den mindste model er hurtigst men mindst nøjagtig, mens den største model er meget nøjagtig men kræver flere ressourcer. Ifølge en gennemgang fra Digital Suits ligger Whisper’s fejlrate (word error rate, WER) omkring 8 procent, mens transskriptionen af en times lydoptagelse typisk tager mellem 10 og 30 minutter.

Sprogunderstøttelse og oversættelse

Whisper er en avanceret open source ASR-model skabt af OpenAI, der kan transskribere lyd på 97 sprog med en høj nøjagtighed. En anden kilde angiver, at modellen understøtter transskription på op til 98 sprog og kan oversætte tale fra op til 30 sprog til engelsk. Modellen håndterer desuden lyd af varierende kvalitet, da Whisper kan arbejde med forskellige lydkvaliteter, herunder støjfyldte miljøer, og kan bruge rå lyd uden meget forudgående støjreduktion.

Anvendelsesmuligheder

Whisper bruges bredt til automatisk generering af undertekster, transskription af møder og interviews, samt til at gøre lydbaseret indhold mere tilgængeligt for personer med hørenedsættelse. Fordi modellen er open source, kan den også indbygges i tredjepartsværktøjer og virksomheders egne systemer, hvor den fx kombineres med søgefunktioner eller stemmestyrede kommandoer.

Begrænsninger ved Whisper

Whisper er ikke fejlfri. Modellen har blandt andet begrænset understøttelse af mindre udbredte sprog og kan lave fejl, når den støder på meget specialiseret fagsprog. Derudover er Whisper ikke bygget til øjeblikkelig transskription undervejs i en samtale, da API’et ikke understøtter live-transskription (token streaming) i den udbredte version. I praksis betyder det, at lyden typisk skal optages eller modtages i en blok, før den kan sendes til modellen og omsættes til tekst.

Eksempel
En journalist optager et interview på sin telefon og lader Whisper transskribere lydfilen til tekst, som kan redigeres og bruges direkte i en artikel.
Ofte stillede spørgsmål
Er Whisper gratis at bruge?
OpenAI har gjort Whisper tilgængelig gratis som open source-model, som udviklere selv kan installere og køre. Bruger man i stedet en API-tjeneste, der stiller Whisper til rådighed, kan der være omkostninger forbundet med brugen, afhængigt af udbyderen.
Hvilke sprog kan Whisper transskribere?
Whisper understøtter transskription på et stort antal sprog, angivet til omkring 97-98 sprog i forskellige kilder, og kan derudover oversætte tale fra en række sprog direkte til engelsk.
Kan Whisper transskribere tale i realtid?
Den udbredte Whisper API understøtter ikke live-transskription (token streaming). Lyden skal typisk foreligge som en optagelse eller sendes i afgrænsede blokke, før modellen kan omsætte den til tekst.
Hvad er forskellen på Whisper og GPT?
Whisper er trænet til at omsætte talt lyd til tekst, mens GPT-modeller er sprogmodeller, der genererer eller bearbejder tekst. I fx ChatGPTs stemmefunktion arbejder de to typer modeller sammen: Whisper laver transskriptionen, hvorefter en GPT-model genererer selve svaret.
Hvilke modelstørrelser findes der af Whisper?
Whisper findes i flere størrelser - blandt andet tiny, base, small, medium, large og turbo - hvor de mindste modeller er hurtigst men mindre nøjagtige, og de største er mere nøjagtige men kræver flere computerressourcer.
Vil du forstå den sprogmodel, Whisper ofte arbejder sammen med i værktøjer som ChatGPT?
GPT (Generative Pre-trained Transformer) →