Whisper (OpenAI)
Whisper er en talegenkendelsesmodel udviklet af OpenAI, der omdanner talt sprog til skreven tekst ved hjælp af en neural netværksarkitektur kaldet en transformer. Modellen er trænet til at genkende tale på tværs af mange sprog og kan desuden oversætte tale direkte til engelsk. Whisper er gjort tilgængelig som open source, hvilket betyder at udviklere frit kan bruge den og bygge videre på den i egne systemer.
Et konkret eksempel kunne være en journalist, der optager et interview på sin telefon og bagefter lader Whisper transskribere lydfilen til tekst, som derefter kan redigeres og bruges direkte i en artikel, uden at interviewet først skal skrives ned ord for ord manuelt. Samme princip ligger bag den stemmefunktion, mange kender fra ChatGPT, hvor det talte input først skal omsættes til tekst, før sprogmodellen kan forstå og svare på det.
Sådan fungerer Whisper
Modellen bygger på en encoder-decoder-arkitektur, hvor den ene del af netværket (encoderen) behandler lydinputtet, mens den anden del (decoderen) genererer tekstoutputtet. I praksis sker det ved, at lydoptagelsen deles op i mindre stykker og omdannes til såkaldte log-mel-spektrogrammer, der viser frekvens over tid. Herefter omdanner encoderen spektrogrammerne til vektorrepræsentationer, kaldet embeddings, hvorefter decoderen bruger disse embeddings til at generere den færdige tekst.
Whisper deler den grundlæggende transformer-teknologi med sprogmodeller som GPT, men hvor GPT primært er bygget til at generere sammenhængende tekst ud fra tekst, er Whisper trænet specifikt til at omsætte lyd til tekst. Selve trænings-metoden hører under det bredere felt deep learning, hvor modellen lærer mønstre i store mængder data frem for at følge håndskrevne regler.
Whisper i ChatGPTs stemmefunktion
Når en bruger taler ind i ChatGPTs stemmefunktion i stedet for at skrive, er det Whisper (eller en videreudvikling af samme teknologi), der omdanner den indtalte lyd til tekst. Denne tekst sendes derefter videre til den underliggende sprogmodel, som genererer et svar, der til sidst kan læses højt af en talesyntese-funktion. På den måde fungerer Whisper som bindeleddet, der gør stemmebaseret dialog med en chatbot mulig, uden at brugeren selv skal skrive noget. Samme princip om at kombinere flere AI-komponenter til én samlet oplevelse ses også, når man opsætter en Custom GPT tilpasset en bestemt opgave eller virksomhed.
Modelstørrelser og nøjagtighed
OpenAI har offentliggjort Whisper i seks forskellige modelstørrelser med varierende hastighed og nøjagtighed: tiny, base, small, medium, large og turbo. Valget mellem dem afhænger typisk af, hvor mange computerressourcer man har til rådighed, og hvor stor vægt man lægger på hastighed frem for præcision, da den mindste model er hurtigst men mindst nøjagtig, mens den største model er meget nøjagtig men kræver flere ressourcer. Ifølge en gennemgang fra Digital Suits ligger Whisper’s fejlrate (word error rate, WER) omkring 8 procent, mens transskriptionen af en times lydoptagelse typisk tager mellem 10 og 30 minutter.
Sprogunderstøttelse og oversættelse
Whisper er en avanceret open source ASR-model skabt af OpenAI, der kan transskribere lyd på 97 sprog med en høj nøjagtighed. En anden kilde angiver, at modellen understøtter transskription på op til 98 sprog og kan oversætte tale fra op til 30 sprog til engelsk. Modellen håndterer desuden lyd af varierende kvalitet, da Whisper kan arbejde med forskellige lydkvaliteter, herunder støjfyldte miljøer, og kan bruge rå lyd uden meget forudgående støjreduktion.
Anvendelsesmuligheder
Whisper bruges bredt til automatisk generering af undertekster, transskription af møder og interviews, samt til at gøre lydbaseret indhold mere tilgængeligt for personer med hørenedsættelse. Fordi modellen er open source, kan den også indbygges i tredjepartsværktøjer og virksomheders egne systemer, hvor den fx kombineres med søgefunktioner eller stemmestyrede kommandoer.
Begrænsninger ved Whisper
Whisper er ikke fejlfri. Modellen har blandt andet begrænset understøttelse af mindre udbredte sprog og kan lave fejl, når den støder på meget specialiseret fagsprog. Derudover er Whisper ikke bygget til øjeblikkelig transskription undervejs i en samtale, da API’et ikke understøtter live-transskription (token streaming) i den udbredte version. I praksis betyder det, at lyden typisk skal optages eller modtages i en blok, før den kan sendes til modellen og omsættes til tekst.