Hoppa till innehållet
Aipress

OpenAI

Whisper försvinner ur OpenAI:s API i februari 2027

Fyra modeller för tal till text försvinner från OpenAI:s API. Den 26 februari 2027 stängs whisper-1, gpt-4o-transcribe, gpt-4o-mini-transcribe och gpt-4o-transcribe-diarize. Utvecklare hänvisas till två nya modeller som lanserades den 28 juli 2026, en månad före avvecklingsbeskedet.

Thomas Karlsson Publicerad 4 min läsning
Whisper försvinner ur OpenAI:s API i februari 2027

Beskedet publicerades den 26 augusti 2026 i OpenAI:s ändringslogg, där det formuleras så här:

These models will shut down on February 26, 2027. Migrate to gpt-live-transcribe or gpt-transcribe.

Det betyder att de fyra är avvecklade från och med nu men slutar fungera först den 26 februari 2027. Fram till dess ska den som anropar dem gå över till någon av de två nya. Under övergångsperioden fungerar allt som vanligt.

Den som använder en färdig transkriberingstjänst som kund behöver inte göra något direkt. Ansvaret ligger hos företaget eller utvecklaren bakom tjänsten. Bygger den på någon av de berörda modellerna måste den uppdateras före slutdatumet.

Så används gpt-transcribe och gpt-live-transcribe

Vilken ersättare som passar beror främst på om ljudet redan är inspelat eller kommer in i realtid.

gpt-transcribe är avsedd för färdiga ljudfiler, exempelvis inspelade intervjuer, föreläsningar och möten. Filer upp till 25 MB tas emot i formaten mp3, mp4, mpeg, mpga, m4a, wav och webm. Ett enkelt anrop ser ut så här:

curl --request POST \
  --url https://api.openai.com/v1/audio/transcriptions \
  --header "Authorization: Bearer $OPENAI_API_KEY" \
  --header 'Content-Type: multipart/form-data' \
  --form file=@/path/to/file/audio.mp3 \
  --form model=gpt-transcribe

Texten kan också lämnas löpande medan filen bearbetas, med parametern stream. Det ska inte blandas ihop med direkt transkribering från en mikrofon, eftersom även en färdig inspelning kan strömmas under bearbetningen.

gpt-live-transcribe är byggd för ljud som pågår just nu. Det kan vara ett telefonsamtal, ett digitalt möte eller en mikrofon i en app där texten ska visas medan personen talar. Modellen är gjord för kort fördröjning, och fördröjningen går att justera.

Fotografi av en ljus arbetsplats där en bärbar dator visar en uppladdad ljudfil med vågform, medan en person längre bak talar i en bordsmikrofon med aktiv nivåmätare

Båda kan få extra information som hjälper dem att tolka ljudet. Utvecklaren kan exempelvis ange produktnamn, medicinska termer eller förkortningar som sannolikt förekommer. Sådana nyckelord fungerar som ledtrådar och måste inte återges i resultatet.

Det går också att ange flera förväntade språk samtidigt. Det passar inspelningar där deltagarna växlar språk, medan de äldre modellerna bara tar emot en språkledtråd. Arbetsflödena beskrivs närmare i företagets guide för transkribering.

På sina egna modellsidor placerar OpenAI båda ersättarna i den högsta prestandaklassen. Det är företagets egen bedömning och ska inte läsas som resultatet av ett oberoende test.

Vad kostar de nya transkriberingsmodellerna?

Priserna anges i amerikanska dollar per ljudminut, före eventuell moms och valutaväxling.

Modell Pris per minut (dollar)
gpt-transcribe (ny) 0,0045
gpt-live-transcribe (ny) 0,017
whisper-1 0,006
gpt-4o-transcribe 0,006
gpt-4o-mini-transcribe 0,003

För färdiga filer blir bytet billigare för de flesta: en timme kostar 0,27 dollar med den nya modellen, jämfört med 0,36 dollar för whisper-1. Den gamla budgetmodellen ligger däremot lägre, så där innebär bytet en höjning från 0,18 dollar per timme.

Direktsänt ljud kostar mer. Realtidsvarianten motsvarar 1,02 dollar för en timme, nästan tre gånger whisper-1:s minutpris. Företag som hittills har haft en filmodell i ett upplägg som liknar realtid bör därför kontrollera både teknik och kostnad inför bytet.

gpt-4o-transcribe-diarize, som kan märka upp vem som talar, prissätts per token i stället för per minut, 2,50 dollar per miljon inmatningstoken och 10 dollar per miljon utmatningstoken. Kostnaden kan därför inte jämföras direkt med minutpriserna i tabellen.

Undertexter och talarmärkning saknar nya ersättare

Samma två nya modeller rekommenderas som ersättare för samtliga fyra som ska bort. För vanlig omvandling av tal till text finns därmed en tydlig väg framåt, men några specialfunktioner saknar en angiven efterträdare.

Dokumentationen hänvisar till gpt-4o-transcribe-diarize när varje replik ska märkas med rätt talare. För tidskoder på ordnivå och undertextfiler i formaten SRT och VTT anges whisper-1. Den ligger också bakom översättning av en färdig inspelning till engelska genom det särskilda gränssnittet för ljudöversättning.

Alla tre försvinner den 26 februari 2027, men några nya alternativ för funktionerna har inte presenterats. Den som skapar undertexter, skiljer mellan flera röster eller översätter ljud kan därför inte räkna med att ett byte av modellnamn räcker.

Grafik med rubriken Inför modellbytet: vanlig transkribering har en ersättare angiven, medan talarmärkning, undertexter SRT/VTT och översättning till engelska saknar ny ersättare

Migreringen bör provas mot verkliga inspelningar innan den tas i drift. För svenska tjänster bör testerna omfatta dialekter, facktermer och samtal där flera språk blandas, liksom namn, skiljetecken, talarbyten och tidskoder. Resultatet behöver jämföras med den nuvarande lösningen och med de krav som tjänsten faktiskt har.

Whisper med öppen källkod påverkas inte

Beskedet gäller whisper-1, den version av Whisper som körs på företagets servrar och säljs genom dess API. Den öppna Whisper-modellen påverkas inte.

Kod och modellfiler finns öppet publicerade och kan köras lokalt på en egen dator eller server. Program som har byggt in den versionen fortsätter därför att fungera oberoende av slutdatumet. Skillnaden kan vara svår att se, eftersom både molntjänsten och lokala program ofta marknadsförs med namnet Whisper.

Avvecklingen gäller utvecklar-API:t, och OpenAI har inte nämnt ChatGPT.

För vanliga användare märks förändringen sannolikt först när en app uppdateras. Utvecklare måste ha slutfört migrering och tester före den 26 februari 2027. Därefter går de fyra avvecklade modellerna inte längre att anropa genom API:t.

Thomas Karlsson

Thomas Karlsson

Huvudredaktör, AI expert och journalist

Thomas bevakar generativ AI, språkmodeller och verktygen som förändrar hur vi arbetar. Han skriver för dig som vill förstå utvecklingen utan att redan kunna tekniken.

Läs mer om Thomas Så arbetar AiPress

Läs också

Alla nyheter

AiPress i din inkorg

Följ AI-utvecklingen
med vårt nyhetsbrev.

Få de senaste AI-nyheterna via e-post. Du bekräftar själv din prenumeration och kan avsluta den när du vill.

Så hanterar vi dina uppgifter.

Driftstatus

Från leverantörernas statussidor

OpenAI-logotyp OpenAI just nu

Officiell status
Hämtar status …

Tjänster och status
  • APIs
  • ChatGPT
  • Codex
  • FedRAMP
  • Ads Platform