# GPT-Live 1 lyssnar och talar samtidigt

> OpenAI:s nya röstmodell i API:t, testad på svenska: tystnar inom 0,3 sekunder vid avbrott, 0,05 dollar per minut, men bokningarna brast med GPT-5.6 Sol.

Publicerad: 2026-09-11  
Skribent: Thomas Karlsson  
Sajt: Aipress.se  
URL: https://aipress.se/nyheter/gpt-live-1/

OpenAI har gjort röstsystemet GPT-Live 1 allmänt tillgängligt i sitt API. Det kan lyssna och tala samtidigt, hantera avbrott mitt i ett svar och hålla samtalet i gång medan en annan AI söker information eller använder externa system.

Aipress testade GPT-Live 1 i sju svenska samtal från Sverige. Tjänsten höll sig till svenska, skrev ut replikerna korrekt och tystnade inom 0,3 sekunder när den avbröts. Bokningstestet visade samtidigt en allvarlig svaghet: tillsammans med GPT-5.6 Sol hanterades ingen av tre bokningar helt korrekt.

Röstdelen kostar 0,05 dollar per minut. Kostnaden för den AI som sköter sökningar, resonemang och andra uppgifter tillkommer.

## Vad gör GPT-Live 1 annorlunda än en vanlig röstassistent?

En traditionell röstassistent består ofta av tre separata steg. Först omvandlas tal till text. En språkmodell skriver sedan ett svar, som till sist läses upp av en talsyntes.

Varje övergång tar tid och kan påverka rytmen i samtalet. Systemet måste också avgöra när användaren har talat färdigt och vad som ska hända om personen avbryter, ändrar sig eller börjar prata med någon annan i rummet.

GPT-Live 1 hanterar inkommande och utgående ljud i ett sammanhängande röstlager. Därför kan tjänsten reagera innan en replik är helt avslutad, ge korta bekräftelser under tiden den lyssnar och sluta tala när användaren tar ordet.

![Illustration där assistentens mörkblå talband tystnar när användarens korallröda band kommer in, med etiketterna Assistenten talar, Du talar och Tystnar](https://aipress.se/images/posts/gpt-live-1-avbrott.webp)

Mer krävande arbete kan lämnas över till en annan AI eller tjänst. OpenAI kallar detta delegering. I ett restaurangsamtal kan GPT-Live 1 exempelvis sköta dialogen med gästen medan en hjälpmodell kontrollerar bokningssystemet.

Utvecklaren kan använda Responses API med en av företagets språkmodeller eller ansluta en egen agent, server eller annan AI-tjänst. GPT-5.6 Terra rekommenderas som utgångspunkt i dokumentationen. Luna beskrivs som ett billigare alternativ för rutinuppgifter, medan Astra är avsedd för ärenden som kräver mer resonemang.

## Aipress testade GPT-Live 1 i sju svenska samtal

Vi byggde en testklient i Python och anslöt den till GPT-Live 1 via WebSocket. Sju förinspelade svenska repliker strömmades i realtid, 100 millisekunder åt gången, på samma sätt som ljud från en mikrofon.

Ingen människa talade under testet. Användarens repliker skapades med text-till-tal-systemet `gpt-4o-mini-tts` och rösten Alloy, som instruerades att tala vardaglig svenska. GPT-Live 1 använde rösten Marin och fick instruktionen att uppträda som en lugn svensk assistent.

Samtalet innehöll en vanlig fråga om vad assistenten kunde hjälpa till med, en väderfråga som krävde webbsökning och en frisörbokning som först skulle kontrolleras och sedan godkännas av användaren. Vi avbröt också assistenten mitt i ett svar och skickade en ny replik medan vädersökningen pågick.

Samma manus kördes tre gånger med GPT-5.6 Sol i bakänden, tre gånger med GPT-6 Astra och en gång med GPT-5.6 Luna. Alla använde standardinställningarna för resonemang.

## Hur bra fungerar GPT-Live 1 på svenska?

Samtliga sju samtal genomfördes helt på svenska. Utskriften av användarreplikerna var korrekt, inklusive å, ä och ö. Transkripten av assistentens egna svar innehöll också naturlig och begriplig svenska.

Företaget bakom tjänsten publicerar ingen fullständig språklista och nämner inte svenska särskilt. GPT-Live uppges vara optimerad för några av de vanligaste språken i ChatGPT, men uttal och flyt kan variera.

Vårt begränsade test visar därför att svenska fungerar tekniskt. Det säger däremot inte att kvaliteten är lika hög med alla röster, dialekter eller typer av samtal. Uttalet mätte vi inte, så lyssna själv: hela dialogen från en av GPT-6-omgångarna ligger här, oklippt och rakt ur API:et, med våra AI-genererade frågor och svaren.

<audio controls preload="none" src="/audio/posts/gpt-live-1-samtal-astra.mp3"></audio>

API:t svarade från Sverige och `gpt-live-1` fanns direkt i modellistan. Vi kunde starta en session med en vanlig API-nyckel, utan väntelista eller särskild verifiering av organisationen. API:ts gratisnivå stöds inte.

## Så snabbt tystnar GPT-Live 1 när du avbryter

Skillnaden mot en turbaserad röstassistent märktes tydligast när användaren började prata medan assistenten själv talade.

I sex körningar hann rösten påbörja ett svar innan repliken ”Vänta, stopp!” kom. Den tystnade då inom 0,3 sekunder från replikens början och svarade exempelvis:

> Okej, vad undrar du?

I den sjunde körningen var assistenten redan tyst när avbrottet kom. Så här låter det i ett kort utdrag ur ljudet:

<audio controls preload="none" src="/audio/posts/gpt-live-1-avbrott.mp3"></audio>

Systemet reagerade även innan användaren hade talat färdigt. Under en körning började det säga ”Absolut” ungefär 0,2 sekunder innan den första repliken var avslutad. Vid vädersökningarna förekom korta lyssnarljud som ”Mm”, ”Jag fattar” och ”Okej, fattar” medan arbetet fortsatte i bakänden.

Beteendet kan ge ett mer följsamt samtal, men behöver styras noggrant. Om svaret börjar för tidigt kan det uppfattas som att assistenten avbryter användaren. Språktjänsten Speak uppger att GPT-Live 1 minskade oönskade avbrott med nästan 80 procent jämfört med företagets tidigare turbaserade system. Siffran kommer från kundens egen utvärdering, återgiven i [OpenAI:s lanseringsinlägg](https://openai.com/index/introducing-gpt-live-1-in-the-api/).

## GPT-Live 1 söker information medan samtalet fortsätter

När vi frågade om vädret i Stockholm lämnades uppgiften vidare efter 0,8 till 0,9 sekunder. I en av körningarna skedde delegeringen 0,9 sekunder innan hela frågan hade skickats.

En kort bekräftelse, exempelvis ”Jag kollar”, kom inom 0 till 0,3 sekunder efter frågans slut. Webbsökningen och bearbetningen tog 2,1 till 6,4 sekunder. Det fullständiga vädersvaret började efter 5,4 till 8,4 sekunder.

![Tidslinje över vår minutlånga session med GPT-6 Astra i bakänden: våra repliker, assistentens tal, delegeringar, webbsökningar och de två anropen till bokningsfunktionen](https://aipress.se/images/posts/gpt-live-1-tidslinje-astra.webp)

Medan sökningen pågick skickade vi ytterligare en replik om risken för regn under morgondagens cykeltur. Assistenten svarade med korta lyssnarljud under väntetiden. Det efterföljande vädersvaret angav att inget regn väntades i Stockholm nästa dag.

OpenAI redovisar en svarstid på 0,798 sekunder i sitt eget test, jämfört med 1,41 sekunder för GPT-Realtime-2.1. Företaget uppger även att GPT-Live 1 förbättrade resultatet i Full Duplex Bench med 30 procentenheter. Det är leverantörens egna mätningar och de kan inte jämföras direkt med vårt test eftersom uppställningarna skiljer sig åt.

## Bokningstestet med GPT-Live 1 avslöjade en risk

Frisörbokningen var försökets mest krävande del. Instruktionen till bakänden var tydlig: kontrollera först om tiden var ledig och boka endast efter att användaren hade svarat ja.

Astra kontrollerade tillgängligheten först i alla tre körningar. Under den första svarade vår egen testfunktion felaktigt att tiden var upptagen eftersom den inte kände igen datumformatet `2026-09-11`. Assistenten meddelade då korrekt att ingen bokning hade gjorts. Felet låg i vår funktion och rättades före de två följande försöken.

I dessa två körningar uppgav assistenten att tiden var ledig, bad om ett godkännande och skickade bokningsanropet först efter vårt ja. Tiden bokades alltså i två av tre Astra-försök. Luna följde samma korrekta ordning i sin enda körning.

Med Sol gick det fel i samtliga tre försök. Vid det första bokade bakänden tiden direkt utan att invänta användarens bekräftelse. I de två följande kontrollerades tiden först och assistenten frågade om den skulle bokas. När vi svarade ja skickades däremot ingen ny uppgift till bokningsfunktionen. Trots det sade rösten att bokningen skulle genomföras. Ingen bokning skedde.

![Tidslinje över en session med GPT-5.6 Sol i bakänden där assistenten talar efter vårt ja utan att någon ny uppgift går till bakänden](https://aipress.se/images/posts/gpt-live-1-tidslinje-sol.webp)

Det är ett beteende som [guiden Prompting GPT-Live uttryckligen varnar för](https://developers.openai.com/api/docs/guides/live-prompting):

> It must not promise a booking, guess a price, or claim an action has finished before the backend confirms it.

Det betyder att röstlagret aldrig får säga att något är klart innan verktyget har bekräftat det, och det var precis vad som hände här. Lyssna på hela Sol-dialogen, där löftet kommer utan att någon uppgift går vidare:

<audio controls preload="none" src="/audio/posts/gpt-live-1-samtal-sol.mp3"></audio>

Mätningen visar inte om Sol-felen uppstod när GPT-Live 1 beslutade att inte delegera eller genom hur hjälpmodellen formulerade sina svar. Sju körningar räcker inte heller för att rangordna systemen generellt. Resultatet visar däremot varför känsliga handlingar behöver tekniska kontroller.

En app måste skilja mellan användarens avsikt, ett påbörjat arbete och ett bekräftat resultat. Vid betalningar, bokningar, vårdärenden eller kontoändringar bör det talade beskedet bygga på svaret från det faktiska systemet.

![En telefonlur säger Bokningen är klar medan raden i bokningsliggaren är tom och märkt Ingen bokning](https://aipress.se/images/posts/gpt-live-1-bokning.webp)

Ett avbrott i samtalet stoppar inte heller automatiskt ett pågående verktygsanrop. Om användaren ångrar en bokning medan den behandlas måste appen själv kunna avbryta eller återkalla åtgärden.

## Vad kostar GPT-Live 1 per samtal?

GPT-Live 1 kostar 0,05 dollar per minut för röstsessionen, motsvarande 3 dollar per timme. Tiden debiteras per sekund utan avrundning till hela minuter. Språkmodellen i bakänden, webbsökningar och andra verktyg kostar extra. Priset finns på [modell- och prissidan för GPT-Live 1](https://developers.openai.com/api/docs/models/gpt-live-1).

Våra sju sessioner omfattade 60 till 71 fakturerade sekunder vardera. Röstdelen kostade därför 0,050 till 0,059 dollar per körning.

| AI i bakänden | Uppmätt totalkostnad |
|---|---:|
| GPT-5.6 Luna | 0,073 dollar |
| GPT-5.6 Sol | 0,109 till 0,122 dollar |
| GPT-6 Astra | 0,166 till 0,262 dollar |

Summan omfattar röstsessionen, arbetet i bakänden och en webbsökning för 0,01 dollar. Resultaten gäller vårt testmanus på drygt en minut och är inte fasta priser för andra samtal.

Med Luna var röstdelen den största kostnaden. Med Astra kostade resonemanget och verktygsarbetet mer än själva samtalet.

Hela tiden som sessionen är öppen debiteras. Det gäller när användaren talar, när assistenten talar, under tystnad och medan externa uppgifter behandlas. Att stänga av mikrofonen pausar inte kostnaden. För en WebRTC-anslutning debiteras dessutom 15 sekunder vid starten, men tiden räknas sedan av från sessionens faktiska längd.

Långa bakgrundsjobb bör därför inte lämna röstsamtalet öppet i onödan. En dyrare hjälpmodell kan ändå ge en lägre totalkostnad om den avslutar uppgiften snabbare och därmed förkortar sessionen.

## GPT-Live 1 och Realtime-API:et har olika prismodeller

Minutpriset kan inte jämföras direkt med det äldre Realtime-API:et. GPT-Realtime-2.1 debiteras per ljudtoken i stället för per minut.

Priset är 32 dollar per miljon inkommande ljudtokens och 64 dollar per miljon utgående. Användarens ljud motsvarar en token per 100 millisekunder, medan assistentens ljud motsvarar en token per 50 millisekunder.

Med dessa värden kostar en minut inkommande tal cirka 0,019 dollar och en minut tal från assistenten cirka 0,077 dollar. Text tillkommer. Dessutom skickas samtalshistoriken in på nytt vid varje tur, vilket gör att senare svar kan bli dyrare.

GPT-Live 1:s pris på 0,05 dollar gäller i stället varje minut som röstsessionen är öppen, oavsett vem som talar eller om båda är tysta. Det gör kostnaden enklare att uppskatta utifrån samtalets längd, men arbetet i bakänden måste fortfarande räknas separat.

## Så får ChatGPT-användare tillgång till GPT-Live 1

GPT-Live i ChatGPT drivs av GPT-Live 1 eller den mindre versionen GPT-Live 1 mini, beroende på abonnemang.

Free-användare får begränsad tillgång till mini. Go omfattar tre timmar med mini, medan Plus ger tre timmar med GPT-Live 1. Pro-abonnemanget för 100 dollar omfattar 15 timmar och varianten för 200 dollar ger obegränsad användning.

Gränserna räknas över ett rullande dygn, inte per kalenderdag. Enterprise-kunder med förbrukningsbaserad prissättning betalar 0,05 dollar per minut, samma minutpris som i API:t.

GPT-Live introducerades i ChatGPT den 8 juli 2026. API-lanseringen innebär att andra företag nu kan bygga in motsvarande röstfunktioner i egna appar, telefonväxlar och arbetsflöden.

## GPT-Live 1 får fler röster och stöd för telefoni

Lanseringen omfattar tolv nya röster: Quartz, Ripple, Vesper, Willow, Stone, Gleam, Meridian, Bossa, Tempo, Beacon, Delta och Cinder. Företag som vill använda en egen röst behöver ansöka om tillgång.

Tjänsten kan anslutas från en webbläsare med WebRTC, från en server med WebSocket eller till telefoni genom SIP. Det finns också integrationer med bland andra LiveKit, Twilio, Telnyx och Daily/Pipecat.

Både användarens tal och assistentens svar kan levereras som textutskrifter. Systemet kan dessutom prioritera särskilda nyckelord, exempelvis produktnamn, orter samt bokstavs- och sifferkombinationer som annars lätt misstolkas.

Ljud som skapas med GPT-Live har vattenstämplats med Googles SynthID sedan den 31 juli 2026. Märkningen används både i ChatGPT Voice och i API:t.

## Hur ansluter utvecklare till GPT-Live 1?

Modell-id:t är `gpt-live-1`. Den använder den särskilda API-adressen `v1/live/sessions` och kan inte anropas genom Chat Completions, det vanliga Responses API:t, Realtime-API:et eller Batch API.

In- och utdata kan bestå av ljud och text. Bild och video stöds inte. Kunskapsgränsen är den 31 juli 2025, vilket innebär att aktuell information måste hämtas genom en hjälpmodell eller ett verktyg som webbsökning.

I vårt svenska test gav tekniken snabba avbrott, fungerande transkribering och ett mer följsamt samtal. Bokningsfelen visar samtidigt att naturligt tal inte innebär att ärendeflödet är tillförlitligt. När assistenten får utföra en handling utanför samtalet måste appen kontrollera det verkliga resultatet innan användaren får besked om att uppgiften är klar.
