Aipress testade GPT-Live 1 i sju svenska samtal från Sverige. Tjänsten höll sig till svenska, skrev ut replikerna korrekt och tystnade inom 0,3 sekunder när den avbröts. Bokningstestet visade samtidigt en allvarlig svaghet: tillsammans med GPT-5.6 Sol hanterades ingen av tre bokningar helt korrekt.
Röstdelen kostar 0,05 dollar per minut. Kostnaden för den AI som sköter sökningar, resonemang och andra uppgifter tillkommer.
Vad gör GPT-Live 1 annorlunda än en vanlig röstassistent?
En traditionell röstassistent består ofta av tre separata steg. Först omvandlas tal till text. En språkmodell skriver sedan ett svar, som till sist läses upp av en talsyntes.
Varje övergång tar tid och kan påverka rytmen i samtalet. Systemet måste också avgöra när användaren har talat färdigt och vad som ska hända om personen avbryter, ändrar sig eller börjar prata med någon annan i rummet.
GPT-Live 1 hanterar inkommande och utgående ljud i ett sammanhängande röstlager. Därför kan tjänsten reagera innan en replik är helt avslutad, ge korta bekräftelser under tiden den lyssnar och sluta tala när användaren tar ordet.
Mer krävande arbete kan lämnas över till en annan AI eller tjänst. OpenAI kallar detta delegering. I ett restaurangsamtal kan GPT-Live 1 exempelvis sköta dialogen med gästen medan en hjälpmodell kontrollerar bokningssystemet.
Utvecklaren kan använda Responses API med en av företagets språkmodeller eller ansluta en egen agent, server eller annan AI-tjänst. GPT-5.6 Terra rekommenderas som utgångspunkt i dokumentationen. Luna beskrivs som ett billigare alternativ för rutinuppgifter, medan Astra är avsedd för ärenden som kräver mer resonemang.
Aipress testade GPT-Live 1 i sju svenska samtal
Vi byggde en testklient i Python och anslöt den till GPT-Live 1 via WebSocket. Sju förinspelade svenska repliker strömmades i realtid, 100 millisekunder åt gången, på samma sätt som ljud från en mikrofon.
Ingen människa talade under testet. Användarens repliker skapades med text-till-tal-systemet gpt-4o-mini-tts och rösten Alloy, som instruerades att tala vardaglig svenska. GPT-Live 1 använde rösten Marin och fick instruktionen att uppträda som en lugn svensk assistent.
Samtalet innehöll en vanlig fråga om vad assistenten kunde hjälpa till med, en väderfråga som krävde webbsökning och en frisörbokning som först skulle kontrolleras och sedan godkännas av användaren. Vi avbröt också assistenten mitt i ett svar och skickade en ny replik medan vädersökningen pågick.
Samma manus kördes tre gånger med GPT-5.6 Sol i bakänden, tre gånger med GPT-6 Astra och en gång med GPT-5.6 Luna. Alla använde standardinställningarna för resonemang.
Hur bra fungerar GPT-Live 1 på svenska?
Samtliga sju samtal genomfördes helt på svenska. Utskriften av användarreplikerna var korrekt, inklusive å, ä och ö. Transkripten av assistentens egna svar innehöll också naturlig och begriplig svenska.
Företaget bakom tjänsten publicerar ingen fullständig språklista och nämner inte svenska särskilt. GPT-Live uppges vara optimerad för några av de vanligaste språken i ChatGPT, men uttal och flyt kan variera.
Vårt begränsade test visar därför att svenska fungerar tekniskt. Det säger däremot inte att kvaliteten är lika hög med alla röster, dialekter eller typer av samtal. Uttalet mätte vi inte, så lyssna själv: hela dialogen från en av GPT-6-omgångarna ligger här, oklippt och rakt ur API:et, med våra AI-genererade frågor och svaren.
API:t svarade från Sverige och gpt-live-1 fanns direkt i modellistan. Vi kunde starta en session med en vanlig API-nyckel, utan väntelista eller särskild verifiering av organisationen. API:ts gratisnivå stöds inte.
Så snabbt tystnar GPT-Live 1 när du avbryter
Skillnaden mot en turbaserad röstassistent märktes tydligast när användaren började prata medan assistenten själv talade.
I sex körningar hann rösten påbörja ett svar innan repliken ”Vänta, stopp!” kom. Den tystnade då inom 0,3 sekunder från replikens början och svarade exempelvis:
Okej, vad undrar du?
I den sjunde körningen var assistenten redan tyst när avbrottet kom. Så här låter det i ett kort utdrag ur ljudet:
Systemet reagerade även innan användaren hade talat färdigt. Under en körning började det säga ”Absolut” ungefär 0,2 sekunder innan den första repliken var avslutad. Vid vädersökningarna förekom korta lyssnarljud som ”Mm”, ”Jag fattar” och ”Okej, fattar” medan arbetet fortsatte i bakänden.
Beteendet kan ge ett mer följsamt samtal, men behöver styras noggrant. Om svaret börjar för tidigt kan det uppfattas som att assistenten avbryter användaren. Språktjänsten Speak uppger att GPT-Live 1 minskade oönskade avbrott med nästan 80 procent jämfört med företagets tidigare turbaserade system. Siffran kommer från kundens egen utvärdering, återgiven i OpenAI:s lanseringsinlägg.
GPT-Live 1 söker information medan samtalet fortsätter
När vi frågade om vädret i Stockholm lämnades uppgiften vidare efter 0,8 till 0,9 sekunder. I en av körningarna skedde delegeringen 0,9 sekunder innan hela frågan hade skickats.
En kort bekräftelse, exempelvis ”Jag kollar”, kom inom 0 till 0,3 sekunder efter frågans slut. Webbsökningen och bearbetningen tog 2,1 till 6,4 sekunder. Det fullständiga vädersvaret började efter 5,4 till 8,4 sekunder.
Medan sökningen pågick skickade vi ytterligare en replik om risken för regn under morgondagens cykeltur. Assistenten svarade med korta lyssnarljud under väntetiden. Det efterföljande vädersvaret angav att inget regn väntades i Stockholm nästa dag.
OpenAI redovisar en svarstid på 0,798 sekunder i sitt eget test, jämfört med 1,41 sekunder för GPT-Realtime-2.1. Företaget uppger även att GPT-Live 1 förbättrade resultatet i Full Duplex Bench med 30 procentenheter. Det är leverantörens egna mätningar och de kan inte jämföras direkt med vårt test eftersom uppställningarna skiljer sig åt.
Bokningstestet med GPT-Live 1 avslöjade en risk
Frisörbokningen var försökets mest krävande del. Instruktionen till bakänden var tydlig: kontrollera först om tiden var ledig och boka endast efter att användaren hade svarat ja.
Astra kontrollerade tillgängligheten först i alla tre körningar. Under den första svarade vår egen testfunktion felaktigt att tiden var upptagen eftersom den inte kände igen datumformatet 2026-09-11. Assistenten meddelade då korrekt att ingen bokning hade gjorts. Felet låg i vår funktion och rättades före de två följande försöken.
I dessa två körningar uppgav assistenten att tiden var ledig, bad om ett godkännande och skickade bokningsanropet först efter vårt ja. Tiden bokades alltså i två av tre Astra-försök. Luna följde samma korrekta ordning i sin enda körning.
Med Sol gick det fel i samtliga tre försök. Vid det första bokade bakänden tiden direkt utan att invänta användarens bekräftelse. I de två följande kontrollerades tiden först och assistenten frågade om den skulle bokas. När vi svarade ja skickades däremot ingen ny uppgift till bokningsfunktionen. Trots det sade rösten att bokningen skulle genomföras. Ingen bokning skedde.
Det är ett beteende som guiden Prompting GPT-Live uttryckligen varnar för:
It must not promise a booking, guess a price, or claim an action has finished before the backend confirms it.
Det betyder att röstlagret aldrig får säga att något är klart innan verktyget har bekräftat det, och det var precis vad som hände här. Lyssna på hela Sol-dialogen, där löftet kommer utan att någon uppgift går vidare:
Mätningen visar inte om Sol-felen uppstod när GPT-Live 1 beslutade att inte delegera eller genom hur hjälpmodellen formulerade sina svar. Sju körningar räcker inte heller för att rangordna systemen generellt. Resultatet visar däremot varför känsliga handlingar behöver tekniska kontroller.
En app måste skilja mellan användarens avsikt, ett påbörjat arbete och ett bekräftat resultat. Vid betalningar, bokningar, vårdärenden eller kontoändringar bör det talade beskedet bygga på svaret från det faktiska systemet.
Ett avbrott i samtalet stoppar inte heller automatiskt ett pågående verktygsanrop. Om användaren ångrar en bokning medan den behandlas måste appen själv kunna avbryta eller återkalla åtgärden.
Vad kostar GPT-Live 1 per samtal?
GPT-Live 1 kostar 0,05 dollar per minut för röstsessionen, motsvarande 3 dollar per timme. Tiden debiteras per sekund utan avrundning till hela minuter. Språkmodellen i bakänden, webbsökningar och andra verktyg kostar extra. Priset finns på modell- och prissidan för GPT-Live 1.
Våra sju sessioner omfattade 60 till 71 fakturerade sekunder vardera. Röstdelen kostade därför 0,050 till 0,059 dollar per körning.
| AI i bakänden | Uppmätt totalkostnad |
|---|---|
| GPT-5.6 Luna | 0,073 dollar |
| GPT-5.6 Sol | 0,109 till 0,122 dollar |
| GPT-6 Astra | 0,166 till 0,262 dollar |
Summan omfattar röstsessionen, arbetet i bakänden och en webbsökning för 0,01 dollar. Resultaten gäller vårt testmanus på drygt en minut och är inte fasta priser för andra samtal.
Med Luna var röstdelen den största kostnaden. Med Astra kostade resonemanget och verktygsarbetet mer än själva samtalet.
Hela tiden som sessionen är öppen debiteras. Det gäller när användaren talar, när assistenten talar, under tystnad och medan externa uppgifter behandlas. Att stänga av mikrofonen pausar inte kostnaden. För en WebRTC-anslutning debiteras dessutom 15 sekunder vid starten, men tiden räknas sedan av från sessionens faktiska längd.
Långa bakgrundsjobb bör därför inte lämna röstsamtalet öppet i onödan. En dyrare hjälpmodell kan ändå ge en lägre totalkostnad om den avslutar uppgiften snabbare och därmed förkortar sessionen.
GPT-Live 1 och Realtime-API:et har olika prismodeller
Minutpriset kan inte jämföras direkt med det äldre Realtime-API:et. GPT-Realtime-2.1 debiteras per ljudtoken i stället för per minut.
Priset är 32 dollar per miljon inkommande ljudtokens och 64 dollar per miljon utgående. Användarens ljud motsvarar en token per 100 millisekunder, medan assistentens ljud motsvarar en token per 50 millisekunder.
Med dessa värden kostar en minut inkommande tal cirka 0,019 dollar och en minut tal från assistenten cirka 0,077 dollar. Text tillkommer. Dessutom skickas samtalshistoriken in på nytt vid varje tur, vilket gör att senare svar kan bli dyrare.
GPT-Live 1:s pris på 0,05 dollar gäller i stället varje minut som röstsessionen är öppen, oavsett vem som talar eller om båda är tysta. Det gör kostnaden enklare att uppskatta utifrån samtalets längd, men arbetet i bakänden måste fortfarande räknas separat.
Så får ChatGPT-användare tillgång till GPT-Live 1
GPT-Live i ChatGPT drivs av GPT-Live 1 eller den mindre versionen GPT-Live 1 mini, beroende på abonnemang.
Free-användare får begränsad tillgång till mini. Go omfattar tre timmar med mini, medan Plus ger tre timmar med GPT-Live 1. Pro-abonnemanget för 100 dollar omfattar 15 timmar och varianten för 200 dollar ger obegränsad användning.
Gränserna räknas över ett rullande dygn, inte per kalenderdag. Enterprise-kunder med förbrukningsbaserad prissättning betalar 0,05 dollar per minut, samma minutpris som i API:t.
GPT-Live introducerades i ChatGPT den 8 juli 2026. API-lanseringen innebär att andra företag nu kan bygga in motsvarande röstfunktioner i egna appar, telefonväxlar och arbetsflöden.
GPT-Live 1 får fler röster och stöd för telefoni
Lanseringen omfattar tolv nya röster: Quartz, Ripple, Vesper, Willow, Stone, Gleam, Meridian, Bossa, Tempo, Beacon, Delta och Cinder. Företag som vill använda en egen röst behöver ansöka om tillgång.
Tjänsten kan anslutas från en webbläsare med WebRTC, från en server med WebSocket eller till telefoni genom SIP. Det finns också integrationer med bland andra LiveKit, Twilio, Telnyx och Daily/Pipecat.
Både användarens tal och assistentens svar kan levereras som textutskrifter. Systemet kan dessutom prioritera särskilda nyckelord, exempelvis produktnamn, orter samt bokstavs- och sifferkombinationer som annars lätt misstolkas.
Ljud som skapas med GPT-Live har vattenstämplats med Googles SynthID sedan den 31 juli 2026. Märkningen används både i ChatGPT Voice och i API:t.
Hur ansluter utvecklare till GPT-Live 1?
Modell-id:t är gpt-live-1. Den använder den särskilda API-adressen v1/live/sessions och kan inte anropas genom Chat Completions, det vanliga Responses API:t, Realtime-API:et eller Batch API.
In- och utdata kan bestå av ljud och text. Bild och video stöds inte. Kunskapsgränsen är den 31 juli 2025, vilket innebär att aktuell information måste hämtas genom en hjälpmodell eller ett verktyg som webbsökning.
I vårt svenska test gav tekniken snabba avbrott, fungerande transkribering och ett mer följsamt samtal. Bokningsfelen visar samtidigt att naturligt tal inte innebär att ärendeflödet är tillförlitligt. När assistenten får utföra en handling utanför samtalet måste appen kontrollera det verkliga resultatet innan användaren får besked om att uppgiften är klar.
Vanliga frågor (FAQ)
Fungerar GPT-Live 1 på svenska?
Ja, i Aipress test svarade GPT-Live 1 på svenska i samtliga sju samtal, och API:ets utskrifter av våra repliker var ordagrant korrekta, inklusive å, ä och ö. OpenAI nämner dock inte svenska i någon offentlig språklista och uppger att uttal och flyt kan variera mellan språk.
Vad kostar en timmes samtal med GPT-Live 1?
Röstsessionen med GPT-Live 1 kostar 0,05 dollar per minut, alltså 3 dollar per timme, och debiteras per sekund. Hjälpmodellen och verktygen kostar extra: i Aipress test kostade Luna cirka 0,0035 dollar per samtal och Astra 0,10 till 0,17 dollar för ett samtal på drygt en minut.
Kan jag prova GPT-Live 1 i ChatGPT utan API?
Ja, GPT-Live i ChatGPT använder GPT-Live 1 för Plus, med 3 timmar per rullande dygn, och för Pro, med 15 timmar eller obegränsad användning beroende på abonnemang. Free och Go använder i stället den mindre modellen GPT-Live 1 mini.
Källor
- Changelog
OpenAI, hämtad
- GPT-Live 1
OpenAI, hämtad
- Pricing
OpenAI, hämtad
- Getting started with GPT-Live
OpenAI, hämtad
- Delegation and tools in GPT-Live
OpenAI, hämtad
- Prompting GPT-Live
OpenAI, hämtad
- Cost optimization
OpenAI, hämtad
- Build more natural voice experiences with GPT-Live-1 in the API
OpenAI, hämtad
- Introducing GPT-Live
OpenAI, hämtad
- Introducing GPT-Live-1 in the API
OpenAI Developer Community, hämtad
- GPT-Live System Card
OpenAI, hämtad
- ChatGPT Voice
OpenAI Help Center, hämtad
Thomas Karlsson
Huvudredaktör, AI expert och journalist
Thomas bevakar generativ AI, språkmodeller och verktygen som förändrar hur vi arbetar. Han skriver för dig som vill förstå utvecklingen utan att redan kunna tekniken.