Den tydligaste förbättringen gäller stökigt och flerspråkigt ljud. Enligt xAI:s lanseringsinlägg har den nya versionen tränats på verkligt ljud med bakgrundsljud och flera språk, inspelat i många olika miljöer. Företaget lyfter bland annat kundsamtal, röstkommandon och upplästa telefonnummer och e-postadresser som användningsområden.
Hur bra är Grok Voice Transcribe 2.0?
Grok Voice Transcribe 2.0 placerar sig först i Artificial Analysis test av tjänster som skriver ut tal medan ljudet pågår. Ordfelsfrekvensen är 2,73 procent, jämfört med 3,93 för föregångaren.
Ordfelsfrekvens, ofta förkortat WER efter engelskans word error rate, mäter hur stor andel ord som byts ut, missas eller läggs till. Ett lägre värde är bättre.
Resultatet motsvarar omkring 31 procent färre ordfel än med Grok Voice Transcribe 1.0. xAI beskriver förstaplatsen som en jämförelse mellan 32 tjänster, men den aktuella sidan hos Artificial Analysis innehåller 34, varav 28 visas som standard. Förstaplatsen stämmer alltså, men inte det angivna antalet.
Topplaceringen gäller dessutom det sammanvägda resultatet. På Artificial Analysis eget material med samtal för röstassistenter hamnar Grok på sjunde plats av de 28. Försprånget byggs i stället upp på de två andra delarna, som består av engelska anföranden i Europaparlamentet och engelskspråkiga börssamtal.
Testet omfattar omkring åtta timmars ljud och är helt på engelska. Det säger därför inget om hur väl tjänsten hanterar svenska. Artificial Analysis topplista visar också att Grok är mest träffsäker i jämförelsen, men inte snabbast eller billigast.
För färdiga ljudfiler blir placeringen lägre. Där är ordfelsfrekvensen 2,3 procent, vilket ger en femteplats. Föregångaren ligger på 4,0. Före Grok ligger MAI-Transcribe-2 och ElevenLabs Scribe v2 samt två tjänster som xAI inte tog med i sitt jämförelsediagram.
xAI:s egna tester visar störst lyft för korta kommandon
xAI:s huvudpåstående om den nya versionen lyder så här i lanseringsinlägget:
Across our real-world evaluations, Grok Voice Transcribe 2.0 is one of the most accurate transcription models available today and twice as accurate as Grok Voice Transcribe 1.0, at the same price.
Påståendet betyder hälften så många fel som 1.0, till oförändrat pris, räknat på ljud ur xAI:s egen verksamhet. Underlaget är fyra test, varav tre på engelska och ett med korta röstkommandon på 19 språk.
| Test, WER i procent | Grok Voice Transcribe 2.0 | Grok Voice Transcribe 1.0 |
|---|---|---|
| Telefonsamtal till kundtjänst, 8 kHz | 7,09 | 10,56 |
| Samtal med Grok | 3,34 | 8,65 |
| Sifferuppgifter och adresser | 3,20 | 7,23 |
| Korta kommandon på 19 språk | 6,81 | 20,55 |
I tre av fyra mätningar mer än halveras antalet fel. Störst är skillnaden för korta kommandon, där värdet sjunker från 20,55 till 6,81. För telefonsamtal är minskningen omkring en tredjedel. xAI uppger att Grok Voice Transcribe 2.0 var bäst av samtliga deltagare på just telefonljud.
Företagets egen tabell visar samtidigt en konkurrent före Grok i ett av testen. Microsofts MAI-Transcribe-2 fick 2,56 på sifferuppgifter och adresser, mot 3,20 för xAI:s tjänst. Googles Gemini 3.5 Transcribe hamnade efter Grok Voice Transcribe 2.0 i alla fyra mätningarna.
Uppgiften om ”dubbelt så exakt” vilar därmed på xAI:s interna material. Den oberoende jämförelsen visar också en tydlig förbättring, men där är skillnaden mot version 1.0 omkring 31 procent.
Grok Voice Transcribe 2.0 har blivit bättre på svenska
xAI har även jämfört 19 språk. För svenska sjönk ordfelsfrekvensen från 22,17 med den tidigare versionen till 6,91 med Grok Voice Transcribe 2.0.
Det är en stor förbättring, men Grok var inte bäst på svenska. ElevenLabs Scribe v2 nådde 5,43 i samma mätning. Resultatet kommer dessutom från xAI:s eget test och bör inte jämställas med en oberoende jämförelse.
Skillnaden mellan språken är stor. Den nya versionen nådde drygt 2 procent på italienska och kinesiska, men 11,75 på norska och 17,05 på danska. Den kan automatiskt upptäcka språk och enligt xAI även följa språkbyten mitt i en inspelning.
Svenska är ett av 25 språk där utvecklaren kan ange en språkkod för att få talade nummer, valutor och måttenheter formaterade som skriven text. För svenska används koden sv.
Så anropar en utvecklare tjänsten
Inspelade filer skickas med en POST-begäran till https://api.x.ai/v1/stt. Direktsänt ljud använder wss://api.x.ai/v1/stt, alltså samma sökväg via en WebSocket-anslutning.
Detta är xAI:s eget exempel för en inspelad fil:
curl -X POST https://api.x.ai/v1/stt \
-H "Authorization: Bearer $XAI_API_KEY" \
-F model=grok-voice-transcribe-2.0 \
-F format=true \
-F language=en \
-F "keyterm=Understand The Universe" \
-F file=@audio.mp3
Svaret kommer tillbaka som strukturerad JSON med bland annat utskriften, identifierat språk, ljudets längd och tidsuppgifter för orden. Vid direktsänt ljud skickar servern både preliminära textavsnitt och det färdiga resultatet. Fler inställningar och gränser finns i xAI:s dokumentation för tal till text.
Grok Voice Transcribe 2.0 märker upp talare och viktiga ord
Funktioner som följer med:
- Tidsstämplar för varje ord.
- Automatisk märkning av olika talare.
- Separat utskrift av upp till åtta ljudkanaler.
- Högst 100 nyckelord för exempelvis produktnamn och facktermer.
- Automatisk borttagning av utfyllnadsord.
- Identifiering av när en person har talat färdigt.
En ljudfil får vara högst 500 megabyte. Någon maximal speltid anges inte.
Atlassian använder tekniken för utskrifter av Loom-videor och uppger att den gav bättre resultat än företagets tidigare lösning. Ett möjligt arbetsflöde är att spela in en genomgång i Loom, göra text av inspelningen och låta ett kodverktyg använda instruktionerna.
Vad kostar Grok Voice Transcribe 2.0?
Priset är oförändrat jämfört med föregångaren: 0,10 dollar per ljudtimme via det vanliga API-anropet och 0,20 dollar per timme för ett direktsänt ljudflöde. Märkning av talare, tidsstämplar och nyckelord medför enligt lanseringsinlägget ingen extra avgift. De två konkurrenter xAI ställer upp bredvid sig är dyrare: ElevenLabs Scribe v2 på 0,22 och 0,39 för samma två användningssätt, Deepgram Nova-3 på 0,26 och 0,46.
Dokumentationen säger två olika saker om standardversionen
xAI:s egna sidor ger motstridiga besked om vilken version som används när utvecklaren utelämnar modellnamnet. Guiden för tal till text pekar ut 2.0 som standard, medan versionshistoriken fortfarande anger 1.0.
Utvecklare bör därför ange grok-voice-transcribe-2.0 uttryckligen. xAI säger att föregångaren ska fasas ut under de kommande veckorna, men har inte publicerat något slutdatum.
Svenska stöds, men någon EU-region finns inte
Dokumentationen anger ingen särskild begränsning för svenska användare. Tjänsten är dock avsedd för utvecklare och företag som använder xAI:s API. Företaget beskriver ingen motsvarande funktion för att ladda upp och skriva ut filer direkt i den vanliga Grok-appen.
För svenska verksamheter är behandlingen av ljuddata en separat fråga. Röst-API:t använder xAI:s globala anslutning. Företagets särskilda USA-anslutning hanterar inte rösttjänster, och det finns ingen dokumenterad EU-anslutning eller garanti om att ljud och utskrifter stannar inom EU. Hur länge inskickat ljud och färdig text sparas framgår inte heller av xAI:s sidor. Organisationer som arbetar med kundsamtal, möten eller annat ljud med personuppgifter behöver därför bedöma dataskyddskraven innan tjänsten tas i bruk.
Vanliga frågor om Grok Voice Transcribe 2.0
Måste en utvecklare ange att ljudet är på svenska?
Nej, Grok Voice Transcribe 2.0 upptäcker språket automatiskt och kan följa språkbyten mitt i en inspelning. Språkkoden sv används bara för att formatera talade nummer, valutor och måttenheter som skriven text.
Källor
- Introducing Grok Voice Transcribe 2.0
xAI, hämtad
- Speech to Text
xAI, hämtad
- Pricing
xAI, hämtad
- Release notes
xAI, hämtad
- Regional endpoints
xAI, hämtad
- Speech to Text Leaderboard: Streaming
Artificial Analysis, hämtad
- Speech to Text Leaderboard: Non-streaming
Artificial Analysis, hämtad
- Speech to Text Benchmarking Methodology
Artificial Analysis, hämtad
Thomas Karlsson
Huvudredaktör, AI expert och journalist
Thomas bevakar generativ AI, språkmodeller och verktygen som förändrar hur vi arbetar. Han skriver för dig som vill förstå utvecklingen utan att redan kunna tekniken.