# Gemini 3.5 Transcribe: Googles nya tal till text

> Google lanserar Gemini 3.5 Transcribe, tal till text med stöd för svenska. Två modeller för ljudfiler och direktsändning, funktioner, precision och pris.

Publicerad: 2026-08-26  
Skribent: Thomas Karlsson  
Sajt: Aipress.se  
URL: https://aipress.se/nyheter/gemini-3-5-transcribe/

Google har lanserat två Gemini-modeller som omvandlar tal till text. Den ena skriver ut innehållet i färdiga ljudfiler, medan den andra textar direkt under pågående samtal. Båda stöder svenska och kan användas av utvecklare i Sverige.

Modellerna heter `gemini-3.5-transcribe` och `gemini-3.5-transcribe-live`. Googles källor ger dock olika besked om deras status. I Gemini API:s ändringslogg står att modellerna blev allmänt tillgängliga, så kallat GA, den 26 augusti 2026. I [Googles blogginlägg om lanseringen](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/) från samma dag beskrivs Gemini 3.5 Transcribe i stället som en publik förhandsversion i Gemini API. Det går därför inte att utifrån informationen slå fast att modellen helt har lämnat teststadiet.

Gemini API är Googles gränssnitt för utvecklare. Företag kan använda modellerna för att bygga exempelvis mötesverktyg, diktafonappar, kundtjänstsystem och tjänster för undertextning.

## Gemini 3.5 Transcribe finns i två versioner

`gemini-3.5-transcribe` tar emot en inspelad ljudfil och lämnar tillbaka en utskrift. Den passar bland annat för intervjuer, föreläsningar, poddar och möten som ska skrivas ut i efterhand.

`gemini-3.5-transcribe-live` arbetar medan personen talar. Ljudet skickas löpande till Google och texten kommer tillbaka i små delar genom Gemini Live API. Det lämpar sig för direktextning, röstdiktering och andra funktioner där orden behöver visas innan inspelningen har avslutats.

| Funktion | Ljudfiler | Direktsänt ljud |
|---|---|---|
| Modell | `gemini-3.5-transcribe` | `gemini-3.5-transcribe-live` |
| Text visas | När filen har behandlats | Löpande medan personen talar |
| Längsta ljud | 60 minuter | 10 minuter per session |
| Skiljer mellan talare | Ja | Nej |
| Tidskod för varje ord | Ja | Nej |
| Anpassad ordlista | Ja | Ja |
| Automatisk språkidentifiering | Ja | Ja |

Modellen för ljudfiler klarar upp till en timmes ljud per anrop. Gränsen sjunker till 30 minuter om utvecklaren vill få tidskoder för varje ord eller låta modellen märka upp vem som säger vad.

Livesessioner kan pågå i högst tio minuter. Modellen skickar preliminär text medan någon fortfarande pratar och en slutlig version när talaren gör paus eller avslutar sitt yttrande. Den preliminära texten kan ändras när modellen får mer sammanhang, ungefär som automatiska undertexter som rättar de senaste orden i efterhand.

## Så anropar du Gemini 3.5 Transcribe

Ett minimalt exempel i Python laddar upp en ljudfil och skriver ut texten. Google AI Studio ger en API-nyckel som läggs i miljövariabeln `GEMINI_API_KEY`.

```python
from google import genai

client = genai.Client()

audio_file = client.files.upload(file="mote.mp3")

interaction = client.interactions.create(
    model="gemini-3.5-transcribe",
    input=[{"type": "audio", "uri": audio_file.uri, "mime_type": audio_file.mime_type}],
    generation_config={
        "transcription_config": {
            "language_codes": ["sv-SE"],
            "custom_vocabulary": ["Skatteverket", "Försäkringskassan"],
            "mode": {"type": "verbatim", "diarization_mode": "speaker"},
        }
    },
)

print(interaction.output_text)
```

Raden `language_codes` talar om att inspelningen är på svenska, `custom_vocabulary` är den egna ordlistan och `diarization_mode` slår på uppmärkningen av vem som talar. Tas hela `generation_config` bort identifierar modellen språket själv och lämnar en ordagrann utskrift utan talaretiketter.

## Hur exakt är Gemini 3.5 Transcribe?

Google kallar Gemini 3.5 Transcribe sin mest exakta tal-till-text-modell hittills. Enligt företagets egna uppgifter, med Artificial Analysis som mätare, har modellen en genomsnittlig ordfelsfrekvens på 2,6 procent för färdiga ljudfiler och 4,0 procent för direktsänt ljud. Ordfelsfrekvens, ofta förkortat WER efter engelskans *word error rate*, mäter hur många ord som har ersatts, utelämnats eller lagts till. Ett lägre värde är bättre.

På det flerspråkiga FLEURS-testet uppger Google en ordfelsfrekvens på 5,04 procent för färdiga ljudfiler och 5,50 procent för direktsänt ljud. De resultaten gäller ett urval stora språk och språkvarianter, inte svenska särskilt.

![Stapeldiagram med fyra staplar: Genomsnitt Ljudfil 2,6 procent och Live 4,0 procent, FLEURS Ljudfil 5,04 procent och Live 5,50 procent, med texten Lägre är bättre](https://aipress.se/images/posts/gemini-3-5-transcribe-ordfelsfrekvens.webp)

Föregångaren heter Chirp 3. Google uppger att Gemini 3.5 Transcribe både ger färre ordfel och arbetar snabbare än den modellen. Tiden från tal till färdigställd text ska enligt företaget ha blivit 70 procent kortare, även det mätt av Artificial Analysis.

Testresultaten ger en bild av modellens prestanda under bestämda förhållanden, men säger inte hur väl den fungerar i varje enskild situation. Mikrofon, dialekt, överlappande röster, facktermer och bakgrundsljud kan påverka resultatet.

## Fungerar Gemini 3.5 Transcribe på svenska?

Gemini 3.5 Transcribe stöder fler än 85 språkvarianter. Svenska finns uttryckligen med som `sv-SE`, och Gemini API samt Google AI Studio är tillgängliga i Sverige.

Modellerna kan själva identifiera vilket språk som talas och hantera språkbyten mitt i ett samtal. Det kan vara användbart när en svensk mening innehåller engelska produktnamn och fackuttryck. Om utvecklaren redan vet att inspelningen är på svenska går det att ange språket i förväg, vilket enligt Google kan förbättra träffsäkerheten.

Google uppger att modellerna är framtagna för olika accenter, bakgrundsljud och flerspråkiga samtal. De publicerade mätvärdena är däremot genomsnitt eller resultat för grupper av språk. Någon separat ordfelsfrekvens för svenska anges inte. Den som bygger en svensk tjänst behöver därför prova modellen med den typ av ljud som faktiskt ska behandlas.

## Gemini 3.5 Transcribe finns i flera Google-produkter

Vanliga användare kan möta tekniken utan att själva arbeta med Gemini API. På Android används den i Rambler, en ny dikteringsfunktion i Gboard som rensar bort utfyllnadsord och låter användaren redigera och ändra stil med rösten. Den finns även i Gemini-appen för macOS, men där endast på engelska.

Gemini 3.5 Transcribe används också i utvecklingsverktyget Google Antigravity, där modellen med användarens tillåtelse kan ta hänsyn till det som visas på skärmen och till tidigare chattmeddelanden. I byggläget i Google AI Studio går det att beskriva och skapa appar med rösten. Google planerar dessutom att föra in tekniken i Chrome, så att användaren kan diktera i textfält på webben, men den funktionen har ännu inte lanserats.

För svenska användare är utbudet mer begränsat. Googles supportsida för Rambler räknar upp arabiska, engelska, franska, tyska, hindi och flera andra indiska språk samt italienska, japanska, koreanska, portugisiska, ryska och spanska. Svenska finns inte med. Den som vill använda Gemini 3.5 Transcribe på svenska är därför i dag hänvisad till Gemini API eller tjänster som har byggt in modellen.

## Gemini 3.5 Transcribe känner igen facktermer och olika talare

Båda modellerna kan få en egen ordlista med sådant som personnamn, orter, produktnamn, förkortningar och termer från exempelvis vård, juridik eller teknik.

Google tillåter upp till 1 000 ord och fraser, men rekommenderar i praktiken en mer koncentrerad lista på omkring 100 poster för bästa resultat. En lång lista med vanliga ord kan göra styrningen mindre användbar.

Funktionen kan vara särskilt värdefull på svenska, där sammansatta ord samt namn på företag och myndigheter annars lätt misstolkas. En mötestjänst kan exempelvis få deltagarnas namn och projektets vanligaste facktermer innan utskriften börjar.

Vid behandling av en färdig ljudfil kan modellen även märka upp olika röster som exempelvis `spk_1` och `spk_2`. Dokumentationen anger stöd för upp till åtta talare, men tilldelningen av repliker vid tre eller fler personer betecknas som experimentell. I blogginlägget uttrycker sig Google försiktigare och skriver att tilldelningen fungerar för upp till tre talare. Modellen vet inte automatiskt vad deltagarna heter, utan skiljer i första hand rösterna åt med neutrala etiketter.

Det går också att få start- och sluttid för varje ord. Sådana tidskoder kan användas för att synkronisera undertexter, söka fram rätt ställe i en inspelning eller koppla en textrad till ljudet. Google varnar för att ordvisa tidskoder kan försämra själva transkriberingen något.

Varken talarseparering eller ordvisa tidskoder finns i livemodellen.

## Hur gör Gemini 3.5 Transcribe tal mer lättläst?

Modellerna har två sätt att skriva ut det som sägs. Standardläget återger talet så ordagrant som möjligt, inklusive utfyllnadsord, upprepningar och avbrutna meningar. Det passar när utskriften ska ligga nära originalinspelningen.

Det smarta läget bearbetar texten för läsning. Det kan ta bort hummanden, hantera självrättningar och lägga till stycken, skiljetecken och listor. Om någon säger ”vi ses på tisdag, nej förresten onsdag klockan två” kan utskriften ange den slutliga tiden utan att behålla hela rättelsen.

Bearbetningen är praktisk för anteckningar och utkast, men resultatet blir inte en exakt återgivning av ljudet. Vid journalistiska intervjuer, forskning, rättsliga ärenden eller andra sammanhang där varje formulering kan ha betydelse är det ordagranna läget säkrare. Utskriften bör ändå kontrolleras mot inspelningen innan den används som citat eller beslutsunderlag.

Det smarta läget för färdiga ljudfiler kan inte kombineras med talarseparering eller ordvisa tidskoder. Utvecklaren måste alltså välja mellan en rensad lästext och en mer detaljerad, ordagrann utskrift.

![En ljudvåg löper genom ett förstoringsglas: före linsen står vi ses på tisdag, eh, nej, och inne i linsen den rensade meningen Vi ses på onsdag klockan två](https://aipress.se/images/posts/gemini-3-5-transcribe-smart-lage.webp)

## Gemini 3.5 Transcribe Live textar medan du talar

Liveversionen tar emot ljud i små bitar genom en WebSocket-anslutning. Det är en teknik som låter appen och Googles servrar skicka information åt båda hållen utan att skapa en ny anslutning för varje ljudklipp.

Google rekommenderar monoljud med 16 000 mätningar per sekund och ljudbitar på omkring en tiondels sekund. Modellen kan själv känna av när någon börjar och slutar prata. En app kan också styra detta lokalt, exempelvis med en tryck-för-att-tala-knapp.

Liveströmmen innehåller både preliminär och fastställd text. Den preliminära versionen uppdateras snabbt under pågående tal och kan visas som direkttextning. När modellen bedömer att yttrandet är färdigt skickas en slutlig version som appen kan spara.

Google skiljer funktionen från en röststyrd AI-assistent. Transcribe Live lyssnar och skriver, men är inte avsedd att resonera kring innehållet eller svara med en egen röst.

## Vad kostar Gemini 3.5 Transcribe?

På den [kostnadsfria nivån i Gemini API](https://ai.google.dev/gemini-api/docs/pricing#gemini-3.5-transcribe) tar Google inte betalt för modellernas in- och utdata, men användningen omfattas av begränsningar.

För betalande kunder tar Google betalt per token, alltså per bit ljud in och per bit text ut. Google räknar med 25 ljudtoken per sekund in och 175 texttoken per minut ut, och anger själva vad det blir per minut. Priserna är i amerikanska dollar från Googles prissida den 26 augusti 2026.

| | `gemini-3.5-transcribe` (ljudfiler) | `gemini-3.5-transcribe-live` (direktsänt) |
|---|---|---|
| Ljud in, per miljon token | 2,00 dollar | 3,50 dollar |
| Text ut, per miljon token | 12,00 dollar | 21,00 dollar |
| Ljud in, omräknat per minut | 0,003 dollar | 0,005 dollar |
| Text ut, omräknat per minut | 0,002 dollar | 0,004 dollar |
| Sammanlagt per minut, Googles uppskattning | omkring 0,005 dollar | omkring 0,009 dollar |

En timmes mötesinspelning kostar alltså omkring 0,30 dollar att skriva ut, och tio minuters direkttextning omkring 0,09 dollar. Den faktiska debiteringen bygger på mängden ljud- och texttoken och kan därför variera beroende på hur mycket text inspelningen ger.

Google anger att innehåll på den kostnadsfria nivån kan användas för att förbättra företagets produkter. På den betalda nivån ska inskickat innehåll inte användas för det ändamålet. Den som behandlar kundsamtal, patientuppgifter, personalmöten eller annat känsligt material behöver ändå kontrollera avtal, laglig grund, lagring och åtkomst innan ljud skickas till en extern tjänst.
