# Gemini 3.6 Flash gör AI agenter billigare att köra

> Gemini 3.6 Flash och 3.5 Flash-Lite finns nu. Färre token per svar sänker priset för AI agenter. En tredje modell, Flash Cyber, stannar hos myndigheter.

Publicerad: 2026-07-23  
Skribent: Thomas Karlsson  
Sajt: Aipress.se  
URL: https://aipress.se/nyheter/gemini-3-6-flash-anvander-17-farre-token/

Google har släppt två nya Flash-modeller för utvecklare som behöver köra många AI-uppgifter snabbt och till rimlig kostnad. Den ena är tänkt som ett nytt vardagsval, den andra är byggd för stora mängder enklare jobb. Samtidigt presenterar bolaget en säkerhetsmodell som bara kommer att släppas till en begränsad krets.

## Samma jobb med färre token

Gemini 3.6 Flash tar över rollen som arbetshäst i Flash-serien. Jämfört med föregångaren 3.5 Flash ska modellen vara bättre på bland annat programmering, dokumentanalys och uppgifter där text, bilder, diagram eller andra sorters innehåll behöver hanteras samtidigt.

Den mest intressanta förändringen syns dock inte alltid i det färdiga svaret. Enligt Google använder 3.6 Flash i genomsnitt 17 procent färre utdatatoken än 3.5 Flash i Artificial Analysis Index. I vissa tester är skillnaden större. På programmeringstestet DeepSWE har tokenanvändningen minskat med upp till 65 procent.

Det kan låta som en ganska teknisk detalj, men tokenförbrukningen påverkar vad en AI-agent faktiskt kostar att driva. En agent som granskar dokument, letar efter information och sedan sammanställer en rapport kan behöva resonera i flera omgångar och använda olika verktyg längs vägen. Om modellen klarar samma uppgift med färre steg, kortare svar och färre verktygsanrop blir varje körning billigare.

Priset för Gemini 3.6 Flash är 1,50 dollar per miljon token som skickas in och 7,50 dollar per miljon token som modellen genererar. Indatapriserna är oförändrade jämfört med 3.5 Flash, medan priset för utdata har sänkts från 9 till 7,50 dollar.

Det är alltså inte en modell som bara ska svara kortare. Google uppger att den också har blivit bättre på att undvika onödiga resonemangsslingor, oönskade kodändringar och upprepade felsökningsförsök.

## Tydliga förbättringar inom kod och datorstyrning

På DeepSWE, som testar mer långvarigt arbete med mjukvaruutveckling, får Gemini 3.6 Flash ett resultat på 49 procent. Föregångaren nådde 37 procent. Även på MLE-Bench, ett test för maskininlärning och forskningsrelaterade uppgifter, är ökningen tydlig: från 49,7 till 63,9 procent.

Modellen har också blivit bättre på så kallad computer use, där AI:n arbetar direkt i ett grafiskt datorgränssnitt. Resultatet på OSWorld-Verified stiger från 78,4 till 83 procent. Datorstyrningen finns som ett inbyggt verktyg i Gemini API och Gemini Enterprise, vilket gör att utvecklare inte behöver bygga hela den delen på egen hand.

För vanligt kunskapsarbete är förbättringen mindre dramatisk, men fortfarande mätbar. På GDPval-AA v2 ökar resultatet från 1 349 till 1 421. Google lyfter bland annat fram arbete med dokument, finansiella rapporter, diagram och stora mängder data som lämpliga användningsområden.

Samtidigt finns det saker som utvecklare behöver hålla ett öga på. I Googles egen dokumentation står det att 3.6 Flash gärna kör diagnostiska skript innan modellen börjar ändra kod. Det kan ge bättre resultat vid komplicerade problem, men också leda till några extra steg när uppgiften egentligen är enkel. Mänskliga testare har dessutom föredragit tidigare modeller för vissa visuella layouter, trots att 3.6 Flash varit bättre på att få själva koden att fungera.

## Flash-Lite tar hand om volymjobben

Gemini 3.5 Flash-Lite är byggd med en annan prioritering. Här ligger fokus på låg fördröjning och hög kapacitet snarare än att varje enskild uppgift ska få modellens fulla uppmärksamhet.

Det gör den lämpad för exempelvis dokumentsortering, informationsutvinning, sökningar och underagenter som utför mindre delar av ett större arbetsflöde. Artificial Analysis har mätt hastigheten till omkring 350 utdatatoken per sekund, vilket gör Flash-Lite till den snabbaste modellen i Gemini 3.5-serien.

Priset är också betydligt lägre än för 3.6 Flash: 0,30 dollar per miljon indatatoken och 2,50 dollar per miljon utdatatoken. Båda modellerna har stöd för ett kontextfönster på en miljon token och kan lämna svar på upp till 64 000 token. De har även stöd för tänkandelägen och inbyggda verktyg, däribland datorstyrning.

Utvecklare kan själva välja hur mycket beräkningsarbete Flash-Lite ska lägga på en uppgift. De lägre nivåerna passar när stora mängder relativt enkla jobb behöver gå snabbt. Högre nivåer kan användas när modellen ska resonera i flera led eller när flera underagenter arbetar tillsammans.

Trots att Flash-Lite är den lättare modellen är den inte svag i alla jämförelser. På Terminal-Bench 2.1 ökar resultatet från 31 till 54 procent jämfört med 3.1 Flash-Lite. För lång kontext går resultatet på GDM-MRCR v2 från 60,1 till 72,2 procent, medan GDPval-AA v2 stiger från 642 till 1 140.

I ett par tester går 3.5 Flash-Lite även förbi den äldre Gemini 3 Flash. Den får 54,2 procent på SWE-Bench Pro, mot 49,6 procent för 3 Flash. På OSWorld-Verified är resultatet 74 procent jämfört med 65,1 procent.

Namnet Lite syftar därmed främst på kostnad och hastighet. Det betyder inte att modellen alltid presterar sämre.

## Säkerhetsmodellen får inte en öppen lansering

Den tredje modellen heter Gemini 3.5 Flash Cyber och har ett betydligt smalare användningsområde. Den bygger på 3.5 Flash men har anpassats för att hitta, kontrollera och laga säkerhetshål i kod.

Modellen används tillsammans med CodeMender, Googles agent för kodsäkerhet. Där kan flera Flash Cyber-agenter undersöka samma problem och sedan sammanställa sina resultat i en gemensam rapport. Enligt Google når kombinationen konkurrenskraftiga resultat på säkerhetstestet CyberGym.

Någon bred lansering är däremot inte planerad. Verktyg som kan hitta sårbarheter kan användas för att försvara system, men samma kunskap kan också utnyttjas för angrepp. Google tänker därför erbjuda modellen genom ett pilotprogram för myndigheter och utvalda partner. Tillgången ska ske via CodeMender.

För de flesta Gemini-användare kommer Flash Cyber alltså inte att dyka upp som ännu ett modellval i appen. Google vill först ge säkerhetsteam möjlighet att hitta och rätta kritiska brister utan att samtidigt sprida ett verktyg som kan missbrukas.

Även Gemini 3.6 Flash har fått skärpta säkerhetsskydd. Google pekar särskilt på risker kopplade till cyberangrepp samt kemiska, biologiska, radiologiska och nukleära hot. Modellen ska stå emot försök att kringgå skydden bättre än tidigare, men utan att neka lika många tillåtna frågor.

## Modellerna är redan tillgängliga

Gemini 3.6 Flash och Gemini 3.5 Flash-Lite lanserades den 21 juli 2026 och är nu allmänt tillgängliga för produktionsbruk. Utvecklare hittar dem i Gemini API via Google AI Studio och Android Studio. 3.6 Flash finns även i Google Antigravity.

Företagskunder får tillgång genom Gemini Enterprise Agent Platform, medan 3.6 Flash också finns i appen Gemini Enterprise. Båda modellerna går att använda i den vanliga Gemini-appen och Flash-Lite har börjat införas i Google Search.

Gemini 3.5 Pro befinner sig fortfarande i tester med utvalda partner. Google uppger att den ska släppas bredare när den är färdig. Bolaget har samtidigt inlett förträningen av Gemini 4.

Den mer omedelbara nyheten är ändå ekonomin. Gemini 3.6 Flash kostar mindre per genererad token än sin föregångare och behöver i genomsnitt färre token för att slutföra en uppgift. För en enskild fråga blir skillnaden kanske obetydlig. När tusentals AI-agenter körs om och om igen kan den bli desto större.
