Gemini 3.6 Flash gör AI agenter billigare att köra
Thomas Karlsson · Publicerad · 5 min
Gemini får två nya Flash modeller som ska göra AI agenter snabbare och billigare i drift. Samtidigt kommer en specialiserad cybermodell som ska hitta och laga sårbar kod, men den får en betydligt mer begränsad lansering.
Den nya modellen ska bära vardagsjobbet
Gemini 3.6 Flash ska bära det mesta av vardagsarbetet i Flash serien. Modellen ska prestera bättre än 3.5 Flash inom programmering, kunskapsarbete och multimodala uppgifter, alltså arbete med flera sorters innehåll som dokument, diagram och data.
Den stora förändringen är effektiviteten. Enligt Artificial Analysis Index använder 3.6 Flash 17 procent färre token i sina svar än 3.5 Flash. Det betyder att modellen använder ungefär fem token där föregångaren använde sex.
På vissa tester, däribland DeepSWE från Datacurve, har användningen av token minskat med upp till 65 procent. Modellen behöver också färre resonemangssteg och verktygsanrop för att klara arbetsflöden med flera moment.
Varför spelar det roll för dig? Tänk dig en AI agent som ska gå igenom en mapp med dokument, plocka ut siffror och skriva ett utkast till en rapport. Om modellen kan nå samma mål med färre steg och kortare svar slipper den tugga vidare i onödan.
Priset ligger på 1,50 dollar per miljon token som skickas in och 7,50 dollar per miljon token som modellen lämnar som svar. Det är ett lägre pris per utdatatoken än för 3.5 Flash och ska sänka kostnaden för varje uppgift som en AI agent utför.
Färre token är inte bara ett kortare svar. Här handlar det om att modellen ska ta en enklare väg genom jobbet.
Kod och datorarbete får ett lyft
Effektiviteten kommer tillsammans med bättre testresultat. På kodtestet DeepSWE når 3.6 Flash 49 procent, jämfört med 37 procent för 3.5 Flash. Den gör färre oönskade kodändringar och fastnar mer sällan i upprepade körningar.
På MLE Bench, som mäter arbete inom maskininlärningsforskning, stiger resultatet från 49,7 till 63,9 procent. För den som använder en modell som programmeringshjälp betyder det att 3.6 Flash både ska skriva bättre kod och behöva färre omtag.
Modellen har också blivit bättre på computer use, datoranvändning där AI:n arbetar med ett datorgränssnitt. Resultatet på OSWorld-Verified ökar från 78,4 till 83,0 procent.
Datoranvändning finns nu som ett inbyggt verktyg på klientsidan via Gemini API och Gemini Enterprise. Det gör att utvecklare inte behöver plocka ihop hela den delen själva när en agent ska utföra uppgifter över flera steg.
Även kunskapsarbete förbättras. På GDPval-AA v2 går resultatet från 1 349 till 1 421. Kunderna Hebbia och Harvey har särskilt lyft modellens förmåga att läsa dokument, analysera diagram och data samt skriva rapportutkast.
Flash-Lite väljer fart framför tyngd
Gemini 3.5 Flash-Lite riktar sig till uppgifter där låg fördröjning och hög kapacitet är viktigast, exempelvis agentsökningar och dokumentbehandling. Artificial Analysis mäter hastigheten till 350 utdatatoken per sekund, vilket gör den till den snabbaste modellen i 3.5 serien.
Priset är 0,30 dollar per miljon token in och 2,50 dollar per miljon token ut. Modellen ska samtidigt ge betydligt bättre kvalitet än 3.1 Flash-Lite.
Utvecklare kan ställa in olika nivåer av tänkande. De lägsta nivåerna prioriterar snabb och billig körning för stora mängder enklare uppgifter, medan högre nivåer kan användas när flera underagenter behöver arbeta genom en uppgift steg för steg.
Det är lite som att välja mellan snabbkassan och en bemannad disk. Du behöver inte använda den tyngsta processen när jobbet bara är att sortera och skicka vidare.
Flash-Lite får också datoranvändning som inbyggt verktyg. På Terminal-Bench 2.1 ökar resultatet från 31 till 54 procent jämfört med 3.1 Flash-Lite. För lång kontext går resultatet på GDM-MRCR v2 från 60,1 till 72,2 procent, medan GDPval-AA v2 stiger från 642 till 1 140.
På vissa tester slår den lättare modellen till och med Gemini 3 Flash. Flash-Lite når 54,2 procent mot 49,6 procent på SWE-Bench Pro och 74,0 mot 65,1 procent på OSWorld-Verified. Lite betyder alltså mindre resurskrävande, inte automatiskt mindre kapabel.
Cybermodellen hålls inom en mindre krets
Den tredje nyheten är Gemini 3.5 Flash Cyber, en modell som bygger på 3.5 Flash och har finjusterats för att hitta och laga säkerhetssårbarheter i kod. Den används tillsammans med säkerhetsagenten CodeMender.
I CodeMender arbetar flera Flash Cyber agenter ihop och lämnar en gemensam rapport. Kombinationen når konkurrenskraftiga resultat på cybersäkerhetstestet CyberGym, enligt uppgifterna bakom lanseringen.
Men den här modellen blir inte fritt tillgänglig. Eftersom tekniken både kan skydda och missbrukas ska den snart erbjudas enbart till myndigheter och betrodda partner genom CodeMender, inom ett pilotprogram med begränsad tillgång.
Tanken är att ge säkerhetsteamen ett försprång så att de kan hitta och laga kritiska sårbarheter innan de utnyttjas. För vanliga användare innebär det framför allt att cyberdelen inte kommer att dyka upp bredvid de andra modellerna i Gemini appen.
3.6 Flash har samtidigt fått förstärkta skydd för kemiska, biologiska, radiologiska och nukleära risker samt missbruk inom cyberangrepp. Modellen ska vara betydligt mer motståndskraftig mot jailbreaks, försök att kringgå dess skydd, utan att lika ofta neka användbara och tillåtna uppgifter.
Två modeller går att använda direkt
Gemini 3.6 Flash och 3.5 Flash-Lite finns tillgängliga från och med nu. Utvecklare kommer åt dem via Gemini API i Google AI Studio och Android Studio. 3.6 Flash finns dessutom i Google Antigravity.
Företag får modellerna genom Gemini Enterprise Agent Platform, medan 3.6 Flash också finns i appen Gemini Enterprise. För övriga användare finns båda via Gemini appen, och Flash-Lite rullas även ut i Google Search.
Gemini 3.5 Pro testas med partner och ska släppas brett när modellen är redo. Förträningen av Gemini 4 har också startat i det mest ambitiösa träningsförsöket hittills.
Det bekräftade här och nu är mer konkret. Gemini 3.6 Flash finns redan att använda, kostar mindre per utdatatoken än 3.5 Flash och behöver 17 procent färre token i Artificial Analysis Index. Det är skillnaden mellan en AI agent som bara kan göra mer och en som också slösar mindre på vägen.