# Google lanserar Gemini 3.7 Flash: snabbare utvecklingstakt, bättre kodning och lägre pris

> Google släpper Gemini 3.7 Flash bara tre veckor efter 3.6. Bättre kodning, dokumentanalys och agentflöden, till halva ordinarie prisnivån under introduktionen.

Publicerad: 2026-08-14  
Skribent: Thomas Karlsson  
Sajt: Aipress.se  
URL: https://aipress.se/nyheter/google-lanserar-gemini-3-7-flash/

Google presenterar Gemini 3.7 Flash, en ny modell som främst riktar sig till utvecklare, företag och användare som bygger AI-agenter. Modellen kommer bara tre veckor efter Gemini 3.6 Flash och beskrivs som den hittills mest intelligenta arbetsmodellen i Flash-serien.

Den korta tiden mellan versionerna säger en del om hur Google numera arbetar med Gemini. I stället för att vänta på större generationsskiften kan företaget föra in förbättringar löpande, baserat på utvecklares återkoppling och nya algoritmiska framsteg. Gemini 3.7 Flash är därför ingen helt fristående modell. Den bygger vidare på 3.6 Flash, men har fått en uppdaterad grund för resonemang och bättre förmåga att hantera längre, mer sammansatta arbetsflöden.

De tydligaste förbättringarna finns inom programmering, webbutveckling, dokumentanalys och agentbaserad automatisering. Samtidigt introduceras modellen till ett pris som ligger på hälften av den ordinarie prisnivå som Google anger för Gemini 3.6 Flash.

## En Flash-modell för uppgifter som kräver mer resonemang

Flash-serien har traditionellt placerats mellan de allra minsta modellerna och de tyngsta Pro-alternativen. Tanken är att modellen ska vara tillräckligt snabb och billig för att användas i stor skala, utan att ge upp för mycket när arbetsuppgifterna blir komplicerade.

Med Gemini 3.7 Flash försöker Google flytta den balansen ytterligare. Modellen ska kunna lägga mer arbete på planering, verktygsanrop och uppgifter som består av många beroende steg. Den kan också anpassa hur mycket beräkning som används för resonemang. Utvecklare får därmed möjlighet att väga kvalitet mot svarstid och kostnad beroende på vilket system de bygger.

En enklare förfrågan kan hanteras med låg fördröjning, medan en kodningsagent eller dokumentanalys kan tillåtas att resonera mer utförligt. Den här flexibiliteten är särskilt relevant i produktionsmiljöer, där varje extra sekund och varje token påverkar både användarupplevelsen och den totala kostnaden.

Gemini 3.7 Flash tar emot text, bilder, ljud och video. Kontextfönstret är upp till en miljon tokens, vilket gör det möjligt att skicka in stora mängder material i samma arbetsflöde. Det kan exempelvis röra sig om en omfattande kodbas, en samling avtal, längre videoinnehåll eller flera dokument som behöver analyseras tillsammans.

Modellen lämnar text som resultat och kan generera upp till 64 000 tokens i ett svar.

## Betydande förbättringar inom programmering

Programmering är ett av områdena där skillnaden mot föregångaren märks tydligast. Google lyfter fram bättre resultat för felsökning, problemlösning och uppgifter där modellen behöver arbeta i en kodbas under längre tid.

På FrontierCode 1.1 Main, ett test som mäter kvaliteten på kod avsedd för produktionsmiljöer, når Gemini 3.7 Flash 43,6 procent. Gemini 3.6 Flash fick 34,4 procent i samma test. Den nya modellen ligger därmed även något över Claude Sonnet 5 och GPT-5.6 Terra i just denna utvärdering, enligt Googles redovisade siffror.

I DeepSWE v1.1, som fokuserar på mer långvarigt arbete inom mjukvaruutveckling, får Gemini 3.7 Flash 65,3 procent. Föregångaren ligger på 48,6 procent i modellkortets jämförelse. GPT-5.6 Terra når högre med 69,6 procent, men kostar samtidigt betydligt mer per token enligt Googles pristabell.

Resultaten i Terminal-bench pekar åt samma håll. I version 2.1, som mäter agentbaserad kodning i en terminalmiljö, får 3.7 Flash 85,8 procent mot 78,0 procent för 3.6 Flash. I det nyare och svårare Terminal-bench 3.0 stiger resultatet från 5,4 till 14,9 procent.

Det betyder inte att modellen alltid kan slutföra avancerade utvecklingsprojekt på egen hand. Googles egen säkerhetsbedömning konstaterar tvärtom att 3.7 Flash klarar enskilda kodningsuppgifter men fortfarande saknar den självständighet som behövs för att koppla ihop dem till ett helt forsknings- eller utvecklingsflöde utan mänsklig hjälp.

För vanlig systemutveckling är förbättringen ändå relevant. En modell som hittar fler fel vid första försöket, förstår instruktioner bättre och återhämtar sig när ett angreppssätt misslyckas kan minska antalet manuella korrigeringar. Det är ofta där den praktiska tidsvinsten finns: inte i att modellen skriver varje kodrad själv, utan i att utvecklaren slipper börja om lika många gånger.

## Webbutveckling med färre omgångar

Gemini 3.7 Flash har också förbättrats för webbutveckling och generering av användargränssnitt. Google uppger att modellen kan skapa mer funktionella layouter och mer kompletta applikationer med färre instruktioner.

Den kan utgå från flera typer av visuella referenser. Det kan vara en skärmbild, en vanlig bild eller ett helt designsystem med regler för färger, typografi, komponenter och avstånd. Målet är att den genererade sidan inte bara ska likna förlagan ytligt, utan även följa dess struktur och beteende.

På Arena.ai:s WebDev Arena får modellen ett Elo-resultat på 1 588, jämfört med 1 538 för Gemini 3.6 Flash. I tabellen i Googles modellkort ligger 3.7 Flash också över de jämförda resultaten för Claude Sonnet 5, GPT-5.6 Terra och Muse Spark 1.2.

Det här kan vara användbart för allt från snabba prototyper till komponenter som senare ska föras in i en större produkt. Skillnaden mellan en visuellt trovärdig demo och kod som går att arbeta vidare med är dock stor. Googles fokus på funktionsgrad och kod för produktionsmiljöer tyder på att företaget vill flytta Flash-serien närmare det senare.

## Starkare agentfunktioner och bättre verktygsanvändning

Gemini 3.7 Flash är utvecklad med agentbaserade arbetsflöden i åtanke. En agent behöver kunna göra mer än att svara på en fråga. Den måste tolka ett mål, dela upp arbetet, välja rätt verktyg, genomföra åtgärder och kontrollera om resultatet blev rimligt.

Google beskriver 3.7 Flash som mer uthållig när den stöter på hinder. Den ska i högre grad kunna byta strategi, ställa en förtydligande fråga när användarens avsikt är oklar och följa detaljerade instruktioner genom hela arbetsprocessen. Modellen lägger också mer beräkning på planering och på att avgöra när externa verktyg ska användas.

I AutomationBench, som testar automatisering av verklighetsnära arbetsflöden på företag, når modellen 30,4 procent. Gemini 3.6 Flash fick 17,0 procent. I Googles jämförelse ligger Claude Sonnet 5 på 10,7 procent och GPT-5.6 Terra på 23,6 procent.

På OSWorld 2.0, där en modell ska använda datorgränssnitt som en agent, får 3.7 Flash 47,9 procent. Resultatet är klart bättre än föregångarens 33,8 procent, men strax under GPT-5.6 Terras 50,2 procent.

Agent’s Last Exam visar en mer begränsad förbättring. Där får modellen 26,3 procent, jämfört med 24,2 procent för 3.6 Flash. Claude Sonnet 5 ligger högst i den redovisade jämförelsen med 33,3 procent.

Bilden är alltså inte att 3.7 Flash leder i varje agenttest. Däremot tycks modellen ha tagit ett tydligt steg framåt i arbetsflöden där verktyg, kod och företagsdata behöver kombineras.

## Dokument, juridik och kunskapsintensiva områden

En annan viktig del av lanseringen handlar om arbete med stora och komplicerade dokument. Google pekar särskilt ut finans, juridik och biovetenskap som områden där modellen har blivit mer träffsäker.

I GDP.pdf, ett test av hur väl AI-modeller förstår expertmaterial i PDF-format, får Gemini 3.7 Flash 34,0 procent. Gemini 3.6 Flash når 22,0 procent, Claude Sonnet 5 får 28,0 procent och GPT-5.6 Terra 24,7 procent.

Resultatet är intressant eftersom PDF-dokument ofta är svårare än vanlig löptext. De kan innehålla tabeller, diagram, fotnoter, flera spalter och information som måste kopplas samman mellan olika sidor. För juridiska och finansiella arbetsflöden räcker det sällan att hitta ett enskilt textstycke. Modellen behöver förstå hur villkor, siffror och hänvisningar påverkar varandra.

På Harvey LAB-AA, som består av komplexa juridiska arbetsflöden, når Gemini 3.7 Flash 90,7 procent. Det är högre än 3.6 Flash på 85,1 procent och något högre än Claude Sonnet 5 på 90,1 procent.

I GDPval-AA v2, en bredare utvärdering av kunskapsarbete, får modellen Elo-resultatet 1 525. Där ligger den under Claude Sonnet 5, GPT-5.6 Terra och Muse Spark 1.2, men tydligt över Gemini 3.6 Flash på 1 422.

Resultaten visar att förbättringarna inte är helt jämnt fördelade. Gemini 3.7 Flash har blivit märkbart starkare på dokumentförståelse och vissa professionella arbetsflöden, men är inte bäst i samtliga tester av allmänt kunskapsarbete.

## Biovetenskap, expertresonemang och långa kontexter

Modellen har även utvärderats inom forskning och avancerat resonemang.

På HLE-Verified, som testar expertkunskaper över flera ämnesområden, når Gemini 3.7 Flash 53,6 procent. Föregångaren får 51,2 procent. Resultatet ligger även över Claude Sonnet 5 på 31,0 procent och GPT-5.6 Terra på 51,1 procent i Googles tabell.

I BioMysteryBench får modellen 87,1 procent på uppgifter som bedömts vara möjliga för människor att lösa och 43,5 procent på den svårare nivån. Claude Sonnet 5 är marginellt bättre i den första kategorin, medan GPT-5.6 Terra leder på de svåraste uppgifterna.

På LABBench2, som handlar om biologiska forskningsuppgifter från verkliga miljöer, får Gemini 3.7 Flash 82,1 procent. Det är bättre än 3.6 Flash på 76,1 procent och något högre än de redovisade resultaten för Claude Sonnet 5 och GPT-5.6 Terra.

För bearbetning av långa sammanhang når modellen 97,0 procent i GDM-MRCR v2 med åtta informationsbitar som ska hittas och kopplas samman i en kontext på i genomsnitt 128 000 tokens. Gemini 3.6 Flash får 91,8 procent.

Att en modell har ett kontextfönster på en miljon tokens betyder inte automatiskt att den använder all information lika tillförlitligt. Resultatet i långkontexttestet ger åtminstone stöd för att 3.7 Flash har blivit bättre på att hitta och förena relevant material i stora datamängder.

Modellen får även 85,4 procent i LVBench för förståelse av långa videor, jämfört med 84,2 procent för 3.6 Flash och 68,5 procent för Claude Sonnet 5 i samma redovisning.

## Diagram och visuell informationsanalys

I CharXiv Reasoning, som mäter förmågan att sammanföra information från komplicerade diagram, är resultaten mer blandade.

Utan verktyg får Gemini 3.7 Flash 84,5 procent. Det är marginellt lägre än föregångarens 85,2 procent och även lägre än GPT-5.6 Terras 85,9 procent. Med verktyg stiger resultatet till 88,7 procent, men Gemini 3.6 Flash ligger något högre på 89,4 procent.

Det är ett exempel på att en ny modellversion inte automatiskt förbättrar varje enskild egenskap. Den samlade kapaciteten har ökat, men några testresultat är oförändrade eller något svagare än för 3.6 Flash.

## Priset är en central del av lanseringen

Under introduktionsperioden kostar Gemini 3.7 Flash 0,75 dollar per miljon indatatokens och 3,75 dollar per miljon utdatatokens. Samma introduktionspris visas även för Gemini 3.6 Flash.

Priset gäller till och med den 31 december 2026. Från den 1 januari 2027 är den angivna prisnivån 1,50 dollar per miljon indatatokens och 7,50 dollar per miljon utdatatokens.

Jämfört med flera konkurrerande modeller är introduktionspriset lågt. I Googles tabell kostar Claude Sonnet 5 två dollar för indata och tio dollar för utdata per miljon tokens. GPT-5.6 Terra anges till två respektive tolv dollar, medan Muse Spark 1.2 kostar 1,25 respektive 4,25 dollar.

| Modell | Indata (per miljon tokens) | Utdata (per miljon tokens) |
| --- | --- | --- |
| Gemini 3.7 Flash, introduktionspris till 31 december 2026 | 0,75 dollar | 3,75 dollar |
| Gemini 3.7 Flash, från 1 januari 2027 | 1,50 dollar | 7,50 dollar |
| Claude Sonnet 5 | 2,00 dollar | 10,00 dollar |
| GPT-5.6 Terra | 2,00 dollar | 12,00 dollar |
| Muse Spark 1.2 | 1,25 dollar | 4,25 dollar |

Prisskillnaden märks särskilt i agentbaserade system. En agent kan göra flera modellförfrågningar för att planera, använda verktyg, kontrollera resultat och rätta fel. Kostnaden för ett enda svar säger därför inte så mycket om vad ett helt arbetsflöde kostar. Om en mer träffsäker modell även minskar antalet omförsök kan den faktiska besparingen bli större än skillnaden i tokenpris.

Samtidigt finns en annan sida av resonemanget: en modell som tillåts tänka längre kan förbruka fler tokens. Utvecklare behöver därför testa både kvalitet och total kostnad i sina egna system. Ett lågt listpris garanterar inte att varje arbetsflöde blir billigare.

## Gemini Spark byter till 3.7 Flash

Gemini 3.7 Flash blir också den nya modellen bakom Gemini Spark. Spark är Googles personliga AI-agent för abonnenter på Google AI Pro och Ultra och finns i fler än 160 länder.

Tjänsten presenterades vid Google I/O som en agent som kan arbeta dygnet runt på användarens uppdrag, men fortfarande under användarens kontroll. Med 3.7 Flash ska Spark bli bättre på kunskapsarbete och på att använda verktyg i Google Workspace.

Det kan handla om uppgifter som sträcker sig över flera program och kompetensområden: att läsa dokument, sammanställa information, hantera data och skapa ett färdigt resultat. Uppdateringen ska ge bättre precision och högre kvalitet när sådana uppgifter kräver flera steg.

Att Google lägger modellen i Spark visar också var företaget ser den praktiska användningen. 3.7 Flash är inte enbart tänkt som en modell som utvecklare anropar via ett API. Den ska fungera som motor i tjänster där en AI får större handlingsutrymme och arbetar under längre tid.

## Här blir Gemini 3.7 Flash tillgänglig

Utvecklare kan använda modellen genom Gemini API i Google AI Studio och Android Studio. Den finns också i Google Antigravity, där fokus ligger på arbetsflöden som byggs kring agenter.

För företagskunder distribueras modellen genom Gemini Enterprise Agent Platform och Gemini Enterprise-appen. Privatpersoner möter den genom Spark i Gemini-appen, förutsatt att de har ett Google AI Pro- eller Ultra-abonnemang och befinner sig i ett land där tjänsten stöds.

I modellkortet listas följande kanaler:

- Gemini-appen
- Gemini Enterprise-appen
- Gemini Enterprise Agent Platform
- Google AI Studio
- Gemini API
- Google Antigravity

Det krävs ingen särskild lokal hårdvara eller programvara för att använda modellen. Åtkomsten sker genom Googles tjänster och API:er enligt respektive användarvillkor.

## Arkitektur och träningsdata bygger vidare på 3.6 Flash

Google lämnar begränsat med nya tekniska detaljer om modellens arkitektur. Gemini 3.7 Flash är baserad på Gemini 3.6 Flash, och företaget hänvisar till modellkortet för 3.6 för mer information om arkitektur, träningsdata, databehandling, hårdvara och programvara.

Det som uttryckligen lyfts fram är algoritmiska förbättringar i modellens grundläggande resonemang. Lanseringen verkar därmed handla mer om hur modellen använder sin kapacitet än om en helt ny underliggande konstruktion.

Samma sak gäller träningsmaterialet. Google redovisar ingen separat fullständig beskrivning av datamängden för 3.7 Flash, utan hänvisar tillbaka till föregångaren. Det gör det svårt att utifrån modellkortet avgöra exakt hur mycket av förbättringen som kommer från nya data, efterträning, förändrad inferens eller andra optimeringar.

## Kunskapsgränsen varierar mellan olika områden

Den angivna kunskapsgränsen är mars 2026, men Google lägger till en viktig reservation. I vissa ämnesområden ska modellen ha information fram till detta datum, medan kunskapen inom andra delar kan vara begränsad till januari 2025, i linje med resten av Gemini 3-familjen.

Det betyder att modellen inte bör behandlas som en säker källa till aktuell information enbart utifrån den övergripande kunskapsgränsen. För nyheter, regler, priser, forskning och andra uppgifter som förändras snabbt behöver den använda externa informationskällor eller sökverktyg.

Det är särskilt viktigt i de kunskapsintensiva områden som Google själv lyfter fram. Finans, juridik och biovetenskap kräver ofta att informationen är aktuell och går att kontrollera. En starkare resonemangsförmåga minskar inte behovet av tillförlitliga källor.

## Hallucinationer och tekniska problem finns kvar

Gemini 3.7 Flash har samma grundläggande begränsningar som andra stora språkmodeller. Den kan hallucinera, alltså skapa felaktiga uppgifter eller slutsatser som låter övertygande. Google varnar också för tillfällig långsamhet och förfrågningar som avbryts på grund av tidsgränser.

Det här får större betydelse när modellen används som agent. Ett felaktigt svar i en chatt kan upptäckas och rättas av användaren. En felaktig slutsats i ett automatiserat arbetsflöde kan däremot påverka nästa steg, särskilt om modellen får använda externa verktyg eller genomföra åtgärder.

Utvecklare behöver därför bygga in kontrollpunkter. Det kan vara krav på källhänvisningar, validering av strukturerad data, tester av genererad kod, begränsade behörigheter och mänskligt godkännande innan känsliga åtgärder genomförs.

Google beskriver modellen som mer disciplinerad och i behov av mindre övervakning än 3.6 Flash. Det ska inte tolkas som att övervakning kan tas bort helt.

## Säkerhetsresultaten är överlag nära föregångaren

I Googles interna säkerhetstester presterar Gemini 3.7 Flash ungefär i nivå med Gemini 3.6 Flash när det gäller innehållssäkerhet, ton och obefogade avslag.

Resultaten är dock inte entydiga. I den automatiserade textbaserade säkerhetsutvärderingen försämras resultatet med 1,17 procentenheter, där ett lägre värde är bättre. I det flerspråkiga säkerhetstestet förbättras modellen med 0,48 procentenheter. För säkerheten vid tolkning av bilder till text syns ingen förändring.

Tonläget vid avslag försämras med 0,47 procentenheter enligt det automatiska testet. Antalet obefogade avslag ökar med 0,84 procentenheter, även där i ett mått där lägre är bättre.

Google framhåller att skillnaderna är små och att automatiserade säkerhetsutvärderingar kan ge falska positiva och falska negativa resultat. Material som flaggades granskades därför manuellt. Enligt företaget bestod de flesta försämringarna av felaktiga flaggningar eller innehåll som inte bedömdes som allvarligt.

Specialistgrupper utanför modellens utvecklingsteam har också genomfört manuell så kallad red teaming. Gemini 3.7 Flash klarade lanseringskraven för barnsäkerhet. För innehållssäkerhet i stort rapporterar Google likvärdiga eller bättre resultat än för 3.6 Flash, och granskningen hittade inga allvarliga problem som hindrade lanseringen.

## Förstärkta skydd inom CBRN och cyberangrepp

Google har utvärderat modellen enligt den version av företagets Frontier Safety Framework som publicerades i april 2026. Bedömningen omfattar bland annat kemiska, biologiska, radiologiska och nukleära risker, ofta sammanförda under förkortningen CBRN, samt cybersäkerhet, manipulation och AI-relaterad forskning.

Gemini 3.7 Flash bedömdes inte nå någon av de spårade trösklarna för kritisk kapacitet.

Inom CBRN visar modellen hög förmåga på vissa teoretiska områden, men bedöms sakna den detaljerade expertkunskap och praktiska handlingsnivå som krävs för att fullfölja de prioriterade skadescenarierna. Vid expertstyrda tester kunde vissa deltagare få fram korrekt och användbar information genom hela de testade förloppen. Det krävdes dock tydlig styrning från experter, och de genomsnittliga resultaten låg under Googles kritiska nivå.

På cybersäkerhetsområdet nådde modellen företagets varningsgräns för en kapacitetsnivå, men inte den kritiska tröskeln. Google skickar därför modellen med uppdaterade skydd mot cyberrelaterat missbruk.

Modellen uppvisar även viss förmåga att påverka människors uppfattningar och beteenden i direkta samtal. Den samlade effekten låg under varningsnivån för skadlig manipulation, men Google påpekar att en testmiljö inte nödvändigtvis lockar fram all kapacitet. Missbruk kan dessutom skalas upp av en angripare.

## Modellen kan förstå att den testas, men inte kringgå begränsningarna

En av de mer ovanliga delarna av säkerhetsbedömningen gäller situationsmedvetenhet. Gemini 3.7 Flash visade sig vara tillräckligt observant för att i vissa fall förstå att den befann sig i en testmiljö.

Den lyckades däremot inte använda denna insikt för att kringgå testernas begränsningar. På tester av dolt beteende presterade modellen ungefär i nivå med Gemini 3.1 Pro, medan situationsmedvetenheten var starkare.

Google bedömer också att modellen kan lösa fristående programmeringsuppgifter men inte självständigt sätta samman dem till ett komplett forskningsflöde från början till slut. Den nådde därför varken tröskeln för accelererad AI-forskning eller för avancerad automatisering.

Företaget planerar att publicera en separat och mer utförlig Frontier Safety Framework-rapport för Gemini 3.7 Flash.

## Ett tydligt steg framåt, men inte en universell vinnare

Gemini 3.7 Flash framstår framför allt som en praktiskt inriktad uppgradering. Den har fått bättre resultat inom kodning, långvarigt utvecklingsarbete, PDF-förståelse, juridiska uppgifter och automatisering av företagsprocesser. Förmågan att följa instruktioner och hantera verktyg ska också ha förbättrats, vilket är centralt för agentbaserade system.

Samtidigt är testbilden mer nyanserad än lanseringens huvudbudskap. Modellen leder inte i alla jämförelser. GPT-5.6 Terra ligger exempelvis högre i vissa svåra kodnings- och resonemangstester, medan Claude Sonnet 5 har bättre resultat i delar av agentutvärderingarna. På några områden är 3.7 Flash endast marginellt bättre än 3.6 Flash, och i enstaka tester något sämre.

Modellens starkaste argument är därför kombinationen av kapacitet, multimodalt stöd, lång kontext och pris. Under introduktionsperioden får utvecklare tillgång till en modell som i flera relevanta tester närmar sig eller passerar betydligt dyrare alternativ.

Det är också tydligt att Google ser Flash som mer än ett snabbt budgetval. Med Gemini 3.7 Flash försöker företaget göra serien till ett rimligt förstahandsalternativ för produktionssystem, särskilt sådana där en modell ska skriva kod, använda verktyg, läsa stora dokument och genomföra uppgifter i många steg.

För utvecklare blir den avgörande frågan hur resultaten ser ut utanför standardiserade tester. Om modellen verkligen behöver färre omförsök, följer instruktioner mer konsekvent och klarar längre arbetsflöden med mindre handpåläggning kan uppgraderingen få stor praktisk betydelse. Om inte, är den fortfarande en billigare och på flera områden tydligt bättre version av 3.6 Flash.

Gemini 3.7 Flash är tillgänglig från lanseringen genom Googles utvecklar- och företagstjänster. Den börjar samtidigt användas i Gemini Spark för berättigade Google AI Pro- och Ultra-abonnenter.
