Tidigare behandlade Gemini normalt videor genom att plocka ut bildrutor med en fast takt, som standard en bild per sekund. Hela materialet lades sedan in i modellens sammanhang tillsammans med ljud och tidsstämplar. Metoden fungerar, men kan förbruka stora mängder token när filmen är lång. Token är de små enheter som tjänsten använder för att mäta hur mycket material modellen behandlar och därmed vad användningen kostar.
I det nya läget styr modellen själv granskningen. Den kan söka i tidslinjen, läsa transkriptionen och återvända till intressanta avsnitt med högre bildfrekvens eller upplösning. Enligt lanseringsinlägget kan detta minska tokenförbrukningen med upp till 88 procent och kostnaden med upp till 66 procent.
Lanseringen skedde den 1 september 2026 för Gemini 3.7 Flash, Gemini 3.6 Flash och Gemini 3.5 Flash-Lite.
AI:n söker i videon efter svaret
Ordet agentisk betyder här att Gemini får använda ett inbyggt verktyg för att navigera i videon. Modellen bedömer vilka delar som behöver undersökas, hämtar dem och fortsätter resonera utifrån resultatet.
Om frågan gäller de viktigaste beskeden i en två timmar lång presentation kan Gemini börja med transkriptionen och därefter öppna avsnitten där nya produkter eller beslut nämns. Den behöver inte läsa in en bildruta från varje sekund av hela inspelningen.
En fråga om en snabb rörelse kräver en annan metod. Modellen kan då granska ett kort tidsintervall med fler bildrutor för att fånga något som annars hade hamnat mellan två stillbilder.
Företaget lyfter fram fyra användningsområden:
- hitta mycket korta händelser och exakta klippgränser
- söka efter specifika uppgifter i flera timmar långa inspelningar
- upptäcka avvikelser och ovanliga rörelser
- räkna handlingar eller följa föremål genom en film
Tekniken kan exempelvis användas för att söka i föreläsningar, sammanfatta videomöten, kontrollera industrifilm eller hitta lämpliga klipp för videoredigering.
Stora besparingar i Googles egna tester
De två som skrivit inlägget, produktchefen Rohan Doshi och forskningschefen Mario Lucic, sammanfattar nyheten så här i ingressen:
Our new agentic feature for video analysis cuts token consumption by up to 88%, reduces costs by up to 66%, and boosts quality by up to 7%.
Det betyder att de tre talen mäter tre olika saker, och att vart och ett är det högsta värde som uppmätts i något enskilt prov, inte ett genomsnitt.
Gemini 3.7 Flash förbrukade färre token med agentisk bearbetning än med det statiska standardläget i samtliga tre tester.
Tabellen visar antalet token per fråga.
| Test | Vad testet mäter | Statiskt läge | Agentiskt läge | Minskning |
|---|---|---|---|---|
| Minerva | komplext resonemang | 80 900 | 33 600 | 58,4 procent |
| 1H-VideoQA | förståelse av lång video | 397 600 | 47 700 | 88,0 procent |
| LVBench | förståelse av lång video | 300 300 | 36 000 | 88,0 procent |
Träffsäkerheten ökade samtidigt, men förbättringen varierade tydligt mellan testerna.
| Test | Statiskt läge | Agentiskt läge | Relativ förbättring |
|---|---|---|---|
| Minerva | 73,7 procent | 79,0 procent | 7,2 procent |
| 1H-VideoQA | 87,5 procent | 88,5 procent | 1,1 procent |
| LVBench | 85,1 procent | 88,6 procent | 4,1 procent |
Siffrorna på 88 respektive 7 procent är alltså de bästa resultaten i var sin kategori, inte genomsnitt eller något som gäller varje videofråga.
I jämförelsediagrammet för 1H-VideoQA ställs Gemini 3.7 Flash även mot GPT 5.6 Terra, GPT 5.6 Sol, Claude Opus 5.0 och Grok 4.6. Där placerar företaget sin egen modell bäst sett till kombinationen av träffsäkerhet och kostnad.
Alla mätningar har utförts av Google, och någon oberoende bekräftelse av resultaten har ännu inte presenterats.
Funktionen finns i Sverige via API och AI Studio
Agentisk videoförståelse finns från lanseringsdagen i Gemini API genom Google AI Studio och i Gemini Enterprise Agent Platform. Både API:t och AI Studio är tillgängliga i Sverige enligt företagets lista över regioner. Användaren måste vara minst 18 år för att använda AI Studio, och åldern kan behöva verifieras på Google-kontot.
Det nya läget fungerar med uppladdade videofiler och offentliga YouTube-videor. Stödet för YouTube-länkar är fortfarande en förhandsversion. Privata och olistade filmer kan inte användas.
Detta är inledningsvis ett verktyg för utvecklare. Den vanliga Gemini-appen har ännu inte fått samma möjlighet. Agentisk videoförståelse ska senare komma till appens Flash- och Flash-Lite-modeller, men något datum har inte angetts. Tekniken ska även användas i Ask YouTube under de kommande månaderna.
En svensk användare kan alltså prova läget nu i AI Studio eller bygga in det i en egen tjänst. Den som enbart använder Gemini som vanlig chattbot behöver vänta på den kommande utrullningen.
Så aktiveras det agentiska läget
Statiskt läge är fortfarande standard. En utvecklare måste därför välja agentisk bearbetning för den aktuella videon.
I Python anges inställningen processing med värdet agentic:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
},
{
"type": "text",
"text": "Vilka är de tre viktigaste beskeden i presentationen?"
}
]
)
print(interaction.output_text)
Det går att skicka in flera filmer och välja olika bearbetning för varje video. En lång föreläsning kan exempelvis granskas agentiskt medan ett kort experiment behandlas statiskt.
Utvecklaren kan kontrollera att rätt läge användes genom att läsa stegen i svaret. Stegen processing_call och processing_result visar att modellen har begärt och tagit emot ett videoavsnitt, ljud eller en del av transkriptionen.
Statiskt läge passar fortfarande vissa filmer bättre
Agentisk bearbetning är främst avsedd för långa videor. På klipp under fem minuter kan modellens planering och extra verktygsanrop göra att det tar något längre tid innan svaret börjar visas.
Statiskt läge rekommenderas därför när svarstiden är känslig eller när hela klippet måste granskas bildruta för bildruta. Bara det statiska alternativet låter utvecklaren välja ett bestämt tidsintervall eller ställa in en egen fast bildfrekvens.
Gränserna för videofiler beror på hur de skickas in. File API tar emot filer på upp till 2 GB på gratisnivån och 20 GB på betalnivån. Modeller med ett kontextfönster på en miljon token kan normalt behandla upp till tre timmars video med låg medieupplösning eller en timme med hög upplösning.
För YouTube gäller högst åtta timmars video per dygn på gratisnivån. Betalnivån har ingen motsvarande gräns baserad på speltid. Högst tio videor kan skickas i samma anrop.
Fler begränsningar och exempel finns i dokumentationen om videoförståelse.
Vad kostar agentisk videoförståelse?
Funktionen har ingen egen avgift. Den vanliga prissättningen för den valda Gemini-modellen gäller.
Gemini 3.7 Flash och 3.6 Flash kostar på betalnivån 0,75 dollar per miljon indatatoken och 3,75 per miljon utdatatoken till och med den 31 december 2026. Därefter fördubblas priserna. Gemini 3.5 Flash-Lite ligger på 0,30 respektive 2,50 för samma mängd.
Alla tre modellerna har även en gratisnivå. Där kostar in- och utdata inget, men innehållet kan användas för att förbättra företagets produkter. På betalnivån används materialet inte för det ändamålet.
Ett räkneexempel gör det konkret. En timmes inspelning motsvarar i standardläget omkring 360 000 token. Med introduktionspriset ovan blir det ungefär 0,27 dollar för att skicka in den. Med den största kostnadsminskning som redovisas hamnar samma timme på ungefär nio cent. Uträkningen är vår egen och bygger på de takter och andelar som anges ovan.
Att förbrukningen krymper mer än priset har en förklaring värd att känna till. En del av det som blir kvar är själva letandet i filmen, och sådant arbete bokförs som utdata. Utdata kostar fem gånger så mycket som indata, så en minskning i antal ger alltid en mindre minskning på fakturan.
Vinsten blir mindre på korta klipp. Den som ska budgetera behöver därför mäta på sitt eget underlag i stället för att räkna med den högsta siffran i tabellerna ovan.
Thomas Karlsson
Huvudredaktör, AI expert och journalist
Thomas bevakar generativ AI, språkmodeller och verktygen som förändrar hur vi arbetar. Han skriver för dig som vill förstå utvecklingen utan att redan kunna tekniken.