# Grok 4.7 billigare än GPT-6 Astra men långsammare

> Aipress testar xAI:s nya modell på vardagsuppgifter, svenskt korrektur och programmering. Den klarar alla sju uppgifter men två av tre spel kraschar.

Publicerad: 2026-09-22  
Skribent: Thomas Karlsson  
Sajt: Aipress.se  
URL: https://aipress.se/nyheter/grok-4-7/

xAI har lanserat Grok 4.7, en ny AI-modell för programmering, dokument och annat kunskapsarbete. I Aipress test klarade modellen alla sju vardagsuppgifterna och kostade mindre än hälften så mycket som GPT-6 Astra. Grok tog däremot nästan tre gånger så lång tid och använde betydligt fler tanketoken.

[Grok 4.7](https://x.ai/news/grok-4-7) bygger enligt xAI, som nu använder namnet SpaceXAI, på en större grundmodell än föregångaren Grok 4.6. Träningen har inriktats mer på uppgifter som tar lång tid att genomföra, och modellen ska ha blivit bättre på att kontrollera sitt eget arbete och hantera långa samtal.

Modellen kan läsa text och bilder och använda verktyg för bland annat webbsökning, kodkörning och funktionsanrop. Kontextfönstret rymmer 500 000 token. Kunskapsgränsen är maj 2026.

## Aipress testade Grok 4.7 på sju vardagsuppgifter

Aipress testade Grok 4.7 genom xAI:s API från Sverige under lanseringsdygnet den 21 till 22 september. Modellen fick rätta ett svenskt kundmejl, hitta programfel, tolka ett kvitto och en prislista, använda ett väderverktyg samt skapa underlag till en Excel-fil och en PowerPoint-presentation.

Alla sju uppgifter kördes en gång på tankenivån medium. Resultaten jämfördes med tidigare körningar där GPT-6 Astra hade fått samma instruktioner och samma nivå.

| Uppgift | Grok 4.7 | Tid | Kostnad |
|---|---|---:|---:|
| Rätta sju fel i ett svenskt kundmejl | 7 av 7 | 43,7 sekunder | 0,0217 dollar |
| Hitta två fel i Python-kod | 2 av 2 | 9,0 sekunder | 0,0040 dollar |
| Göra ett ICA-kvitto till JSON | Godkänd | 25,5 sekunder | 0,0132 dollar |
| Kontrollera vädret för två orter | Godkänd | 4,8 sekunder | 0,0071 dollar |
| Läsa en prislista på ett foto | Godkänd | 5,4 sekunder | 0,0043 dollar |
| Skapa en månadsbudget i Excel | 9 av 9 krav | 219,1 sekunder | 0,1037 dollar |
| Skapa en PowerPoint-presentation | 10 av 10 krav | 181,9 sekunder | 0,0743 dollar |
| **Totalt** | **Alla rätt** | **489 sekunder** | **0,228 dollar** |

GPT-6 Astra klarade också alla sju men behövde sammanlagt 175 sekunder. Kostnaden blev 0,527 dollar.

Grok kostade därmed omkring 43 procent av Astra för samma sju uppgifter, men tog 2,8 gånger så lång tid. Modellen använde 22 861 tanketoken, jämfört med 5 897 för Astra.

![Två arbetsorder på ett bord: Grok 4.7 med stoppur på 489 sekunder och prislapp 0,228 dollar, GPT-6 Astra med 175 sekunder och 0,527 dollar, båda med bocken Alla 7](https://aipress.se/images/posts/grok-4-7-kropp1.webp)

Jämförelsen består av en körning per uppgift och visar därför inte hur modellerna brukar prestera över många försök. Den visar däremot att Groks låga tokenpris inte automatiskt innebär korta svar eller snabb behandling.

## Så svarade Grok 4.7 på de sju uppgifterna

Grok rättade alla sju planterade språkfel i kundmejlet. Svaret var korrekt men presenterades som ett enda långt stycke, medan Astra behöll textens styckeindelning.

I programmeringsuppgiften ändrade Grok endast de två felaktiga delarna. Konkurrenten rättade också felen men tog dessutom bort en avrundning som inte omfattades av instruktionen.

Båda modellerna läste kvittot och prislistan korrekt. Grok lämnade kvittots JSON-data på en enda rad, medan konkurrentens svar var indraget och lättare att läsa.

Excel-uppgiften gav ett fungerande kalkylblad med åtta formler. Grok markerade cellerna som användaren kunde ändra och lade även till en resultatmarginal som inte hade efterfrågats. Astra använde tretton formler, men båda filerna uppfyllde samtliga nio krav.

![Groks månadsbudget för en frisörsalong öppnad i LibreOffice: intäkter per tjänst, kostnader och resultat före skatt 70 500 kronor](https://aipress.se/images/posts/grok-4-7-excel.webp)

PowerPoint-presentationen bestod av fem prydliga bilder utan text som hamnade utanför bildytan. Två språk- och innehållsproblem drog ned helhetsintrycket. Frasen ”Korta råvaror” saknade begriplig betydelse, och leveranstiden angavs både som före klockan 08.00 och före klockan 09.00 på olika bilder. De påhittade kontaktuppgifterna såg dessutom verkliga ut och saknade en tydlig markering om att de var exempel.

![Bild 1 av 5 i Groks presentation för Bageriet Solrosen](https://aipress.se/images/posts/grok-4-7-presentation-1.webp)

![Bild 2 av 5 i Groks presentation för Bageriet Solrosen](https://aipress.se/images/posts/grok-4-7-presentation-2.webp)

![Bild 3 av 5 i Groks presentation för Bageriet Solrosen](https://aipress.se/images/posts/grok-4-7-presentation-3.webp)

![Bild 4 av 5 i Groks presentation för Bageriet Solrosen](https://aipress.se/images/posts/grok-4-7-presentation-4.webp)

![Bild 5 av 5 i Groks presentation för Bageriet Solrosen](https://aipress.se/images/posts/grok-4-7-presentation-5.webp)

xAI:s API kan inte lämna över en PowerPoint- eller Excel-fil på samma sätt som Astra kunde göra i OpenAI:s kodmiljö. Grok fick därför skriva kompletta Python-skript som skapade filerna på Aipress dator. Båda skripten fungerade utan ändringar vid första försöket.

## Två av tre asteroidspel kraschade direkt

För att testa programmering fick Grok även skapa ett litet spel i en enda HTML-fil. Spelet skulle fungera direkt i webbläsaren, styras med piltangenterna och ha skott, poäng, liv, game over och cyberpunkstil.

Uppgiften kördes en gång på var och en av nivåerna medium, high och xhigh. High är standardnivån när användaren inte väljer någon inställning.

| Modell och nivå | Uppfyllda krav | Tid | Kostnad |
|---|---:|---:|---:|
| Grok 4.7 medium | 2 av 9 | 44,5 sekunder | 0,0267 dollar |
| Grok 4.7 high | 2 av 9 | 51,5 sekunder | 0,0326 dollar |
| Grok 4.7 xhigh | 9 av 9 | 33,5 sekunder | 0,0209 dollar |
| GPT-6 Astra medium | 9 av 9 | 58,9 sekunder | 0,2166 dollar |

Versionerna från medium och high kraschade redan på den första bildrutan. Koden försökte gå igenom listorna med asteroider, skott och partiklar innan listorna hade fått något innehåll. Startskärmen syntes, men själva spelet kom aldrig i gång.

![Groks asteroidspel på nivån medium efter start: bara rutnät och stjärnor, poäng 0 och liv 3, inget skepp och inga asteroider](https://aipress.se/images/posts/grok-4-7-spel-medium.webp)

Felet i medium-versionen kunde rättas genom att ändra en enda kodrad och skapa listorna som tomma från början. Efter ändringen uppfyllde även det spelet alla nio krav.

Den oredigerade xhigh-versionen, som vi kallar Grok-Asteroid, fungerade direkt och går att [spela här](/files/posts/grok-4-7-grok-asteroid.html). Den hade ett mörkt spelfält, neonfärger, svenska instruktioner, poängräkning, tre liv och fungerande omstart. Med Aipress 30 sekunder långa testsekvens fick spelet 40 poäng innan samtliga liv var slut. Astra-Asteroid, som vi kallar Astras spel, fick 1 060 poäng med samma tangenttryckningar och finns att [spela här](/files/posts/gpt-6-astra-neon-drift.html).

![Grok-Asteroid, Groks spel på nivån xhigh: game over-skärmen SYSTEM FAILURE med poäng 40 och uppmaningen TRYCK R](https://aipress.se/images/posts/grok-4-7-spel-xhigh.webp)

![Astra-Asteroid mitt i spelet: neonskepp, färgade asteroider, poäng 950 och två liv](https://aipress.se/images/posts/grok-4-7-spel-astra.webp)

Resultatet betyder inte att xhigh alltid är bättre. Varje nivå kördes bara en gång, och antalet tanketoken var nästan oförändrat: 176 på medium, 223 på high och 206 på xhigh. Skillnaden visar främst hur mycket ett enskilt modellsvar kan variera.

## Högre tankenivå gav inte bättre svenskt korrektur

Aipress körde också korrekturuppgiften på alla fyra tankenivåerna och jämförde med GPT-6 Astra och GPT-5.6 Sol.

| Modell och nivå | Hittade fel | Tid | Kostnad |
|---|---:|---:|---:|
| Grok 4.7 low | 6 av 7 | 18,7 sekunder | 0,0094 dollar |
| Grok 4.7 medium | 7 av 7 | 43,7 sekunder | 0,0217 dollar |
| Grok 4.7 high | 6 av 7 | 45,8 sekunder | 0,0224 dollar |
| Grok 4.7 xhigh | 6 av 7 | 42,9 sekunder | 0,0207 dollar |
| GPT-6 Astra low | 7 av 7 | 7,8 sekunder | 0,0233 dollar |
| GPT-6 Astra medium | 7 av 7 | 8,3 sekunder | 0,0285 dollar |
| GPT-6 Astra high | 7 av 7 | 36,1 sekunder | 0,0667 dollar |
| GPT-6 Astra xhigh | 7 av 7 | 52,0 sekunder | 0,1116 dollar |
| GPT-5.6 Sol low | 7 av 7 | 10,0 sekunder | 0,012 dollar |
| GPT-5.6 Sol medium | 7 av 7 | 10,9 sekunder | 0,016 dollar |
| GPT-5.6 Sol high | 7 av 7 | 13,0 sekunder | 0,0166 dollar |
| GPT-5.6 Sol xhigh | 7 av 7 | 24,5 sekunder | 0,0370 dollar |

Grok missade samma datumfel på low, high och xhigh: ”den 12:e augusti” fick stå kvar i stället för ”den 12 augusti”. Bara medium rättade samtliga fel. Svaret på xhigh var dessutom tecken för tecken identiskt med svaret på low.

GPT-6 Astra och GPT-5.6 Sol hittade alla sju felen på varje nivå. Sol på high blev både snabbast och billigast av körningarna som gav helt rätt resultat.

Groks högre nivåer gav alltså ingen tydlig förbättring i denna korta uppgift. Från medium till xhigh låg tid, kostnad och antal tanketoken på ungefär samma nivå. Resultatet skiljer sig från Astra och Sol, där högre nivåer ledde till mer omfattande resonemang och högre kostnad.

![Fyra pennor märkta låg 6 av 7, medel 7 av 7, hög 6 av 7 och xhög 6 av 7 runt frasen den 12:e augusti, där bara medel-pennan rättar till den 12 augusti](https://aipress.se/images/posts/grok-4-7-kropp2.webp)

## Oberoende tester placerar Grok 4.7 bakom de bästa modellerna

xAI lyfter fram stora förbättringar inom långvarigt kontorsarbete och programmering. I företagets tabell får Grok 4.7 bland annat 46,3 procent i CursorBench 4.0, 71 procent i DeepSWE och 38 procent i Terminal-Bench 4.0. DeepSWE-resultatet gäller tankenivån high, medan de övriga Grok 4.7-resultaten i tabellen anges för xhigh.

Resultaten kommer från xAI:s lanseringsmaterial. Företaget redovisar inte testmiljö, datum eller fullständig metod för jämförelserna.

Den oberoende mättjänsten [Artificial Analysis](https://artificialanalysis.ai/articles/benchmarking-grok-4-7) gav Grok 4.7 resultatet 46 i sitt Intelligence Index. Det är två poäng bättre än Grok 4.6 men lägre än Claude Fable 5.1 och GPT-6 Astra, som båda fick 53.

Förbättringen var tydligast i längre yrkesuppgifter. Grok 4.7 fick 1 657 Elo-poäng i AA-Briefcase, 111 mer än Grok 4.6. AA-Briefcase är Artificial Analysis privata test för långa arbetsuppgifter och består av realistiska uppgifter från arbetslivet. Resultaten bedöms i Elo-poäng.

Med Grok Build fick modellen 56 poäng i Artificial Analysis Coding Agent Index, en ökning med nio poäng från föregångaren. Den placerade sig på fjärde plats efter Claude Fable 5.1, GPT-6 Astra och Claude Opus 5.

Grok använde samtidigt mycket data. På Intelligence Index producerade modellen i genomsnitt omkring 81 000 utdatatoken per uppgift på nivån xhigh. Grok 4.6 använde 36 000 på high och GPT-6 Astra 27 000 på max. Enligt Artificial Analysis tog Grok 4.7 ungefär 7,1 minuter per uppgift i denna mätning, som genomfördes på xhigh.

Resultaten i Terminal-Bench varierar beroende på testmiljö. xAI anger 38 procent, medan Grok 4.7 nådde 26 procent i Artificial Analysis standardiserade testmiljö, enligt The Decoder. När Grok 4.7 kördes på xhigh i xAI:s egen kodagent Grok Build blev resultatet 33 procent, jämfört med 18 procent för Grok 4.6 med Grok Build.

Skillnaden betyder inte att någon av siffrorna nödvändigtvis är fel. Ett programmeringstest påverkas av både modellen, den omgivande kodagenten, verktygen och inställningarna. Resultat från olika körmiljöer bör därför inte jämföras som om de vore samma test.

## Grok 4.7 kostar från två dollar per miljon token

I xAI:s API kostar Grok 4.7 två dollar per miljon nya indatatoken och sex dollar per miljon utdatatoken. Cachad indata kostar 0,50 dollar. Även modellens interna tanketoken debiteras som utdata.

När en fråga innehåller minst 200 000 indatatoken fördubblas varje tokenpris:

| Användning | Under 200 000 indatatoken | Minst 200 000 indatatoken |
|---|---:|---:|
| Ny indata | 2 dollar | 4 dollar |
| Cachad indata | 0,50 dollar | 1 dollar |
| Utdata | 6 dollar | 12 dollar |

Utvecklare kan välja nivåerna low, medium, high och xhigh. High används som standard, och resonemanget kan inte stängas av helt.

xAI rekommenderar att samtal får en särskild cachenyckel. Den gör att efterföljande anrop styrs till samma server och ökar chansen att tidigare indata kan återanvändas till det lägre cachepriset. Utan nyckeln kan ett nytt anrop hamna på en server som saknar den tidigare informationen.

I Aipress test lade Grok dessutom själv till omkring 1 100 cachade indatatoken i varje anrop. Det ökade kostnaden med ungefär 0,0006 dollar per körning.

## Fungerar Grok 4.7 i Sverige?

Aipress kunde använda Grok 4.7 genom xAI:s vanliga API från en dator i Sverige under lanseringsdygnet. Modellen finns också i programmeringstjänsterna Cursor och Grok Build samt genom bland annat OpenRouter, Vercel och Cloudflare.

Enligt xAI:s dokumentation är modellen tillgänglig i alla Cursors abonnemang. Grok 4.7 Fast, som ska skriva svar ungefär dubbelt så snabbt, finns däremot bara i Cursor och Grok Build. Den kostar dubbelt så mycket och ingår inte i Grok Builds kostnadsfria nivå.

Det är ännu oklart vilka privatabonnemang som ger tillgång till Grok 4.7. Fyra timmar efter lanseringen angav xAI:s [prissida](https://x.ai/pricing) fortfarande Grok 4.6 på raden för modeller i jämförelsen mellan SuperGrok för 30 dollar i månaden och SuperGrok Plus för 100 dollar. Ingen av de lästa sidorna uppgav om abonnenterna får tillgång till Grok 4.7.

## xAI redovisar nya säkerhetstest men ingen modellrapport

xAI uppger att Grok 4.7 har fått en helt ny uppsättning skydd och är företagets hittills starkaste modell mot försök att kringgå säkerhetsreglerna.

I företagets eget HackerBench v0.3 släppte modellen igenom 3,3 procent av de riskfyllda instruktionerna. På LatchBios test för biologisk säkerhet nådde den 62,4 procent. xAI säger också att utvalda säkerhetspartner har fått tillgång till modellens mer avancerade funktioner för defensiv forskning.

Lanseringsinlägget innehåller däremot ingen modellrapport eller säkerhetsrapport med fullständig metod, testdata och begränsningar. Säkerhetssiffrorna går därför inte att bedöma lika ingående som om underlaget hade publicerats.

För API-kunder uppger xAI att frågor och svar sparas i 30 dagar och därefter raderas. Företaget säger att materialet inte används för träning utan kundens uttryckliga tillstånd.

Grok 4.7 framstår i våra tester som ett prismässigt intressant alternativ för utvecklare som kan acceptera längre väntetider. Modellen klarade alla sju vardagsuppgifterna till mindre än halva Astras kostnad, men använde nästan fyra gånger fler tanketoken och tog nästan tre gånger så lång tid. De kraschande spelen och det ojämna korrekturresultatet visar samtidigt att högre tankenivå inte garanterar ett bättre svar.
