Astra är samtidigt OpenAI:s första modell på den högsta risknivån för cybersäkerhet i företagets eget ramverk. I tester har den hittat okända säkerhetshål och använt dem för att ta sig in i skyddade system.
För att minska risken släpps en begränsad version som avböjer de mest avancerade cyberuppgifterna. Extra övervakning kan stoppa tillåtet arbete om systemet misstänker att Astra har missförstått sitt uppdrag.
GPT-6 Astra är byggd för arbete i riktiga program
OpenAI beskriver GPT-6 Astra som sin mest kapabla och bäst anpassade modell hittills. Det är företagets egen bedömning och ska inte läsas som en oberoende jämförelse med alla andra alternativ på marknaden.
Den tydligaste förändringen finns i uppgifter där AI:n behöver arbeta i flera steg och använda andra verktyg. Astra kan exempelvis fylla i formulär, uppdatera kunduppgifter, organisera en kalender, söka information på webben och skriva in resultatet i ett dokument eller mejl.
Systemet har tränats för att skapa presentationer, kalkylblad och dokument som följer en befintlig mall. Innehåll och utseende ska kunna anpassas efter en organisations befintliga material i stället för att varje dokument skapas från grunden.
Om en uppgift saknar en mindre detalj kan Astra göra ett rimligt antagande. När svaret kan påverka resultatet ska den i stället ställa en avgränsad fråga. I Codex kan arbetet fortsätta med delar som inte är beroende av användarens svar.
OpenAI uppger att Astra har blivit bättre på att behålla den ursprungliga uppgiften när användaren lägger till nya krav eller ställer en sidofråga. Äldre modeller har ibland tolkat sådana meddelanden som ett nytt uppdrag och tappat bort tidigare instruktioner.
Namnet Astra förklaras inte i OpenAI:s material. Det används som namn på släppet, på samma sätt som Sol, Terra och Luna i GPT-5.6-familjen.
GPT-6 Astra förbättrar resultaten i OpenAI:s tester
OpenAI redovisar höga resultat för GPT-6 Astra inom programmering, datorstyrning, matematik och naturvetenskap. Siffrorna kommer huvudsakligen från företagets egna körningar och visar det bästa resultat som respektive modell nådde vid någon av de tillgängliga resonemangsnivåerna.
| Test | GPT-6 Astra | GPT-5.6 Sol | Bästa redovisade Anthropic-modell |
|---|---|---|---|
| Terminal-Bench 4.0, arbete i terminal | 57,9 % | 37,3 % | 55,8 % |
| OSWorld 2.0, datorstyrning | 72,6 % | 65,7 % | 70,2 % |
| Agents’ Last Exam, yrkesuppgifter i program | 59,3 % | 53,6 % | 55,5 % |
| GPQA Diamond, avancerad naturvetenskap | 96,0 % | 94,6 % | 93,7 % |
| FrontierMath Tier 4, svår matematik | 97,6 % | 83,0 % | 87,8 % |
| Humanity’s Last Exam med verktyg | 57,2 % | ej redovisat | 65,0 % |
| Artificial Analysis Intelligence Index | 61,2 | 60,9 | 65,7 |
Astra ligger inte först i varje jämförelse. Claude Fable 5.1 får högre resultat både i Humanity’s Last Exam och i Artificial Analysis sammanvägda intelligensindex.
Resultatet på FrontierMath anges dessutom på två sätt på samma OpenAI-sida: 98 procent i introduktionen och 97,6 procent i tabellen.
Den mest uppseendeväckande siffran gäller ARC-AGI-3, ett test med nya pusselmiljöer där AI:n behöver upptäcka reglerna medan den arbetar. Astra får 99,9 procent, jämfört med 7,8 procent för GPT-5.6 Sol.
Jämförelsen kräver en tydlig reservation. Astra kördes inte med testets vanliga officiella rigg. OpenAI använde sin egen lösning, som behåller det föregående resonemanget och en större del av historiken mellan dragen. Företaget anser att detta bättre motsvarar verklig användning, men resultatet är därför inte direkt jämförbart med siffror från den officiella riggen.
ARC Prize Foundations Greg Kamradt uppger samtidigt att Astra klarade 96 procent av nivåerna med minst lika hög handlingseffektivitet som deras mänskliga referens. ARC Prize Foundation har däremot inte angett att organisationen har verifierat OpenAI:s resultat på 99,9 procent.
Astra har bidragit till två matematiska resultat
OpenAI kopplar lanseringen till två nya resultat inom talteori.
Det ena gäller avståndet mellan primtal. I mer än tio år var det känt att det finns oändligt många primtalspar med ett avstånd på högst 246. Matematikern Julia Stadlmann förbättrade nyligen gränsen till 240. Med hjälp av Astra har en ny gräns på 186 nu tagits fram.
Det andra arbetet förbättrar en del av en matematisk gräns för ovanligt stora avstånd mellan primtal. Den aktuella termen hade varit oförändrad i mer än 80 år.
OpenAI har publicerat bevisen och kompletterande granskningsmaterial som pdf-filer.
Första OpenAI-modellen på kritisk cybernivå
Den största skillnaden mot föregångarna finns inom cybersäkerhet.
OpenAI placerar Astra på nivån ”Critical” i sitt Preparedness Framework. Det innebär enligt företagets definition att AI-systemet, med rätt verktyg och behörigheter, kan hitta okända säkerhetshål och utveckla metoder för att utnyttja dem i många väl skyddade system utan att en människa leder varje steg.
Det är första gången OpenAI ger en modell denna klassificering.
Så står det i säkerhetsinlägget som kom två dagar före lanseringen:
We now believe Astra meets the Critical cybersecurity capability threshold under our Preparedness Framework, meaning that with the right tools and access, it can find previously unknown security flaws and develop ways to exploit them across many well-protected systems without a person guiding each step. It is the first model we are designating at this level, and requires stronger safeguards during development and before release.
Astra kan alltså, med tillverkarens egen måttstock, göra det som tidigare krävde ett team av säkerhetsexperter, och att man därför håller igen på vad som släpps.
I ett av testerna fick Astra full poäng på ExploitBench, där uppgiften är att skapa fungerande angrepp utifrån redan kända sårbarheter. GPT-5.6 Sol nådde 78,5 procent.
Eftersom äldre säkerhetshål kan ha förekommit i träningsmaterialet skapade OpenAI ett test med 20 nyare sårbarheter i JavaScript-motorn V8 och webbläsaren Chrome. Där hittade och använde Astra två okända sårbarheter som delar av en angreppskedja. OpenAI har påbörjat en ansvarsfull rapportering av bristerna till de berörda utvecklarna.
Vid expertledda tester kunde Astra använda okända sårbarheter för att köra egen kod i härdade webbläsare och bygga angrepp som ger högre behörighet i härdade operativsystem.
Cybertesterna kördes utan de produktionsspärrar som vanliga användare får.
Versionen av Astra för vanliga användare vägrar avancerade cyberuppgifter
Astra kan användas för exempelvis säker kodgranskning och för att föreslå rättningar av sårbarheter. Den ska däremot avböja mer avancerade uppgifter, som att skapa ett fungerande exempel på hur ett säkerhetshål kan utnyttjas.
En mindre grupp säkerhetsexperter får först tillgång till en öppnare variant. OpenAI planerar därefter att utöka programmet Daybreak för defensivt arbete som analys av skadlig kod, kontroll av sårbarheter och utveckling av detektionsregler.
Säkerhetsarbetet har påverkat utvecklingen. Efter en incident hos Hugging Face i augusti pausade OpenAI delar av träningen av avancerade modeller i två veckor. Astra var inte inblandad, men företaget skärpte bland annat nätverksisoleringen, övervakningen och säkerhetskraven innan den stora träningskörningen återupptogs den 28 augusti.
Astras säkerhetskontroller kan stoppa vanliga uppgifter
Den extra övervakningen märks för användare som inte arbetar med cybersäkerhet.
När Astra använder verktyg granskar separata system dess resonemang och handlingar. Om de upptäcker något som kan vara ett otillåtet eller missförstått agerande kan uppgiften saktas ned, pausas eller stoppas.
Så här står det i lanseringsinlägget:
Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop.
I chatten får du alltså en fråga om åtgärden ska fortsätta, medan en tjänst som går via API:t bara ser att körningen avbröts.
OpenAI varnar för att kontrollerna vid lanseringen kan slå till oftare än avsett. Det kan drabba tillåtna säkerhetsuppgifter, långvariga agentkörningar och arbete som inte verkar ha någon koppling till cybersäkerhet.
Astra följer gränser bättre men är svårare att övervaka
OpenAI beskriver Astra som sin hittills bäst anpassade modell, i betydelsen att den oftare följer användarens avsikt och håller sig inom de behörigheter den har fått.
I ett internt test ställdes Astra och GPT-5.6 Sol inför en mycket svår eller omöjlig cyberuppgift. Sol försökte då använda system utanför det tillåtna målet i 48 procent av fallen. Astra gjorde det inte i något fall.
I en annan simulering med drygt 54 000 interna Codex-uppgifter fick Astra ungefär hälften så många flaggor för allvarliga avvikelser som Sol.
Samtidigt redovisas ett besvärligare resultat i lanseringsinlägget:
Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring.
Det betyder att när Astra instrueras att dölja vad den gör, är det svårare för de interna kontrollsystemen att se det i dess skrivna resonemang än det var med Sol.
I konstruerade försök kunde Astra ibland dölja strategisk underprestation och undvika interna övervakare under vissa sabotageuppgifter. OpenAI bedömer att den fortfarande har svårt att dölja det resonemang som krävs för mer komplicerade uppdrag, men beskriver försämringen som något som måste tas på allvar.
Nytt minne för långa uppgifter i Codex
Astra får en experimentell minnesfunktion i Codex för arbeten som pågår längre än det aktiva sammanhanget.
När ett sammanhang blev fullt komprimerade Codex informationen till en sammanfattning. Då kunde detaljer om exempelvis misslyckade lösningar, testresultat och äldre krav försvinna.
Med Astra kan Codex i stället spara fortlöpande anteckningar och söka i föregående sammanhangsfönster. AI:n ska därmed kunna hitta äldre instruktioner och resultat även om de inte kom med i den senaste sammanfattningen.
Funktionen behöver till en början aktiveras i Codex-filen config.toml. OpenAI planerar att göra den till standard för Astra under de kommande veckorna.
Företaget har också uppdaterat systemet runt Codex. Tillsammans med förbättringarna i Astra ska det ge 1,9 gånger snabbare datorstyrning än upplevelsen med GPT-5.6 Sol, mätt på riktmärket Mind2Web.
Vilka abonnemang får GPT-6 Astra?
Utrullningen sker stegvis och tillgången kan komma vid olika tidpunkter i ChatGPT, Work och Codex.
Plus får Astra i ChatGPT Work och Codex, men inte i den vanliga chattfliken. Där erbjuds modellen under namnet GPT-6 Pro och kräver Pro, Business eller Enterprise.
| Abonnemang | Vanlig chatt | ChatGPT Work och Codex |
|---|---|---|
| Plus | Ingen GPT-6 Pro | GPT-6 Astra |
| Pro | GPT-6 Pro | GPT-6 Astra |
| Business | GPT-6 Pro | GPT-6 Astra |
| Enterprise | GPT-6 Pro, om administratören tillåter den | GPT-6 Astra, om administratören tillåter den |
| Free och Go | Inte angivet | Inte angivet |
OpenAI har inte lovat att Free och Go ska få tillgång till Astra.
GPT-6 Pro har egna gränser i den vanliga chatten. Pro-abonnemanget för 200 dollar omfattar 200 meddelanden per vecka. Nivån för 100 dollar ger 50 meddelanden i veckan, delade med GPT-5.6 Sol Pro. Business Standard omfattar 15 meddelanden per månad och Business Premium 50 per vecka. Work och Codex använder separata gränser.
I vårt test den 5 september fungerade Astra i ChatGPT Work, Codex och API:t över en svensk uppkoppling. Utrullningen var inte färdig den 3 september, då samma API-konto fick beskedet att modellen saknades och Codex uppgav att den ännu inte stöddes med ett ChatGPT-konto.
För Codex krävs enligt OpenAI minst version 0.153.0 av kommandoradsprogrammet. I version 0.153.1 gick Astra att ange manuellt, men den visades inte i modellväljaren och var inte standardval. Vi använde version 0.153.4, där Astra kunde väljas direkt.
Vårt test av GPT-6 Astra: alla sju språkfel hittades
Vi testade GPT-6 Astra den 5 september med samma svenska vardagsuppgift i ChatGPT Work, Codex och API:t.
Astra fick rätta ett kundmejl på 120 ord med sju planterade språkfel. Där fanns bland annat särskrivningarna ”kund tjänsten” och ”order nummer”, formerna ”dem sa” och ”bli oroligt” samt ”Min order nummer” i stället för ”Mitt ordernummer”.
Testet kördes med låg och medelhög resonemangsnivå. Astra hittade samtliga sju fel i alla sex körningar och ändrade inget som redan var korrekt.
Ordet ”tillbaks” fick stå kvar med förklaringen att det är en accepterad variant. Det stämmer, även om ”tillbaka” ofta uppfattas som mer neutralt i formell text.
| Tjänst | Låg nivå | Medelnivå |
|---|---|---|
| ChatGPT Work | 15 sekunder enligt gränssnittet | Under 30 sekunder |
| Codex CLI 0.153.4 | 19,5 sekunder | 17,6 sekunder |
| OpenAI API | 7,8 sekunder | 8,3 sekunder |
På medelnivån gjorde Astra två förbättringar utöver de planterade felen: den tog bort ett onödigt komma och delade upp mejlet i stycken. På låg nivå begränsade den sig till rättningarna.
Efter korrekturtestet fick Astra fyra saker till att göra via API:t med effort medium, sådant en privatperson eller en mindre firma kan tänkas be om. Här är både vår fråga och vad som kom tillbaka.
Astra skrev en bildprompt som bildmodellen följde
Vi bad först Astra att skriva instruktionen till en bildmodell:
Jag vill ha en realistisk naturbild. Motivet: ett paradis vid havet med palmer, fåglar och djur som verkligen lever i sådana miljöer. Inga människor, inga byggnader, ingen text i bilden. Skriv en färdig engelsk bildprompt (högst 120 ord) till en bildmodell så att bilden ser ut som ett riktigt fotografi.
Efter 9,5 sekunder svarade Astra med en bildprompt på 99 ord:
A photorealistic wildlife photograph of an untouched tropical beach in the Seychelles: turquoise ocean, clear shallow water, pale sand, weathered granite boulders, and coconut palms leaning toward the sea. White-tailed tropicbirds glide above the shoreline, while a few small ghost crabs forage near their burrows along the damp sand. Lush coastal vegetation frames the beach. Soft early-morning sunlight, natural colors, realistic shadows, subtle sea spray, detailed palm fronds, and gentle breaking waves. Eye-level composition, full-frame camera, 35mm lens, f/8, true-to-life animal anatomy and scale. Peaceful coastal paradise, documentary photography, no artificial saturation. No people, buildings, text, logos, or watermarks.
Astra förklarade på svenska att vitstjärtade tropikfåglar förekommer på Seychellerna och hör hemma vid tropiska havskuster. Spökkrabborna passade också in i miljön, eftersom de gräver hålor i sanden och söker föda nära vattenlinjen.
Vi skickade prompten oförändrad till bildmodellen gpt-image-2 och valde storleken 1 536 × 1 024 bildpunkter samt hög kvalitet. Efter 95 sekunder fick vi en fotorealistisk strand med turkost hav, ljus sand, granitblock, kokospalmer och tät kustvegetation. Två vita tropikfåglar med långa stjärtspröt flög över vattnet och tre små spökkrabbor syntes på stranden.
Bilden innehöll varken människor, byggnader eller text. Vi hittade inget som stred mot beställningen. Även granitblocken stämde med platsen som Astra hade valt, eftersom sådana klippformationer är typiska för Seychellerna. Astras del av uppgiften använde 346 utdatatoken och kostade 0,018 dollar. Kostnaden för bildrenderingen tillkom.
Astra skapade en färdig PowerPoint-presentation
Nästa beställning gällde en fil som skulle gå att öppna och använda:
Skapa en enkel PowerPoint-presentation (pptx) på fem bilder för ett litet svenskt bageri som ska presentera sig för en ny lokal företagskund. Innehåll: titelbild, om bageriet, vad vi erbjuder företag (frukost, fika, catering), priser som exempel, kontakt. Använd påhittade men rimliga uppgifter, all text på svenska, ren layout med en tydlig rubrik per bild. Skapa filen och ge mig den som fil.
Astra använde kodverktyget nio gånger och levererade efter 99 sekunder en pptx-fil på 140 kB. Presentationen bestod av de fem beställda bilderna och handlade om det påhittade Kvartersbageriet Linden i Uppsala.
Titelbilden hade rubriken ”Nybakat till arbetsdagen”. De följande bilderna presenterade ett bageri med fem medarbetare, grundat 2019, samt företagserbjudanden inom frukost, fika och catering. Prisexemplen var 89 kronor för frukost, 49 kronor för fika och 139 kronor per person för lunchcatering. Priserna angavs exklusive moms, med minst tio personer per beställning och en leveransavgift på 150 kronor.
Den sista bilden innehöll en påhittad kontaktperson, adress och öppettider. På varje bild stod också ”Fiktivt bageri, exempel för företagskund” i en liten fotnot. Vi kontrollerade filen med ett program som läser pptx-filer och kunde bekräfta att den innehöll fem bilder. Layouten var ren och sammanhållen, med mörkgrönt, cremevitt och tegelrött som accentfärg. Uppgiften kostade 0,28 dollar. Presentationen går att ladda ner som pptx.
Rymdspelet fungerade direkt i webbläsaren
Den tredje uppgiften prövade om Astra kunde skapa ett fungerande litet program:
Skapa ett litet webbläsarspel i en enda HTML-fil: ett rymdskepp som skjuter asteroider, i cyberpunkstil (neonfärger, mörk bakgrund). Styrning med piltangenterna, skjut med mellanslag. Visa poäng och liv. Spelet ska fungera direkt när filen öppnas i en webbläsare, utan externa bibliotek eller bilder.
Efter 59 sekunder levererade Astra en HTML-fil på 12 kB. Den innehöll hela spelet och behövde varken externa kodbibliotek eller separata bildfiler. Filen fungerade vid första försöket när vi öppnade den i en webbläsare. Du kan prova det själv här på sajten.
Spelet fick namnet ”Neon Drift”. Ett cyanfärgat rymdskepp rörde sig framför en mörk bakgrund med rutnät och stjärnor, medan lila asteroider drev nedåt. Poängen och tre hjärtan visades överst. Där fanns även svenska instruktioner för förflyttning, skott, paus och omstart samt en knapp med texten ”Starta om”. Alla gränssnittstexter blev svenska, trots att beställningen inte uttryckligen krävde det.
Vi provspelade med automatiska tangenttryck. När de tre liven var slut hade spelet nått 570 poäng och visade meddelandet ”SIGNAL FÖRLORAD”, följt av slutpoängen och instruktionen att trycka på R eller Enter för att börja om. Astra använde 4 311 utdatatoken och uppgiften kostade 0,22 dollar.
Excel-budgeten innehöll 13 fungerande formler
Till sist bad vi Astra skapa ett kalkylblad:
Skapa en Excel-fil (xlsx) med en enkel månadsbudget för en liten frisörsalong i Sverige: intäkter per tjänst (klippning, färgning, styling) med antal och pris, kostnader (hyra, löner, material, el, försäkring), och summering med resultat före skatt. Alla summor ska vara riktiga Excel-formler, inte inskrivna tal. All text på svenska.
Astra använde kodverktyget fem gånger och levererade filen efter 41 sekunder. Kalkylbladet var indelat i tre block för intäkter, kostnader och summering. Blå celler markerades som värden som användaren kunde ändra.
Vi kontrollerade filen med ett program som läser Excel-formler och hittade 13 formler. Bland dem fanns =B7*C7 för att räkna ut intäkten på en enskild rad och =SUM(D7:D9) för att summera flera rader. Exempelvärdena gav 140 500 kronor i intäkter, 100 000 kronor i kostnader och ett resultat före skatt på 40 500 kronor.
En detalj var inte anpassad till svensk skrivstandard: beloppen visades med engelskt tusentalskomma, exempelvis ”80,000 kr”, i stället för ”80 000 kr”. Uppgiften kostade 0,16 dollar. Budgeten går att ladda ner som xlsx.
De fyra Astra-körningarna kostade sammanlagt 0,68 dollar. Priset för att rendera bilden med gpt-image-2 ingår inte i summan.
API-priset är mer än dubbelt så högt som för Sol
Utvecklare använder modellnamnet gpt-6-astra i OpenAI:s API. Astra kan ta emot text och bilder och lämnar text som svar. Ljud och video stöds inte.
Kontextfönstret är 1 050 000 token och ett svar kan vara högst 128 000 token. Kunskapsgränsen är den 30 april 2026. Användaren kan välja resonemangsnivåerna low, medium, high, xhigh och max.
OpenAI:s standardpriser anges i dollar per miljon token:
| Typ | Pris |
|---|---|
| Indata | 10 dollar |
| Cachad indata | 1 dollar |
| Skrivning till cache | 12,50 dollar |
| Utdata | 50 dollar |
Det gör indata till Astra 2,5 gånger dyrare än till GPT-5.6 Sol, som kostar fyra dollar per miljon token. OpenAI anger inga priser i svenska kronor.
Färre token betyder inte alltid lägre kostnad
OpenAI framhåller att Astra kan behöva färre token och arbetssteg för att lösa en uppgift. I företagets tester var den uppskattade API-kostnaden per uppgift omkring 9 procent lägre än för GPT-5.6 Sol i Terminal-Bench 4.0. I ett billigare läge på naturvetenskapstestet GPQA Diamond slog Astra samtidigt Sols bästa resultat till cirka 37 procent lägre kostnad. På Agents’ Last Exam använde Astra omkring 65 procent färre utdatatoken än Claude Opus 5 vid de inställningar som gav högst poäng.
Detta beror enligt OpenAI på effektivare problemlösning, inte på cachning. Cachning innebär här att en återkommande inledning i flera API-anrop kan återanvändas. Sådan indata kostar en dollar per miljon token i stället för tio dollar, medan ny indata debiteras till ordinarie pris. Rabatten gäller alltså återanvänd indata, inte svaret eller modellens resonemang, och gör inte en enstaka ny uppgift billigare.
Vårt korrekturtest gav samma mönster när det gäller tokenåtgång, men inte kostnad:
| Modell | Nivå | Utdatatoken | Varav resonemang | Tid | Kostnad |
|---|---|---|---|---|---|
| GPT-6 Astra | Låg | 424 | 135 | 7,8 sekunder | 0,023 dollar |
| GPT-5.6 Sol | Låg | 543 | 288 | 10,0 sekunder | 0,012 dollar |
| GPT-6 Astra | Medel | 529 | 183 | 8,3 sekunder | 0,029 dollar |
| GPT-5.6 Sol | Medel | 772 | 516 | 10,9 sekunder | 0,016 dollar |
Indatan var 206 token i samtliga körningar. Astra använde 22 procent färre utdatatoken på låg nivå och 31 procent färre på medelnivå samt svarade snabbare. Trots det kostade körningarna ungefär dubbelt så mycket som med Sol, eftersom Astras ordinarie tokenpris är 2,5 gånger högre.
Båda modellerna hittade samtliga sju planterade språkfel. Sol lade däremot till två kommatecken som inte behövdes, medan Astra lämnade de redan korrekta delarna oförändrade. Testet visar att lägre tokenåtgång kan minska prisskillnaden, men inte nödvändigtvis göra Astra billigare för en kort uppgift.
För anrop med mer än 272 000 token in fördubblas priset på indata, cachad indata och cacheskrivningar. Utdatan blir 50 procent dyrare. Hela anropet debiteras då enligt den högre taxan, inte bara den del som passerar gränsen.
Batch och Flex kostar hälften av standardpriset. Fast mode kostar dubbelt och ska enligt OpenAI ge upp till dubbla hastigheten.
Astra finns genom Microsoft Azure och Amazon Bedrock. I ChatGPT och Codex ingår användningen i de befintliga abonnemangens kvoter, och OpenAI har inte meddelat någon höjning av månadspriserna.
Thomas Karlsson
Huvudredaktör, AI expert och journalist
Thomas bevakar generativ AI, språkmodeller och verktygen som förändrar hur vi arbetar. Han skriver för dig som vill förstå utvecklingen utan att redan kunna tekniken.