# GPT-6.1 Sol är OpenAI:s nya modell för arbetsuppgifter

> GPT-6.1 Sol förbättrar arbetet med kod, dokument och appar. Priset för inmatning och svar i API är en femtedel av Astras. Läs om tillgång och tester.

Publicerad: 2026-10-01  
Uppdaterad: 2026-10-01  
Skribent: Thomas Karlsson  
Sajt: Aipress.se  
URL: https://aipress.se/nyheter/gpt-6-1-sol/

OpenAI lanserade GPT-6.1 Sol den 29 september 2026. Modellen är en uppgradering av GPT-6 Sol och ska klara mer krävande arbete med kod, dokument och datorprogram till betydligt lägre pris än toppmodellen GPT-6 Astra. Priset för inmatad text och svar är en femtedel av Astras ordinarie API-pris.

I [OpenAI:s lanseringsbeskrivning av GPT-6.1 Sol](https://openai.com/index/introducing-gpt-6-1-sol/) ligger modellen nära Astra i flera tester. Aipress egna försök ger en mer konkret bild: GPT-6.1 Sol löste sju vardagsuppgifter helt rätt för sammanlagt 0,110 dollar. Den tog ungefär lika lång tid som Astra, men kostade betydligt mindre. Modellen skapade också spelbara asteroidspel på alla fyra prövade tankenivåer. När en människa spelade fungerade varje version i mer än en minut.

## Var finns GPT-6.1 Sol att använda?

GPT-6.1 Sol kommer till ChatGPT Work och Codex samt finns i OpenAI:s API, gränssnittet som låter andra program använda modellen. Den går ännu inte att välja i vanliga ChatGPT-samtal. Work är den del av ChatGPT där modellerna arbetar med uppgifter i appar och dokument, medan Codex används för arbete med kod.

Lanseringen omfattar Plus, Pro, Business, Enterprise och Edu. OpenAI:s hjälpsidor beskriver en stegvis utrullning som börjar med Pro och därefter utökas till de andra planerna. Free och Go ingår inte vid lanseringen. För Enterprise och Edu måste en administratör aktivera tillgången. Abonnemang, appversion och arbetsytans inställningar avgör vilka val en användare faktiskt ser.

Vi kunde använda modellen via API och i Codex CLI, terminalversionen av Codex, med ett konto på planen Pro Lite. I CLI-version 0.159.2 stod GPT-6.1 Sol först i modellistan och hade low som förvald tankenivå. Både low och medium svarade. På webben syntes modellen i Work för samma konto, men inte med namn i modellväljaren för Chat. Det bekräftar tillgången för det testade kontot, inte för alla abonnenter.

Skärmbilderna visar modellvalen för det testade kontot. I Chat finns Latest, GPT-5.6 Sol och GPT-5.5, och en separat bild visar reglaget Thinking effort för tankenivån. I Work finns Default, GPT-6.1 Sol, GPT-6 Astra, GPT-6 Sol, GPT-6 Luna, GPT-5.6 Sol och GPT-5.6 Terra. GPT-6.1 Sol syns alltså med namn i Work-väljaren.

![Skärmbild av modellväljaren i ChatGPT:s chattflik med alternativen Latest, GPT-5.6 Sol och GPT-5.5, där GPT-5.5 är märkt Leaving on October 14. GPT-6.1 Sol finns inte i listan](https://aipress.se/images/posts/gpt-6-1-sol-chat-modellval.webp)

![Skärmbild av menyn Thinking effort i ChatGPT:s chattflik, med nivån Medium överst och ett reglage för tankenivån under](https://aipress.se/images/posts/gpt-6-1-sol-chat-tankeniva.webp)

![Skärmbild av modellväljaren i ChatGPT Work med listan Select model: Default överst och därefter GPT-6.1 Sol, GPT-6 Astra, GPT-6 Sol, GPT-6 Luna, GPT-5.6 Sol och GPT-5.6 Terra](https://aipress.se/images/posts/gpt-6-1-sol-work-modellval.webp)

Den som vill installera terminalappen hittar nedladdningar i [utgåvan av Codex CLI 0.159.1](https://github.com/openai/codex/releases/tag/rust-v0.159.1), där GPT-6.1 Sol lades in som standardmodell i den medföljande modellkatalogen och i katalogerna för Amazon Bedrock Mantle och Runtime. Ett tidigare manuellt modellval behålls av Codex. För att välja GPT-6.1 Sol i en interaktiv terminalsession används `/model`. Det går också att starta med `codex --model gpt-6.1-sol`.

I apparna kan användaren börja med kontots förvalda inställning för Power och flytta reglaget mot Smarter för mer resonemang eller Faster för snabbare och billigare arbete. Under Advanced finns separata val för modell, tankenivå och hastighet. Reglaget finns inte i CLI. [Guiden till modellval i Work och Codex](https://learn.chatgpt.com/docs/models) beskriver vilka inställningar som kan visas för respektive konto och app.

Standard och Fast finns vid lanseringen. Ultrafast ska komma senare och utlovas ge upp till åtta gånger snabbare generering av token än standardläget i Codex. Det löftet gäller hur snabbt svaret produceras, inte att varje hel uppgift blir åtta gånger snabbare.

OpenAI anger följande uppskattningar för lokala meddelanden under ett femtimmarsfönster på ChatGPT Business med Standard-platser. GPT-6.1 Sol och GPT-6 Sol har samma intervall och ett högre sådant än Astra. Luna har det största intervallet. Det är uppskattningar, eftersom modell och uppgift påverkar förbrukningen och molnsamtal kan använda mer av utrymmet än lokala meddelanden. Premium-platser har fem gånger den inkluderade användningen och saknar femtimmarsgräns.

| Modell | Standard-platser |
|---|---|
| GPT-6 Astra | 5-45 |
| GPT-6.1 Sol, GPT-6 Sol | 15-150 |
| GPT-5.6 Sol | 10-100 |
| GPT-5.6 Terra | 25-200 |
| GPT-5.6 Luna | 250-2 000 |

## Hur nära GPT-6 Astra ligger GPT-6.1 Sol?

OpenAI:s starkaste argument för uppgraderingen är kombinationen av resultat och kostnad per uppgift. Ett lågt pris per token garanterar inte ett billigt färdigt arbete. Modellen kan behöva skriva mer, tänka längre eller använda fler verktyg. Därför är de redovisade uppgiftskostnaderna mer användbara än enbart prislistan.

I DeepSWE 1.1 ska modeller lösa nya, omfattande programmeringsuppgifter i verkliga kodprojekt. I OpenAI:s mätning nådde GPT-6.1 Sol 75,2 procent på high för 0,65 dollar per uppgift. Föregångarens bästa resultat var 68,8 procent på max för 2,74 dollar. Astra nådde som bäst 74,1 procent på xhigh för 4,43 dollar i den redovisade jämförelsen. GPT-6.1 Sol på medium nådde 73,0 procent för 0,42 dollar. Mer tänkande gav alltså inte alltid ett bättre resultat: xhigh och max stannade båda på 71,9 procent för den nya Sol-modellen.

GDP.pdf prövar hur väl modeller besvarar yrkesrelaterade frågor utifrån komplicerade PDF-dokument, med tabeller, diagram och finstilta detaljer. Dokumenten kommer från bland annat finans, vård och juridik. Enligt OpenAI fick GPT-6.1 Sol högre poäng än Opus 5.5 med reservlösningar och kostade mindre än hälften så mycket per uppgift på de prövade tankenivåerna. Den närmade sig också Astra för ungefär en femtedel av kostnaden per uppgift.

AutomationBench 1.0.6 prövar om en modell slutför arbetsflöden i flera steg med 47 verktyg inom exempelvis försäljning, support och ekonomi. Här låg GPT-6.1 Sol på medium 2,2 procentenheter över Opus 5.5 till ungefär en tredjedel av kostnaden, enligt OpenAI. Förbättringen mot GPT-6 Sol på samma nivå var 4,8 procentenheter. I jämförelsen med Claude Fable 5.1 ingår inte kostnaden för reservlösningar, trots att de behövdes i ungefär 40 procent av uppgifterna. Den modellens redovisade kostnad är därför för låg.

OSWorld 2.0 testar längre arbetsflöden där modellen använder datorprogram. OpenAI redovisar delpoäng på testets offlineuppgifter. Med maximal tankenivå låg GPT-6.1 Sol sju procentenheter över GPT-6 Sol och kostade mindre än hälften så mycket. Avståndet till Astra på max var 2,1 procentenheter, till ungefär en sjundedel av kostnaden per uppgift.

Terminal-Bench Science 0.1 omfattar vetenskapliga arbetsflöden som dataanalys, simuleringar, modellanpassning och bevisföring med kod och terminalverktyg. På max mer än fördubblade GPT-6.1 Sol föregångarens poäng till mindre än halva kostnaden. Den genomsnittliga uppgiftskostnaden var 5,47 dollar, mot 23,21 för Opus 5.5 och 23,80 för Astra. Astra hade fortfarande högst poäng, 68,1 procent, och OpenAI rekommenderar den för de svåraste forskningsuppgifterna.

Resultaten för OpenAI:s modeller kommer från företagets forskningsmiljö eller API. Instruktioner, verktyg och tankenivåer kan skilja sig från dem i ChatGPT. Konkurrenternas resultat har OpenAI hämtat från offentliga rapporter. Siffrorna ska därför läsas med dessa villkor, snarare än som en gemensam mätning av alla modeller i samma produkt.

## DeepSWE:s offentliga jämförelse saknar GPT-6.1 Sol

Den offentliga DeepSWE-tabellen i materialet är en separat jämförelse och innehåller ännu ingen rad för GPT-6.1 Sol. Den ska därför inte användas som ett oberoende belägg för den nya modellens resultat i OpenAI:s lansering.

DeepSWE använder 113 uppgifter från 91 kodprojekt och fem programmeringsspråk. Uppgifterna är skrivna från grunden i stället för att hämtas från tidigare kodändringar. Alla modeller i den offentliga jämförelsen använder samma agentprogram, mini-swe-agent, som låter dem arbeta med koden. DeepSWE:s resultatsida visar både lösningsgrad och resursåtgång.

Astra på xhigh, Gemini 3.8 Flash på high och Claude Opus 5 på max står alla på 74 procent. De redovisade osäkerhetsintervallen överlappar, så tabellen ger inte stöd för en ensam vinnare bland dem. Gemini använder fler steg och fler utdatatoken än Astra, men kostar mindre per uppgift. Billigast i tabellen är GLM 5.3 Flash, med lägre lösningsgrad.

Pass@1 betyder andelen uppgifter som löses vid ett försök. Tecknet ± anger det redovisade osäkerhetsintervallet. Genomsnittskostnaden anges i dollar, utdatatoken är de textenheter modellen producerar och k betyder tusen. Steg är antalet steg i agentens arbete. Inställningen inom hakparentes anger tankenivån.

| Modell | Pass@1 | Genomsnittskostnad | Utdatatoken | Steg |
|---|---|---|---|---|
| gpt-6-astra [xhigh] | 74%±3% | $4.43 | 30k | 29 |
| gemini-3.8-flash [high] | 74%±1% | $2.36 | 143k | 166 |
| claude-opus-5 [max] | 74%±4% | $11.84 | 118k | 99 |
| gpt-5.6-sol [max] | 73%±3% | $6.46 | 60k | 61 |
| claude-fable-5 [xhigh] | 70%±3% | $13.41 | 80k | 68 |
| glm-5.3 [max] | 69%±3% | $3.99 | 80k | 124 |
| kimi-k3 [max] | 69%±5% | $4.65 | 81k | 98 |
| grok-4.6 [medium] | 67%±2% | $3.45 | 50k | 70 |
| gpt-5.6-luna [max] | 67%±4% | $0.61 | 73k | 102 |
| gpt-5.5 [xhigh] | 67%±6% | $7.23 | 46k | 82 |
| gemini-3.7-flash [medium] | 65%±3% | $2.03 | 94k | 117 |
| glm-5.3-flash [max] | 63%±4% | $0.24 | 73k | 123 |
| deepseek-v4-pro [max] | 63%±6% | $1.67 | 106k | 155 |
| claude-opus-4.8 [max] | 59%±2% | $13.22 | 135k | 120 |
| qwen3.8-max [xhigh] | 57%±3% | $3.73 | 95k | 111 |
| muse-spark-1.2 [xhigh] | 55%±2% | $3.70 | 99k | 101 |
| claude-sonnet-5 [max] | 54%±4% | $26.40 | 214k | 268 |
| deepseek-v4-flash [max] | 53%±4% | $0.46 | 108k | 153 |
| gemini-3.6-flash [high] | 47%±4% | $2.21 | 96k | 117 |
| glm-5.2 [max] | 44%±2% | $3.92 | 78k | 129 |
| gemini-3.5-flash [high] | 36%±4% | $3.45 | 76k | 105 |

## Vad kostar GPT-6.1 Sol?

Ordinarie API-pris är 2 dollar per miljon inmatade token och 10 dollar per miljon utdatatoken. Token är de enheter modellen delar upp text i, ofta ord eller delar av ord. API-kostnaden påverkas av både texten som skickas in och texten modellen producerar, inklusive tanketoken som används för resonemang.

Det ordinarie priset för inmatning och svar är samma som för GPT-6 Sol. Den stora prissänkningen mot föregångaren gäller cachelagrad inmatning: tidigare material som kan återanvändas utan att behandlas som helt ny inmatning. Det kostar 0,10 dollar per miljon token, hälften av GPT-6 Sols pris och 95 procent mindre än ny inmatning för GPT-6.1 Sol. Att skriva till cachen kostar 2,50 dollar per miljon token.

Nedan återges OpenAI:s prisjämförelser för Standard, Batch, Flex och Fast. Alla priser är dollar per miljon token. Kort sammanhang betyder högst 272 000 inmatade token. Långt sammanhang betyder fler än 272 000. Den högre taxan gäller då hela förfrågan: inmatning och cache kostar dubbelt så mycket, medan utmatningen kostar 50 procent mer.

Luna är billigast i samtliga fyra tabeller och Astra dyrast. GPT-6.1 Sol och GPT-6 Sol har samma priser för ny inmatning, cacheskrivning och utmatning. Den nya Sol-modellen är billigare för cachelagrad inmatning vid både kort och långt sammanhang. Prislistan för OpenAI:s API anger även villkoren för de olika behandlingslägena och tilläggsavgifterna.

**Standardpriser för OpenAI:s modeller**

| Modell | Kort sammanhang: inmatning | Kort sammanhang: cachelagrad inmatning | Kort sammanhang: cacheskrivning | Kort sammanhang: utmatning | Långt sammanhang: inmatning | Långt sammanhang: cachelagrad inmatning | Långt sammanhang: cacheskrivning | Långt sammanhang: utmatning |
|---|---|---|---|---|---|---|---|---|
| gpt-6-astra | $10.00 | $1.00 | $12.50 | $50.00 | $20.00 | $2.00 | $25.00 | $75.00 |
| gpt-6.1-sol | $2.00 | $0.10 | $2.50 | $10.00 | $4.00 | $0.20 | $5.00 | $15.00 |
| gpt-6-luna | $0.10 | $0.01 | $0.125 | $0.50 | $0.20 | $0.02 | $0.25 | $0.75 |
| gpt-6-sol | $2.00 | $0.20 | $2.50 | $10.00 | $4.00 | $0.40 | $5.00 | $15.00 |

**Batchpriser för OpenAI:s modeller**

Batch är läget för samlade förfrågningar. Priserna är hälften av Standard, med samma inbördes prisordning mellan modellerna.

| Modell | Kort sammanhang: inmatning | Kort sammanhang: cachelagrad inmatning | Kort sammanhang: cacheskrivning | Kort sammanhang: utmatning | Långt sammanhang: inmatning | Långt sammanhang: cachelagrad inmatning | Långt sammanhang: cacheskrivning | Långt sammanhang: utmatning |
|---|---|---|---|---|---|---|---|---|
| gpt-6-astra | $5.00 | $0.50 | $6.25 | $25.00 | $10.00 | $1.00 | $12.50 | $37.50 |
| gpt-6.1-sol | $1.00 | $0.05 | $1.25 | $5.00 | $2.00 | $0.10 | $2.50 | $7.50 |
| gpt-6-luna | $0.05 | $0.005 | $0.0625 | $0.25 | $0.10 | $0.01 | $0.125 | $0.375 |
| gpt-6-sol | $1.00 | $0.10 | $1.25 | $5.00 | $2.00 | $0.20 | $2.50 | $7.50 |

**Flexpriser för OpenAI:s modeller**

Även Flex kostar hälften av Standard. I den här prisjämförelsen är varje pris samma som i Batch.

| Modell | Kort sammanhang: inmatning | Kort sammanhang: cachelagrad inmatning | Kort sammanhang: cacheskrivning | Kort sammanhang: utmatning | Långt sammanhang: inmatning | Långt sammanhang: cachelagrad inmatning | Långt sammanhang: cacheskrivning | Långt sammanhang: utmatning |
|---|---|---|---|---|---|---|---|---|
| gpt-6-astra | $5.00 | $0.50 | $6.25 | $25.00 | $10.00 | $1.00 | $12.50 | $37.50 |
| gpt-6.1-sol | $1.00 | $0.05 | $1.25 | $5.00 | $2.00 | $0.10 | $2.50 | $7.50 |
| gpt-6-luna | $0.05 | $0.005 | $0.0625 | $0.25 | $0.10 | $0.01 | $0.125 | $0.375 |
| gpt-6-sol | $1.00 | $0.10 | $1.25 | $5.00 | $2.00 | $0.20 | $2.50 | $7.50 |

**Fastpriser för OpenAI:s modeller**

Fast kostar dubbelt så mycket som Standard. Hastighetsläget ska inte blandas ihop med det kommande Ultrafast.

| Modell | Kort sammanhang: inmatning | Kort sammanhang: cachelagrad inmatning | Kort sammanhang: cacheskrivning | Kort sammanhang: utmatning | Långt sammanhang: inmatning | Långt sammanhang: cachelagrad inmatning | Långt sammanhang: cacheskrivning | Långt sammanhang: utmatning |
|---|---|---|---|---|---|---|---|---|
| gpt-6-astra | $20.00 | $2.00 | $25.00 | $100.00 | $40.00 | $4.00 | $50.00 | $150.00 |
| gpt-6.1-sol | $4.00 | $0.20 | $5.00 | $20.00 | $8.00 | $0.40 | $10.00 | $30.00 |
| gpt-6-luna | $0.20 | $0.02 | $0.25 | $1.00 | $0.40 | $0.04 | $0.50 | $1.50 |
| gpt-6-sol | $4.00 | $0.40 | $5.00 | $20.00 | $8.00 | $0.80 | $10.00 | $30.00 |

Regional behandling, där bearbetningen hålls i en bestämd region, medför ett tillägg på 10 procent där den erbjuds. GPT-6.1 Sol har stöd för att hålla data inom USA respektive EU, men Fast är inte tillgängligt när data ska stanna inom EU. Verktyg kan också medföra separata avgifter. API-priserna är inte priser för ett ChatGPT-abonnemang.

## GPT-6.1 Sol i Aipress sju vardagsuppgifter

Vi gav GPT-6.1 Sol samma sju uppgifter som jämförelsemodellerna, med ett försök per uppgift och tankenivån medium. Provet omfattar korrektur av ett kundmejl, felsökning av en Python-funktion, överföring av ett kvitto till JSON, väderfrågor via ett verktyg, avläsning av en kaféprislista från en bild, en Excel-budget för en frisörsalong och en presentation för ett bageri.

GPT-6.1 Sol löste alla sju helt rätt i dessa försök. Sonnet 5.5 fick fem helt rätt och Opus 5.5 sex. För Astra och Grok saknas fullständiga resultatbedömningar i tabellen. Ett streck betyder att resultat inte redovisas där, inte att uppgiften gav noll poäng.

GPT-6.1 Sol hade lägst kostnad för varje uppgift i jämförelsen. Summan blev 0,110 dollar mot 0,527 för Astra, 0,413 för Sonnet, 1,059 för Opus och 0,228 för Grok. Sonnet var snabbast totalt. Sol tog 179,6 sekunder, nära Astras 175,5 sekunder, och var snabbare än Astra på bildprislistan och presentationen. De resultaten gäller de här uppgifterna och försöken, inte all användning av modellerna.

Kostnaderna för OpenAI:s och Anthropics modeller är beräknade med respektive företags listpris per token för anropen. Groks kostnader är de belopp xAI rapporterade. Tiderna är Aipress mätningar.

I kundmejlet rättades alla sju inlagda fel. I Python-uppgiften rättades båda buggarna, men Sol ändrade dessutom avrundningen till två decimaler utan att vi bett om det. Rabattfallet gav då 672,3 i stället för 672. Astra och Opus gjorde samma extra ändring. De efterfrågade rättningarna lyckades, men den extra ändringen är relevant för den som vill ha en strikt avgränsad kodändring.

Kvittoresultatet innehöll enbart giltig JSON, ett format för strukturerade uppgifter som ett program kan läsa direkt. Butik, datum, sex kvittorader, pant på egen rad, totalsumman 210,13 och momsen 22,51 blev rätt. Sol kontrollerade också att summan stämde. Sonnet och Opus hade rätt värden men lade dem i kodblock, alltså en formaterad ruta för kod, trots kravet på enbart JSON.

Väderverktyget anropades för båda orterna. Sol återgav regn och 12 grader respektive mulet och 13 grader och rådde till regnjacka. Från kafébilden räknade modellen fram 156 med tillägget för havredryck inkluderat och visade uträkningen. Sonnet rättade sin första summa, 113, till 156 i samma svar.

Excel-budgeten uppfyllde alla nio krav. Den hade ett blad med intäkter per tjänst, antal och pris, fem kostnadsposter och resultat före skatt. Alla 13 uträkningar var formler, med sparade värden i formelcellerna, och siffrorna stämde vid omräkning. Texten saknade teckenfel och en bild visade hela bladet med mellanslag som tusentalsavgränsare. Exempelresultatet blev 41 500 före skatt.

Bilden av budgetbladet är skapad av GPT-6.1 Sol och visar hela bladet med delarna Intäkter, Kostnader och Summering. De blå siffrorna är inmatningsvärden som går att ändra. Du kan [ladda ned Excel-budgeten för frisörsalongen](/files/posts/gpt-6-1-sol-manadsbudget-frisorsalong.xlsx) och undersöka formlerna i kalkylbladet.

![Bild av kalkylbladet Månadsbudget frisörsalong som GPT-6.1 Sol skapade: intäkter för klippning, färgning och styling, fem kostnadsposter från hyra till försäkring och en summering med resultat före skatt 41 500, med blå inmatningsvärden](https://aipress.se/images/posts/gpt-6-1-sol-budget.webp)

Presentationen uppfyllde alla tio krav: fem bilder i bredbildsformatet 16:9, tydliga rubriker, presentation av bageriet, frukost, fika och catering samt exempelpriser och kontaktuppgifter. Inget hamnade utanför bilderna eller överlappade i de renderade bildfilerna. Varje sida hade sidfoten ”Fiktivt bageri • Alla uppgifter och priser är exempel”. Kontaktadressen slutade på .example och ingen kund namngavs.

Här visas hela presentationen från GPT-6.1 Sol, med varje bild för sig i full bredd. Titelbilden presenterar Kvartersbageriet med raden ”Nybakat till er arbetsdag”. Därefter följer en bild om bageriet, utbudet av frukost, fika och catering, exempelpriser för tre paket och en kontaktbild. Vill du öppna presentationen och granska innehållet finns [Kvartersbageriets PowerPoint-fil att ladda ned](/files/posts/gpt-6-1-sol-kvartersbageriet.pptx).

![Bild 1 av 5 i presentationen GPT-6.1 Sol skapade: titelbilden Kvartersbageriet med raden Nybakat till er arbetsdag och ett mörkgrönt band med Lokalt bageri, Personlig service och Leverans till kontoret](https://aipress.se/images/posts/gpt-6-1-sol-presentation-1.webp)

![Bild 2 av 5: Ett litet bageri med stor omtanke, med en kort presentation av det påhittade familjebageriet och en ruta med fyra punkter under rubriken Det här står vi för](https://aipress.se/images/posts/gpt-6-1-sol-presentation-2.webp)

![Bild 3 av 5: Nybakat för varje tillfälle, med tre kort för Frukost, Fika och Catering och vad varje paket innehåller](https://aipress.se/images/posts/gpt-6-1-sol-presentation-3.webp)

![Bild 4 av 5: Exempelpriser för företag, en tabell med frukostpaket, fikapaket och lunchpaket, vad som ingår, pris per person och minsta antal](https://aipress.se/images/posts/gpt-6-1-sol-presentation-4.webp)

![Bild 5 av 5: Låt oss planera er nästa beställning, med en påhittad kontaktperson, e-postadress och telefonnummer och en mörkgrön ruta som beskriver hur man beställer](https://aipress.se/images/posts/gpt-6-1-sol-presentation-5.webp)

Sammanlagt producerade GPT-6.1 Sol 7 870 utdatatoken i vardagsprovet, varav 4 307 tanketoken. Det synliga svaret är alltså bara en del av den textmängd som påverkar kostnaden.

## Behöver GPT-6.1 Sol medium för att rätta ett mejl?

I vårt separata korrekturprov fick modellen samma kundmejl med sju inlagda fel, en gång på low och en gång på medium. Båda försöken hittade alla sju. Low tog 10,3 sekunder och kostade 0,0048 dollar. Medium tog 13,5 sekunder och kostade 0,0055 dollar. Här gav den högre tankenivån ingen förbättring av antalet hittade fel.

Alla modeller i tabellen hittade sju fel på båda nivåerna utom Grok på low, som hittade sex. Sonnet var snabbast och GPT-6.1 Sol billigast på båda nivåerna. Kostnaderna är beräknade med listpris för OpenAI och Anthropic, medan Groks belopp kommer från xAI. Utdatatoken är modellens producerade textenheter, och antalet inom parentes är den del som användes för resonemang. Resultaten gäller ett försök per nivå.

Vi prövade samma mejl även i Codex CLI. GPT-6.1 Sol och Astra hittade alla sju fel på både low och medium. Astra var snabbare i båda fallen. Tokenantalet här är CLI:ns egen totalsumma för anropet och ska läsas som ett annat mått än utdatatoken i föregående tabell. Sol hade fler token än Astra på low, men färre på medium. CLI-tabellen redovisar inga kostnader.

## GPT-6.1 Sol skrev en bildprompt, gpt-image-2 skapade bilden

I bildprovet skulle GPT-6.1 Sol skriva en engelsk prompt för en fotorealistisk tropisk strand med djur och motivera djurvalet. Den valde Curieuse på Seychellerna, en aldabrajättesköldpadda och två vitstjärtade tropikfåglar. Modellen motiverade valet med den frilevande populationen av jättesköldpaddor på Curieuse och tropikfåglarnas förekomst i ögruppen.

Prompten på 99 ord skickades oförändrad till den separata bildmodellen gpt-image-2, med hög kvalitet och storleken 1536 × 1024 bildpunkter. Bilden visade turkost vatten, ljus sand, granitblock och lutande kokospalmer. Sköldpaddan stod i skuggan och två vita tropikfåglar med långa stjärtfjädrar syntes i luften. Bildgenereringen tog 107,4 sekunder.

Strandbilden som visas här är resultatet från gpt-image-2, med granitblocken, sköldpaddan och de två tropikfåglarna. GPT-6.1 Sol skrev instruktionen till bildmodellen.

![Fotorealistisk bild från gpt-image-2 efter GPT-6.1 Sols prompt: en tropisk strand med turkost vatten, ljus sand, stora granitblock och lutande palmer, en jättesköldpadda i skuggan och två vita tropikfåglar med långa stjärtfjädrar i luften](https://aipress.se/images/posts/gpt-6-1-sol-bildprompt.webp)

Tabellen gäller enbart textprompten. Astra skrev sin prompt snabbare, men GPT-6.1 Sol kostade mindre. Kostnaderna är beräknade med OpenAI:s listpris per token och inkluderar inte bilden från gpt-image-2. Siffran inom parentes anger tanketoken. Försöket visar hur Sol formulerade underlaget till en bildmodell, inte hur Sol själv genererade en bild.

| Mått | GPT-6.1 Sol | GPT-6 Astra |
|---|---|---|
| Tid för prompten | 14,4 s | 9,5 s |
| Utdatatoken (tanke) | 377 (150) | 346 (122) |
| Kostnad för prompten | 0,0040 dollar | 0,0185 dollar |

## Klarade GPT-6.1 Sol att bygga ett spelbart asteroidspel?

GPT-6.1 Sol fick skapa ett litet asteroidspel i cyberpunkstil i en enda HTML-fil som går att öppna i webbläsaren. Samma uppgift gavs på tankenivåerna medium, high, xhigh och max. Varje spel testades i webbläsaren vid 60 och 144 Hz, alltså 60 respektive 144 bilduppdateringar per sekund. Vi lät skeppet stå stilla och skjuta i 20 sekunder och lät sedan en människa spela i mer än en minut.

Alla fyra Sol-spelen uppfyllde de nio grundkraven och startade utan fel i webbläsarens konsol. Rörelserna räknades från förfluten tid, så skepp, skott och asteroider höll samma fart vid båda bildfrekvenserna. En krock kostade ett liv, medan en träff på en asteroid aldrig drog bort något liv. Med tiden kom asteroiderna tätare och föll snabbare.

Alla fyra Sol-spelen var spelbara när en människa styrde skeppet. Det gick att röra sig uppåt, nedåt och i sidled, och skeppets fart räckte för att hinna undan asteroiderna utan att det blev svårt att styra. Ett stillastående skepp blev däremot till slut träffat och förlorade alla liv. Max tog 489,5 sekunder att skapa och kostade 0,2461 dollar. Även medium gav ett spelbart resultat i det här försöket, på 80,1 sekunder för 0,0438 dollar.

Jämförelsetabellen visar också skillnader mot andra modeller. Sonnet på medium och high gav 2,40 gånger högre fart vid den högre bildfrekvensen. Sonnet på xhigh fick jämn fart och bedömdes som spelbart, men tappade alla liv med stillastående skepp. Opus på medium bedömdes som spelbart med en brist och hade jämn fart utom vid toppfarten. Grok på medium och high kraschade direkt. Grok på xhigh startade, men var för snabbt och hade samma problem med bildfrekvensen som Sonnet på de lägre nivåerna.

GPT-6 Astras spel var också spelbart för en människa och höll samma fart vid 60 och 144 Hz. Asteroiderna och skotten i Sol-spelen rörde sig ungefär lika fort som i Astras spel. Astra på medium skapade sitt spel på 58,9 sekunder för 0,2166 dollar, alltså snabbare men till högre kostnad än Sol på medium i dessa försök.

Tiderna och spelproven är Aipress mätningar. Kostnaderna är beräknade från OpenAI:s och Anthropics listpriser för respektive modell, eller rapporterade av xAI för Grok.

| Modell och nivå | Krav uppfyllda | Krasch på första bildrutan | Samma fart på 60 och 144 Hz | Spelbart för en människa | Tid | Kostnad |
|---|---|---|---|---|---|---|
| GPT-6.1 Sol medium | 9 av 9 | Nej | Ja | Ja | 80,1 s | 0,0438 dollar |
| GPT-6.1 Sol high | 9 av 9 | Nej | Ja | Ja | 108,3 s | 0,0606 dollar |
| GPT-6.1 Sol xhigh | 9 av 9 | Nej | Ja | Ja | 287,6 s | 0,1264 dollar |
| GPT-6.1 Sol max | 9 av 9 | Nej | Ja | Ja | 489,5 s | 0,2461 dollar |
| Sonnet 5.5 medium | 9 av 9 | Nej | Nej, 2,40 gånger | Nej | 29,3 s | 0,0579 dollar |
| Sonnet 5.5 high | 9 av 9 | Nej | Nej, 2,40 gånger | Nej | 29,0 s | 0,0627 dollar |
| Sonnet 5.5 xhigh | 9 av 9 | Nej | Ja | Ja, men tappar alla liv om skeppet står still | 181,5 s | 0,3227 dollar |
| Opus 5.5 medium | 9 av 9 | Nej | Ja, utom toppfarten | Ja, med en brist | 54,4 s | 0,1539 dollar |
| GPT-6 Astra medium | 9 av 9 | Nej | Ja | Ja | 58,9 s | 0,2166 dollar |
| Grok 4.7 medium | 2 av 9 | Ja | Kraschade | Nej | 44,5 s | 0,0267 dollar |
| Grok 4.7 high | 2 av 9 | Ja | Kraschade | Nej | 51,5 s | 0,0326 dollar |
| Grok 4.7 xhigh | 9 av 9 | Nej | Nej, 2,40 gånger | Nej, för snabbt | 33,5 s | 0,0209 dollar |

I de stillastående försöken förlorade medium, high och xhigh inga liv. På max förlorades ett liv när en asteroid träffade skeppet, alltså genom en krock. High lät stora asteroider dela sig i två vid träff, medan de större asteroiderna på max tålde två eller tre träffar. De olika spelen hade därmed också olika svårighetsmekanik, trots samma beställning.

![Skärmbild av asteroidspelet GPT-6.1-Sol-Medium som GPT-6.1 Sol skrev på tankenivå medium: rosa och lila asteroider, ett cyanfärgat skepp och ett rosa perspektivrutnät på mörk bakgrund, med poäng, rekord och liv överst](https://aipress.se/images/posts/gpt-6-1-sol-spel-medium.webp)

![Skärmbild av asteroidspelet GPT-6.1-Sol-High som GPT-6.1 Sol skrev på tankenivå high: rosa och lila asteroider, ett cyanfärgat skepp och raden Överlev i neonstormen under rubriken, med poäng och två hjärtan överst](https://aipress.se/images/posts/gpt-6-1-sol-spel-high.webp)

![Skärmbild av asteroidspelet GPT-6.1-Sol-Xhigh som GPT-6.1 Sol skrev på tankenivå xhigh: orange, rosa och lila asteroider, ett skepp med sköldring och ett lila rutnät, med poäng, liv och rekord överst](https://aipress.se/images/posts/gpt-6-1-sol-spel-xhigh.webp)

![Skärmbild av asteroidspelet GPT-6.1-Sol-Max som GPT-6.1 Sol skrev på tankenivå max: lila och rosa asteroider med kratrar, ett cyanfärgat skepp med sköldring och ett rutnät, med poäng, liv 1 av 3 och rekord överst](https://aipress.se/images/posts/gpt-6-1-sol-spel-max.webp)

Skärmbilderna visar GPT-6.1 Sols fyra asteroidspel under pågående spel. Vi kallar versionerna GPT-6.1-Sol-Medium, GPT-6.1-Sol-High, GPT-6.1-Sol-Xhigh och GPT-6.1-Sol-Max efter tankenivån som skapade dem. Alla har mörk bakgrund, neonfärgade asteroider och ett perspektivrutnät, med poäng och liv överst.

| Spelnamn | Tankenivå | Spela i webbläsaren |
|---|---|---|
| GPT-6.1-Sol-Medium | medium | [Klicka här](/files/posts/gpt-6-1-sol-asteroid-medium.html) |
| GPT-6.1-Sol-High | high | [Klicka här](/files/posts/gpt-6-1-sol-asteroid-high.html) |
| GPT-6.1-Sol-Xhigh | xhigh | [Klicka här](/files/posts/gpt-6-1-sol-asteroid-xhigh.html) |
| GPT-6.1-Sol-Max | max | [Klicka här](/files/posts/gpt-6-1-sol-asteroid-max.html) |

Spelkoden är oförändrad i alla fyra versionerna.

## Vad säger systemkortet om GPT-6.1 Sols säkerhet?

OpenAI:s systemkort, företagets tekniska redovisning av modellens egenskaper och säkerhetstester, beskriver både förbättringar och kvarstående svagheter. Företaget behandlar GPT-6.1 Sol som Critical för kapacitet inom cybersäkerhet och High för biologisk och kemisk kapacitet enligt sitt eget riskramverk. Critical avser här bland annat förmåga att självständigt hitta och utveckla fungerande angrepp mot tidigare okända sårbarheter i skyddade system. Klassningen gäller kapacitet, inte andelen vanliga samtal som är farliga. Modellen får samma skydd som Astra och ligger under High-gränsen för självförbättring av AI.

I systemkortets tillägg för GPT-6.1 Sol är modellen bättre än GPT-6 Sol i fem av åtta kategorier med svåra säkerhetsfrågor och i fem av sex kategorier för användare under 18 år. För yngre användare var försämringen i kategorin grovt våldsinnehåll inte statistiskt säkerställd. Bildrelaterade säkerhetstester låg på samma nivå eller bättre än föregångarens. Resultaten innebär ändå inte att varje skydd förbättrats: i testet av känsliga personuppgifter under arbete med verktyg sjönk poängen från 0,854 för GPT-6 Sol till 0,744 för GPT-6.1 Sol, där högre är bättre.

Ett särskilt prov kontrollerade om modellen berättade att sökverktyget var trasigt. GPT-6.1 Sol underlät det i 2,08 procent av fallen, jämfört med 4,92 procent för GPT-6 Sol. Inga försök att kringgå den automatiska säkerhetsgranskaren observerades för GPT-6.1 Sol, Astra eller GPT-6 Sol.

I ett annat prov försökte GPT-6.1 Sol fortsätta trots varningar i 23,5 procent av försöken, mot 64,4 procent för GPT-6 Sol och 17,4 procent för Astra. Provet saknade de systemkontroller som normalt ska hindra sådana försök. Vid test av missvisande uppgifter om kodarbete låg GPT-6.1 Sol på 1,50 procent, något högre än GPT-6 Sols 1,30 procent och Astras 0,51 procent. Frågorna var avsiktligt valda för att framkalla problematiskt beteende och talen beskriver inte vanlig användning.

Motståndet mot indirekta promptattacker, där skadliga instruktioner göms i material modellen läser, var 98,983 procent för GPT-6.1 Sol och 99,050 procent för GPT-6 Sol. På angrepp mot instruktionernas prioritetsordning nådde den nya modellen 99,99 procent, samma som Astra. När modellen försökte kringgå övervakning av sitt resonemang var övervakare som också kunde se dess handlingar bättre på att upptäcka sabotage än de som enbart såg resonemanget.

I simulerade interna Codex-uppgifter fick GPT-6.1 Sol 28 markeringar av allvarligare beteende som en rimlig användare sannolikt starkt skulle invända mot, bland 49 650 jämförda uppgifter. Astra fick 27 och GPT-6 Sol 42. OpenAI framhåller att detta är en signal om risk i företagets interna miljö, inte ett direkt mått på säkerheten för externa användare.

I HealthBench Professional, som bedömer svar i läkares samtal om kliniska frågor, dokumentation och medicinsk forskning, fick GPT-6.1 Sol 64,2 poäng efter justering för svarslängd. Det var 3,4 poäng högre än GPT-6 Sol. Enligt OpenAI låg modellen inom 0,5 procentenheter från Astra i samtliga fyra HealthBench-utvärderingar. Modellen gav längre slutsvar än GPT-6 Sol, men något kortare än Astra. Resultaten beskriver svar i dessa utvärderingar.

Cybersäkerhetskapaciteten visar också varför Astra fortfarande har en egen roll. I det interna ExploitBench-provet med nyligen offentliggjorda sårbarheter lyckades GPT-6.1 Sol få system att utföra kod i 21,5 procent av fallen, mot 5,5 procent för GPT-6 Sol och 31,5 procent för Astra. Det äldre ExploitBench-resultatet på 99,7 procent kan enligt OpenAI vara uppblåst av att modellen tidigare exponerats för historiska sårbarheter. I biologiska kapacitetstester nådde GPT-6.1 Sol inte de redovisade Critical-gränserna.

## GPT-6.1 Sols faktakoll och tekniska gränser

OpenAI testade faktariktighet på avidentifierade ChatGPT-samtal där användare tidigare hade anmält ett faktafel. På low minskade andelen svar med minst ett faktafel från 11,4 procent för GPT-6 Sol till 7,7 procent för GPT-6.1 Sol. Det är ungefär 32 procent färre felsvar i just det provet. På de prövade tankenivåerna låg modellens felandel inom 1,9 procentenheter från Astras. Frågorna är särskilt svåra och representerar inte vardaglig användning.

Modellen tar emot text och bilder och lämnar text som svar. Ljud och video stöds inte. Sammanhangsfönstret, utrymmet för material som modellen kan hantera i samma förfrågan, är 1 050 000 token. Högst 922 000 token kan vara inmatning och högst 128 000 utmatning. Den stora kapaciteten innebär inte att långa förfrågningar har samma pris som korta.

I API heter modellen `gpt-6.1-sol`. Tankenivån väljs med `reasoning.effort` och kan vara `low`, `medium`, `high`, `xhigh` eller `max`. Medium är API-standarden, vilket skiljer sig från low som var förvald i vår CLI-miljö. Inställningarna `none` och `minimal` stöds inte. Den som flyttar ett befintligt program från GPT-6 Sol behöver därför kontrollera inställningarna.

Verktygsanrop kräver Responses API. Chat Completions stöds för förfrågningar utan verktyg. Modellen kan använda bland annat webb- och filsökning, kodtolk, terminal, datorstyrning, instruktionspaket och anslutna externa verktyg. Den kan också anropa ett bildgenereringsverktyg, som är separat från modellens egen textutmatning. Stöd för flera samarbetande agenter finns i beta, där modellen kan dela ut delar av arbetet till underagenter. Anpassning genom ytterligare träning, så kallad finjustering, stöds inte. Modellsidan för GPT-6.1 Sol innehåller API-inställningar och tekniska begränsningar.

OpenAI placerar GPT-6.1 Sol som ett billigare alternativ för återkommande, längre arbete med kod, appar och dokument. Astra behåller rollen för de mest krävande uppgifterna och Luna för tydliga, upprepade uppgifter. I våra försök lyckades Sol med vardagsuppgifterna till låg kostnad och skapade spelbara asteroidspel på alla fyra prövade tankenivåer. För just speluppgiften räckte medium för ett spelbart resultat och hade lägst tidsåtgång och kostnad av de fyra Sol-nivåerna.
