Opus 5 blir nu standardmodell för Claude Max och det mest avancerade alternativet i Claude Pro. Tanken är att modellen ska fungera som ett vardagsval för krävande kodning, forskning och kontorsarbete - inte bara tas fram när kostnaden spelar mindre roll.
Samma pris som Opus 4.8
Priset ligger kvar på 5 dollar per miljon inmatade tokens och 25 dollar per miljon genererade tokens. För utvecklare finns modellen i API:t under namnet claude-opus-5.
Anthropic erbjuder även ett snabbare läge, Fast mode, där modellen ska arbeta omkring 2,5 gånger så snabbt som normalt. På Claude Platform kostar det dubbelt så mycket som standardläget. I Claude Code används i stället användningskrediter.
Användaren kan också styra hur mycket arbete modellen ska lägga på en uppgift. En högre nivå ger Claude mer utrymme att resonera och kontrollera sitt svar, men förbrukar fler tokens. Lägre nivåer är tänkta för enklare uppgifter där snabbhet och pris väger tyngre.
Det gör skillnad i praktiken. Ett svårfunnet fel i en större kodbas kan vara värt en grundligare körning, medan en enkel funktion sällan behöver samma arbetsinsats. Kostnaden avgörs alltså inte enbart av vilken modell som används, utan också av hur länge den tillåts arbeta.
Det största lyftet syns inom kodning
I Anthropic-tester som Frontier-Bench och GDPval-AA placerar sig Opus 5 högst bland de jämförda modellerna. På cybersäkerhetsområdet ligger den däremot fortfarande efter Claude Mythos 5.
Frontier-Bench v0.1 gav ett särskilt tydligt resultat. Där mer än fördubblade Opus 5 föregångaren Opus 4.8:s poäng, samtidigt som kostnaden per löst uppgift blev lägre. Testet kördes internt av Anthropic med fem försök per uppgift, vilket är värt att ha i åtanke när siffrorna jämförs.
Även i CursorBench 3.2 närmade sig modellen betydligt dyrare Fable 5. Med maximal arbetsinsats skilde mindre än 0,5 procent mellan modellernas bästa resultat, medan Opus 5 kostade hälften så mycket per uppgift. På nivåerna high, xhigh och max gav den enligt Anthropic bättre resultat för pengarna än någon annan modell i jämförelsen.
En förklaring kan vara att Opus 5 har blivit bättre på att granska sitt eget arbete. Modellen försöker inte bara lösa uppgiften, utan kontrollerar resultatet och byter angreppssätt när något inte fungerar.
Anthropic beskriver bland annat ett test där modellen fick en ritning av en maskindel och uppgiften att återskapa den i FreeCAD. Den hade dock inget verktyg för att titta direkt på bilden. Opus 5 skrev då en egen pipeline för datorseende, läste ut geometrin ur bildens råa pixlar och byggde därefter en fungerande 3D-modell.
Modellen klarade uppgiften upprepade gånger. Ingen av de konkurrerande modellerna lyckades under fem försök med samma upplägg.
I ett annat test fick Opus 5 undersöka ett verkligt fel i en populär pakethanterare med öppen källkod. Den hittade grundorsaken och rättade dessutom ett specialfall som hade missats i projektets egen lösning. En konkurrerande modell åtgärdade bara det synliga felet och drog sedan slutsatsen att problemet var löst.
Det är en ganska viktig skillnad. Att skriva kod som ser rätt ut är en sak. Att upptäcka att den fortfarande innehåller ett fel är något annat.
Starkare även på kontorsarbete och forskning
Förbättringarna är inte begränsade till programmering. I ARC-AGI 3, där modeller ställs inför nya typer av problem, fick Opus 5 tre gånger så högt resultat som den näst bästa modellen i Anthropic-jämförelsen.
Zapier AutomationBench mäter i stället om en modell kan genomföra en företagsuppgift från början till slut. Där var andelen godkända uppgifter omkring 1,5 gånger högre än för närmaste konkurrent vid samma kostnad. Redan med den lägsta arbetsinsatsen klarade Opus 5 fler uppgifter än någon annan modell i testet.
Liknande resultat syntes i OSWorld 2.0, som testar hur väl modeller kan använda en dator. Opus 5 slog där de övriga modellerna vid samtliga jämförda kostnadsnivåer. Den passerade även Fable 5:s bästa resultat till strax över en tredjedel av kostnaden.
Inom livsvetenskaper presterade modellen bättre än Opus 4.8 i alla tester som Anthropic redovisar. Områdena omfattade bland annat strukturbiologi, organisk kemi och bioinformatik.
Störst var skillnaden i uppgifter där en molekylstruktur ska räknas fram ur spektroskopiska data. Där ökade resultatet med 10,2 procentenheter. När modellen skulle förutsäga hur förändringar i ett proteins sekvens påverkar dess funktion låg förbättringen på 7,7 procentenheter. Båda siffrorna kommer från företagets interna tester.
Opus 5 ska även kunna skapa bättre visuellt material. I ett av Anthropics exempel byggde modellen en interaktiv vindtunnel som visar hur luft rör sig över föremål med olika aerodynamiska egenskaper. I ett annat skapade den en interaktiv illustration av en cell.
Färre säkerhetsstopp än med Fable 5
I Anthropics automatiserade beteendegranskning fick Opus 5 värdet 2,3 för sammantaget felanpassat beteende. Det var det lägsta resultatet bland företagets senaste modeller. Enligt granskningen följer den Claudes konstitution bättre än Opus 4.8, Sonnet 5 och Fable 5. Den visade också mindre vilseledande beteende och var svårare att lura till missbruk.
Modellen når däremot inte upp till Mythos 5 inom offensiv cybersäkerhet eller avancerad biologisk forskning. Mythos 5 bygger på samma underliggande modell som Fable 5, men är avsedd för en liten grupp granskade organisationer och har tillgång till kapacitet som begränsas i den allmänt tillgängliga versionen.
Skillnaden inom cybersäkerhet märks främst när en upptäckt sårbarhet ska omvandlas till ett fungerande angrepp. Opus 5 är nästan lika bra som Mythos 5 på att hitta säkerhetshål, men ligger betydligt efter när det gäller att utveckla exploateringskod.
Anthropic har medvetet undvikit att träna både Opus 4.8 och Opus 5 på cyberuppgifter. Trots det har Opus 5 blivit bättre även inom detta område, sannolikt som en följd av att modellens allmänna problemlösningsförmåga har ökat.
Skydden tillåter modellen att leta efter sårbarheter i källkod. Däremot blockeras bland annat sårbarhetsskanning av binärfiler, penetrationstestning och generering av exploateringskod.
Anthropic räknar med att dessa klassificerare ingriper omkring 85 procent mer sällan än skydden runt Fable 5. Om en fråga stoppas i Claude.ai, Claude Code eller Claude Cowork skickas den som standard vidare till Opus 4.8. Samma reservlösning går att aktivera i API:t.
Företag och forskare som redan deltar i Cyber Verification Program får tillgång till en version med färre begränsningar. För biologiska frågor har Anthropic samtidigt ändrat sin reservmodell: förfrågningar som stoppas av Fable 5 skickas nu till Opus 5 i stället för Opus 4.8.
Två betafunktioner lanseras samtidigt
I samband med lanseringen släpper Anthropic två nya funktioner i beta.
Den första gör det möjligt för utvecklare att ändra vilka verktyg Claude får använda mitt under ett samtal, utan att promptcachen blir ogiltig. Det kan vara användbart i längre arbetsflöden där modellen behöver olika verktyg i olika delar av uppgiften.
Den andra funktionen är automatiska modellbyten i API:t. Om en fråga stoppas av säkerhetsklassificerarna för Opus 5 eller Fable 5 kan den skickas vidare till en annan modell i stället för att blockeras helt.
Opus 5 har, precis som tidigare modeller i Opus-serien, inga särskilda krav på datalagring vid allmän användning. Modellen har däremot fortfarande tydliga begränsningar vid långvariga och självständiga forskningsuppgifter, framför allt inom biologi.
På papperet är Opus 5 ett stort steg från Opus 4.8. Den kostar lika mycket, presterar bättre i Anthropics tester och kommer i flera fall nära Fable 5 till betydligt lägre kostnad.
Hur stor skillnaden blir utanför kontrollerade tester återstår att se. Benchmarkresultat säger en hel del, men för de flesta användare blir den verkliga prövningen enklare: om modellen oftare löser uppgiften rätt på första försöket.
Thomas Karlsson
Huvudredaktör, AI expert och journalist
Thomas bevakar generativ AI, språkmodeller och verktygen som förändrar hur vi arbetar. Han skriver för dig som vill förstå utvecklingen utan att redan kunna tekniken.