aipress
Nyheter

Claude Opus 5 tar täten i kodtester utan prishöjning

Thomas Karlsson · Publicerad · 6 min

Claude Opus 5 tar täten i kodtester utan prishöjning
Claude Opus 5 tar täten i kodtester utan prishöjning

Claude Opus 5 finns nu på alla plattformar. Den nya AI modellen kostar lika mycket som Opus 4.8, men mer än fördubblar föregångarens resultat i ett stort kodtest och närmar sig Fable 5 till halva kostnaden per uppgift.

Modellen blir samtidigt standardvalet i Claude Max och den starkaste modellen i Claude Pro. För dig som använder Claude till kod, forskning eller kontorsarbete är tanken enkel. Du ska kunna få bättre resultat utan att automatiskt behöva välja den dyraste modellen.

Mer kapacitet för samma kostnad

Opus 5 kostar 5 dollar per miljon token in och 25 dollar per miljon token ut. Token är de textenheter som modellen bearbetar, och priserna är desamma som för Opus 4.8.

Utvecklare kan använda modellen under namnet claude-opus-5 i Claude API. Den finns också i Fast mode, ett snabbare läge som kör omkring 2,5 gånger så fort som standardläget. Där är grundpriset dubbelt på Claude Platform, medan Claude Code använder användningskrediter.

Du kan dessutom välja hur stor arbetsinsats modellen ska lägga på en uppgift. En högre nivå prioriterar förmåga, medan en lägre nivå sparar token och kan ge snabbare och billigare svar.

Tänk dig att du ber modellen reda ut ett svårfunnet fel i ett program. Du kan låta den arbeta grundligare när problemet är knepigt, men dra ned insatsen när du bara vill få ihop en enklare funktion. Det är inte bara vilken modell du väljer som styr kostnaden, utan också hur hårt den får jobba.

Kodtesterna visar det största klivet

I tester av kod och kunskapsarbete som Frontier-Bench och GDPval-AA är Opus 5 den nya ledaren, men modellen ligger fortfarande efter Mythos 5 inom cybersäkerhet. Mythos 5 bygger på samma underliggande modell som Claude Fable 5, men vissa skydd har tagits bort eller stängts av. Den är bara tillgänglig för en liten grupp betrodda organisationer, som cyberförsvarare och infrastrukturleverantörer.

På Frontier-Bench v0.1 gick Opus 5 om alla andra modeller. Resultatet var mer än dubbelt så högt som för Opus 4.8, samtidigt som kostnaden per uppgift var lägre.

I CursorBench 3.2 låg modellen med maximal arbetsinsats inom 0,5 % från Fable 5:s högsta resultat. Kostnaden per uppgift var då hälften så stor. På nivåerna high, xhigh och max gav Opus 5 också bättre resultat vid en given kostnad än övriga modeller i jämförelsen.

Modellen beskrivs som bättre på att kontrollera sitt eget arbete och försöka igen tills uppgiften lyckas. I ett test fick den en ritning av en maskindel och skulle återskapa delen som en 3D-modell i FreeCAD, men utan möjlighet att direkt titta på ritningen.

Opus 5 byggde då en egen pipeline för datorseende, hämtade geometrin ur bildens råa pixlar och rekonstruerade maskindelen. Den lyckades upprepade gånger. Ingen konkurrerande modell med samma upplägg klarade uppgiften efter fem försök.

I ett annat fall hittade modellen grundorsaken till ett verkligt fel i en populär pakethanterare med öppen källkod. Den rättade också ett specialfall som projektets egen rättning hade missat. En konkurrerande modell från en annan tillverkare åtgärdade bara det synliga symtomet och rapporterade sedan att felet var löst.

Skillnaden är rätt handfast. Att skriva kod är en sak, att märka att koden fortfarande är fel är en annan.

Kontorsjobb och forskning får också ett lyft

Opus 5 placerade sig högst även i tester av problemlösning och kunskapsarbete. På ARC-AGI 3, där modellen möter nya problem, blev resultatet tre gånger så högt som för den näst bästa modellen.

I Zapier AutomationBench testas om en modell kan slutföra företagsuppgifter från början till slut. Där var Opus 5:s andel godkända uppgifter omkring 1,5 gånger så hög som för nästa modell vid samma kostnad. Redan på den lägsta arbetsinsatsen klarade den fler uppgifter än någon annan modell.

På OSWorld 2.0, som mäter hur modeller använder en dator, slog Opus 5 övriga modeller vid varje jämförd kostnadsnivå. Den passerade Fable 5:s bästa resultat till strax över en tredjedel av kostnaden.

För vetenskapligt arbete presterade modellen bättre än Opus 4.8 i samtliga redovisade tester inom livsvetenskaper. Testerna omfattade bland annat strukturbiologi, organisk kemi och bioinformatik.

Det tydligaste lyftet kom i uppgifter där molekylstrukturer ska räknas ut från spektroskopidata. Där fick Opus 5 ett 10,2 procentenheter högre resultat än Opus 4.8 i det interna testet. När uppgiften var att förutsäga hur variationer i ett proteins sekvens påverkar dess funktion var förbättringen 7,7 procentenheter.

Modellen kan även skapa starkare visuella resultat. I ett interaktivt exempel visade den hur luft strömmar över både aerodynamiska och mindre aerodynamiska föremål.

Skydden släpper igenom mer legitimt arbete

Opus 5 fick resultatet 2,3 för sammantaget felanpassat beteende i den automatiserade beteendegranskningen. Det var den lägsta nivån bland de senaste modellerna. Den följde också Claudes Constitution bättre än Opus 4.8, Sonnet 5 och Fable 5, visade minst vilseledande beteende och var svårast att lura till missbruk.

Samtidigt ligger modellen fortfarande efter Mythos 5 inom biologisk forskning och offensiv cybersäkerhet. Att hitta ett säkerhetshål och att använda det för att ta sig in är två olika färdigheter, ungefär som att upptäcka en olåst dörr och faktiskt kunna genomföra ett inbrott. Opus 5 är nästan lika bra som Mythos 5 på att hitta hålen, men ligger långt efter på att göra om en upptäckt brist till ett fungerande angrepp. Anthropic valde medvetet att inte träna Opus 5 på cyberuppgifter, men modellen blev ändå betydligt bättre på dem när dess allmänna förmåga ökade.

Skydden tillåter Opus 5 att hitta sårbarheter i källkod. De blockerar däremot sårbarhetsskanning av binärfiler, penetrationstestning och framställning av exploateringskod.

Klassificerarna väntas ingripa omkring 85 % mer sällan än motsvarande skydd för Fable 5. Om en fråga flaggas i Claude.ai, Claude Code eller Claude Cowork går den som standard vidare till Opus 4.8. Samma reservlösning kan aktiveras via API.

Företag och forskare som redan deltar i Cyber Verification Program får direkt tillgång till en version med färre säkerhetsbegränsningar. Inom biologi skickas frågor som blockeras för Fable 5 nu till Opus 5 i stället för Opus 4.8.

Två nya betafunktioner följer med

Utvecklare kan nu byta vilka verktyg Claude får använda mitt i ett samtal utan att promptcachen blir ogiltig. Funktionen släpps som beta på Claude Platform.

Även automatiska modellbyten kommer i beta till API:t. Om säkerhetsklassificerarna stoppar en fråga till Opus 5 eller Fable 5 kan den skickas vidare till en annan modell i stället för att blockeras helt.

För allmän åtkomst ställs inga krav på datalagring, i linje med tidigare Opus-modeller. Men långvariga, självständiga forskningsuppgifter är fortfarande en tydlig begränsning, särskilt inom biologi.

Opus 5 är byggd för att användas varje dag och arbeta effektivare än andra modeller. På papperet och i jämförelsetester är den tydligt bättre än Opus 4.8 och kommer mycket nära Fable 5:s intelligensnivå i teknikens framkant till halva priset. Den närmaste tiden får visa hur effektiv modellen är i vardaglig användning.

#Anthropic#Claude