Internasjonale målinger
Våre egne tester viser hvordan modellene løser tre konkrete oppgaver. Her er hva uavhengige, internasjonale målinger sier om de samme modellene. Tallene er målt av andre, med andre oppgaver og innstillinger, og er ikke kontrollert av oss.
← Tilbake til våre testerVåre modeller
Modellene vi har testet
Hver kolonne er én måling, med de som dekker flest av modellene først. Varianten modellen ble målt med står under tallet, fordi kildene ofte måler et annet resonneringsnivå enn vi bruker selv («high»). Listeprisen står fast ytterst til høyre, så den alltid kan leses opp mot målingene. Den er leverandørens egen pris, ikke en måling.
Internasjonale målinger av modellene vi har testet, med leverandørenes listepriser til slutt.
| Modell | Arena tekstArena · 02.10.2026 | Arena kodeArena · 02.10.2026 | Arena agentArena · 02.10.2026 | ECIEpoch AI · 04.10.2026 | GPQAEpoch AI · 04.10.2026 | ARC-AGI-2Epoch AI · 04.10.2026 | HLEEpoch AI · 04.10.2026 | METREpoch AI · 04.10.2026 | ListeprisUSD per 1M tokens, inn / ut |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5.5Anthropic | 1 504high · ±9 · 4 552 stemmer | 1 815max · ±16 · 2 062 stemmer | 0,138high · ±0,022 · 5 359 økter | 167,3±4,0 | 90,6 %max | 91,7 %max | ikke målt | ikke målt | 4 / 20 |
| GPT-6 SolOpenAI | 1 457max · ±7 · 8 787 stemmer | 1 689max · ±11 · 3 411 stemmer | 0,097max · ±0,024 · 6 106 økter | ikke målt | 94,3 %max | 89,6 %max | ikke målt | ikke målt | 2 / 10 |
| Claude Fable 5.1Anthropic | 1 501max · ±6 · 11 800 stemmer | 1 749max · ±10 · 6 318 stemmer | 0,143max · ±0,019 · 15 130 økter | 164,8±3,6 | ikke målt | 88,8 %high | 46,5 %xhigh | ikke målt | 10 / 50 |
| Gemini 3.8 FlashGoogle | 1 495high · ±5 · 26 298 stemmer | 1 583high · ±8 · 8 524 stemmer | 0,030high · ±0,008 · 34 396 økter | 156,9±2,9 | 95,4 %high | ikke målt | 44,5 %nivå ukjent | ikke målt | 0,75 / 3,75 |
| Gemini 3.1 ProGoogle | 1 487±3 · 121 806 stemmer | 1 446±5 · 24 347 stemmer | −0,077±0,010 · 86 483 økter | 154,8±2,4 | 94,4 %high | 77,1 %0,96 USD | 46,4 %high | 6 t 24 min | 2 / 12 |
| Mistral Medium 3.5Mistral AI | 1 427±6 · 11 757 stemmer | 1 263±15 · 2 322 stemmer | −0,124±0,015 · 11 156 økter | 141,4±2,6 | ikke målt | ikke målt | ikke målt | ikke målt | 1,65 / 8,25 |
Ingen av modellene våre er målt ennå i SWE-bench Verified. Målingen står i topplistene og kommer inn i tabellen når kilden har tall.
Høyere er bedre i alle målingene, og for listeprisene er lavere bedre. Varianten modellen ble målt med står under tallet, fordi kildene ofte måler et annet resonneringsnivå enn vi bruker selv («high»). Arena-poeng med få stemmer er usikre.
Sist oppdatert: Epoch AI 4. oktober 2026 · Arena 2. oktober 2026
Slik kan du lese det
Tabellen viser hvordan modellene står seg utenfor våre tre oppgaver. Arena bygger på brukerstemmer, og Epoch AI samler mange prøver med fasit i én indeks.
Målingene er gjort med andre oppgaver, på engelsk og ofte med et annet resonneringsnivå enn vi bruker. Bruk dem sammen med våre resultater, ikke i stedet for dem.
Forklaring
Hva måles
Arena tekst
Brukere stiller samme spørsmål til to anonyme modeller og velger det beste svaret. Resultatet blir en rangering i Arena-poeng, beregnet med Bradley–Terry-modellen og med stilkontroll (svarlengde og formatering teller ikke med), slik Arena selv viser den.
ArenaArena-poeng (Bradley–Terry) · Arena (LMArena)
Arena kode (WebDev)
Som over, men brukerne ber om nettsider og apper og vurderer det som bygges. Her finnes ingen variant med stilkontroll.
ArenaArena-poeng (Bradley–Terry) · Arena (LMArena)
Arena agent
Brukerne vurderer modellen som agent i lengre arbeidsøkter med verktøy. Måles i økter, ikke stemmer.
Arenascore fra −1 til 1 · Arena (LMArena)
Epoch Capabilities Index (ECI)
Epochs samleindeks. Den vekter mange benchmarks etter hvor vanskelige de er, så modeller kan sammenlignes selv om de ikke har tatt nøyaktig samme prøver.
Epoch AIindekspoeng · Epoch AI
GPQA Diamond
198 flervalgsspørsmål i biologi, fysikk og kjemi på doktorgradsnivå. Spørsmålene er laget for at de ikke skal kunne googles.
Epoch AIandel riktige · Epoch AI
ARC-AGI-2
Visuelle mønsteroppgaver som er lette for mennesker og vanskelige for maskiner. Måler evnen til å lære en ny regel fra få eksempler.
Epoch AIandel riktige · Epoch AI etter ARC Prize Foundation
Humanity's Last Exam
«Humanity's Last Exam»: rundt 2 500 svært vanskelige spørsmål fra fagfolk i mange fag.
Epoch AIandel riktige · Epoch AI etter Center for AI Safety og Scale AI (lastexam.ai)
METR tidshorisont
Hvor lange programmeringsoppgaver (målt i menneskelig arbeidstid) modellen løser alene med 50 % sannsynlighet.
Epoch AIminutter menneskelig arbeidstid · Epoch AI etter METR
SWE-bench Verified
Ekte feilrettinger i Python-prosjekter på GitHub. Modellen må skrive en endring som får prosjektets egne tester til å passere.
Epoch AIandel riktige · Epoch AI
Listepris
Leverandørens egen pris per million tokens inn og ut, lest på prissidene deres. Ikke en måling.
USD per 1M tokens · fra leverandøren
Topplister
Toppen i hver måling
De ti beste i hver måling, med kildens egne navn. Arena oppgir plasseringen selv; plasseringen i Epoch-listene er regnet ut av oss, der hvert resonneringsnivå teller som egen rad og like verdier deler plass. Modellene vi har testet, er uthevet. I Arena er bare modeller med minst 1 000 stemmer (økter i Arena agent) tatt med.
Arena tekst
- gemini-4-argon-high 1 525 · 4 932 stemmer
- claude-opus-4-6-high 1 505 · 77 636 stemmer
- claude-fable-5-high 1 504 · 38 387 stemmer
- claude-opus-5.5-high 1 504 testet av oss · 4 552 stemmer
- claude-opus-4-7-high 1 501 · 64 946 stemmer
- claude-fable-5.1-max 1 501 testet av oss · 11 800 stemmer
- claude-opus-4-6 1 497 · 82 189 stemmer
- gemini-3.8-flash-high 1 495 testet av oss · 26 298 stemmer
- muse-spark-1.3-max 1 494 · 12 343 stemmer
- claude-opus-4-7 1 494 · 66 058 stemmer
Arena kode (WebDev)
- claude-opus-5.5-max 1 815 testet av oss · 2 062 stemmer
- gpt-6-astra-max 1 788 · 6 123 stemmer
- claude-sonnet-5.5-xhigh 1 786 · 1 531 stemmer
- gpt-6.1-sol-max 1 758 · 1 620 stemmer
- claude-fable-5.1-max 1 749 testet av oss · 6 318 stemmer
- claude-sonnet-5.5-high 1 715 · 2 527 stemmer
- claude-opus-5-max 1 695 · 16 954 stemmer
- gpt-6-sol-max 1 689 testet av oss · 3 411 stemmer
- gemini-4-argon-high 1 680 · 2 422 stemmer
- qwen3.8-max 1 671 · 3 454 stemmer
Arena agent
- Claude Fable 5.1 (Max) 0,143 testet av oss · 15 130 økter
- Claude Opus 5.5 (High) 0,138 testet av oss · 5 359 økter
- Claude Sonnet 5.5 (Max) 0,125 · 5 219 økter
- GPT 6 Astra (Max) 0,123 · 11 717 økter
- GPT 6.1 Sol (Max) 0,112 · 6 278 økter
- GPT 6 Sol (Max) 0,097 testet av oss · 6 106 økter
- Claude Opus 5 (High) 0,087 · 27 560 økter
- Claude Fable 5 (High) 0,082 · 41 832 økter
- Claude Opus 5 (Max) 0,079 · 22 781 økter
- Gemini 4 Argon (High) 0,076 · 10 030 økter
Epoch Capabilities Index (ECI)
- Claude Opus 5.5 167,3 testet av oss
- GPT-6 Astra 166,5
- Claude Sonnet 5.5 165,2
- Claude Fable 5.1 164,8 testet av oss
- Claude Opus 5 162,9
- GPT-5.5 Pro 162,4
- Claude Fable 5 162,2
- GPT-5.6 Sol 161,8
- GPT-5.6 Terra 159,8
- GPT-5.5 159,2
GPQA Diamond
- GPT-6 Astra (max) 95,8 %
- Claude Sonnet 5.5 (max) 95,6 %
- GPT-6.1 Sol (max) 95,4 %
- Gemini 3.8 Flash (high) 95,4 % testet av oss
- Gemini 3.7 Flash (high) 94,8 %
- GPT-5.4 Pro (xhigh) 94,6 %
- Gemini 3.1 Pro Preview (high) 94,4 % testet av oss
- GPT-6 Sol (max) 94,3 % testet av oss
- Gemini 3.6 Flash (high) 94,1 %
- Gemini 3.1 Pro Preview 94,1 % testet av oss
ARC-AGI-2
- GPT-6 Astra (max) 95,0 %
- GPT-6 Astra (xhigh) 93,3 %
- GPT-5.6 Sol (max) 92,5 %
- Claude Opus 5.5 (xhigh) 92,5 %
- GPT-6 Astra (high) 92,1 %
- GPT-6 Astra (medium) 92,1 %
- Claude Opus 5.5 (max) 91,7 % testet av oss
- Claude Opus 5 (max) 90,4 %
- GPT-5.6 Sol (xhigh) 90,0 %
- Claude Fable 5.1 (max) 90,0 % testet av oss
Humanity's Last Exam
- GPT-6 Astra (unknown thinking) 54,8 %
- Claude Fable 5.1 (xhigh) 46,5 % testet av oss
- Gemini 3.1 Pro Preview 46,4 % testet av oss
- Gemini 3.8 Flash (unknown) 44,5 % testet av oss
- GPT-5.4 Pro 44,3 %
- Muse Spark 40,6 %
- Gemini 3 Pro Preview 37,5 %
- GPT-5.4 (xhigh) 36,2 %
- Claude Opus 4.7 (unknown) 36,2 %
- Claude Opus 4.6 (max) 34,4 %
METR tidshorisont
- Claude Mythos Preview (Early) 17 t 25 min
- Claude Opus 4.6 (unknown thinking) 11 t 59 min
- Gemini 3.1 Pro Preview 6 t 24 min testet av oss
- GPT-5.2 (high) 5 t 52 min
- GPT-5.3 Codex 5 t 50 min
- GPT-5.4 (xhigh) 5 t 42 min
- Claude Opus 4.5 (no thinking) 4 t 53 min
- Claude Opus 4.5 (16k thinking) 4 t 49 min
- Gemini 3 Pro Preview 3 t 44 min
- GPT-5.1-Codex-Max 3 t 44 min
SWE-bench Verified
- Claude Opus 4.7 (max) 83,5 %
- GPT-5.5 (xhigh) 80,6 %
- Gemini 3.5 Flash (high) 79,3 %
- Claude Opus 4.6 (no thinking) 78,7 %
- GLM-5.2 (max) 78,7 %
- DeepSeek v4 Pro (max) 77,6 %
- Qwen3.7 Max 77,3 %
- GPT-5.4 (high) 76,9 %
- Qwen 3.6 Max (Preview) 76,7 %
- Kimi K2.6 76,7 %
Kilder
Kilder og lisens
Tallene hentes på serveren vår og vises uten innhold fra kildenes egne nettsider. Tall fra Epoch og Arena er delt under CC BY 4.0 og gjengis med kreditering. Vi har valgt ut målinger og modeller, avrundet tallene og regnet ut plasseringene i Epochs tall selv.
Epoch AI
Lisens: CC BY 4.0
Epoch AI, ‘Capabilities & benchmarking’. Published online at epoch.ai. Retrieved from ‘https://epoch.ai/benchmarks’ [online resource].
Opprinnelig kilde: Center for AI Safety og Scale AI (lastexam.ai) (Humanity's Last Exam); ARC Prize Foundation (ARC-AGI-2); METR (METR tidshorisont). Tallene er samlet inn av Epoch AI.
Sist hentet 4. oktober 2026 · hentet direkte
Arena (LMArena)
Lisens: CC BY 4.0
Arena (LMArena), leaderboard-dataset, CC BY 4.0. https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset
Sist hentet 4. oktober 2026 · hentet direkte
Andre kilder vi har vurdert
- Artificial Analysis: Vilkårene tillater ikke at tallene vises i tabeller for andre uten skriftlig avtale.
- Scale SEAL: Har ingen åpen datalisens eller maskinlesbar flate, så vi lenker i stedet for å gjengi.
- Vals AI: Har ingen åpen datalisens eller maskinlesbar flate, så vi lenker i stedet for å gjengi.
- LiveBench: Resultatene har ingen lisens, og den siste offentlige tabellen mangler modellene vi tester.