Hopp til hovedinnhold

Modelltester

Internasjonale målinger

Våre egne tester viser hvordan modellene løser tre konkrete oppgaver. Her er hva uavhengige, internasjonale målinger sier om de samme modellene. Tallene er målt av andre, med andre oppgaver og innstillinger, og er ikke kontrollert av oss.

← Tilbake til våre tester

Våre modeller

Modellene vi har testet

Hver kolonne er én måling, med de som dekker flest av modellene først. Varianten modellen ble målt med står under tallet, fordi kildene ofte måler et annet resonneringsnivå enn vi bruker selv («high»). Listeprisen står fast ytterst til høyre, så den alltid kan leses opp mot målingene. Den er leverandørens egen pris, ikke en måling.

Internasjonale målinger av modellene vi har testet, med leverandørenes listepriser til slutt.

Internasjonale målinger av modellene vi har testet, med leverandørenes listepriser til slutt.
ModellArena tekstArena · 02.10.2026Arena kodeArena · 02.10.2026Arena agentArena · 02.10.2026ECIEpoch AI · 04.10.2026GPQAEpoch AI · 04.10.2026ARC-AGI-2Epoch AI · 04.10.2026HLEEpoch AI · 04.10.2026METREpoch AI · 04.10.2026ListeprisUSD per 1M tokens, inn / ut
Claude Opus 5.5Anthropic1 504high · ±9 · 4 552 stemmer1 815max · ±16 · 2 062 stemmer0,138high · ±0,022 · 5 359 økter167,3±4,090,6 %max91,7 %maxikke måltikke målt4 / 20
GPT-6 SolOpenAI1 457max · ±7 · 8 787 stemmer1 689max · ±11 · 3 411 stemmer0,097max · ±0,024 · 6 106 økterikke målt94,3 %max89,6 %maxikke måltikke målt2 / 10
Claude Fable 5.1Anthropic1 501max · ±6 · 11 800 stemmer1 749max · ±10 · 6 318 stemmer0,143max · ±0,019 · 15 130 økter164,8±3,6ikke målt88,8 %high46,5 %xhighikke målt10 / 50
Gemini 3.8 FlashGoogle1 495high · ±5 · 26 298 stemmer1 583high · ±8 · 8 524 stemmer0,030high · ±0,008 · 34 396 økter156,9±2,995,4 %highikke målt44,5 %nivå ukjentikke målt0,75 / 3,75
Gemini 3.1 ProGoogle1 487±3 · 121 806 stemmer1 446±5 · 24 347 stemmer−0,077±0,010 · 86 483 økter154,8±2,494,4 %high77,1 %0,96 USD46,4 %high6 t 24 min2 / 12
Mistral Medium 3.5Mistral AI1 427±6 · 11 757 stemmer1 263±15 · 2 322 stemmer−0,124±0,015 · 11 156 økter141,4±2,6ikke måltikke måltikke måltikke målt1,65 / 8,25

Ingen av modellene våre er målt ennå i SWE-bench Verified. Målingen står i topplistene og kommer inn i tabellen når kilden har tall.

Høyere er bedre i alle målingene, og for listeprisene er lavere bedre. Varianten modellen ble målt med står under tallet, fordi kildene ofte måler et annet resonneringsnivå enn vi bruker selv («high»). Arena-poeng med få stemmer er usikre.

Sist oppdatert: Epoch AI 4. oktober 2026 · Arena 2. oktober 2026

Slik kan du lese det

Tabellen viser hvordan modellene står seg utenfor våre tre oppgaver. Arena bygger på brukerstemmer, og Epoch AI samler mange prøver med fasit i én indeks.

Målingene er gjort med andre oppgaver, på engelsk og ofte med et annet resonneringsnivå enn vi bruker. Bruk dem sammen med våre resultater, ikke i stedet for dem.

Forklaring

Hva måles

  • Arena tekst

    Brukere stiller samme spørsmål til to anonyme modeller og velger det beste svaret. Resultatet blir en rangering i Arena-poeng, beregnet med Bradley–Terry-modellen og med stilkontroll (svarlengde og formatering teller ikke med), slik Arena selv viser den.

    ArenaArena-poeng (Bradley–Terry) · Arena (LMArena)

  • Arena kode (WebDev)

    Som over, men brukerne ber om nettsider og apper og vurderer det som bygges. Her finnes ingen variant med stilkontroll.

    ArenaArena-poeng (Bradley–Terry) · Arena (LMArena)

  • Arena agent

    Brukerne vurderer modellen som agent i lengre arbeidsøkter med verktøy. Måles i økter, ikke stemmer.

    Arenascore fra −1 til 1 · Arena (LMArena)

  • Epoch Capabilities Index (ECI)

    Epochs samleindeks. Den vekter mange benchmarks etter hvor vanskelige de er, så modeller kan sammenlignes selv om de ikke har tatt nøyaktig samme prøver.

    Epoch AIindekspoeng · Epoch AI

  • GPQA Diamond

    198 flervalgsspørsmål i biologi, fysikk og kjemi på doktorgradsnivå. Spørsmålene er laget for at de ikke skal kunne googles.

    Epoch AIandel riktige · Epoch AI

  • ARC-AGI-2

    Visuelle mønsteroppgaver som er lette for mennesker og vanskelige for maskiner. Måler evnen til å lære en ny regel fra få eksempler.

    Epoch AIandel riktige · Epoch AI etter ARC Prize Foundation

  • Humanity's Last Exam

    «Humanity's Last Exam»: rundt 2 500 svært vanskelige spørsmål fra fagfolk i mange fag.

    Epoch AIandel riktige · Epoch AI etter Center for AI Safety og Scale AI (lastexam.ai)

  • METR tidshorisont

    Hvor lange programmeringsoppgaver (målt i menneskelig arbeidstid) modellen løser alene med 50 % sannsynlighet.

    Epoch AIminutter menneskelig arbeidstid · Epoch AI etter METR

  • SWE-bench Verified

    Ekte feilrettinger i Python-prosjekter på GitHub. Modellen må skrive en endring som får prosjektets egne tester til å passere.

    Epoch AIandel riktige · Epoch AI

  • Listepris

    Leverandørens egen pris per million tokens inn og ut, lest på prissidene deres. Ikke en måling.

    USD per 1M tokens · fra leverandøren

Topplister

Toppen i hver måling

De ti beste i hver måling, med kildens egne navn. Arena oppgir plasseringen selv; plasseringen i Epoch-listene er regnet ut av oss, der hvert resonneringsnivå teller som egen rad og like verdier deler plass. Modellene vi har testet, er uthevet. I Arena er bare modeller med minst 1 000 stemmer (økter i Arena agent) tatt med.

Arena tekst

  1. gemini-4-argon-high 1 525 · 4 932 stemmer
  2. claude-opus-4-6-high 1 505 · 77 636 stemmer
  3. claude-fable-5-high 1 504 · 38 387 stemmer
  4. claude-opus-5.5-high 1 504 testet av oss · 4 552 stemmer
  5. claude-opus-4-7-high 1 501 · 64 946 stemmer
  6. claude-fable-5.1-max 1 501 testet av oss · 11 800 stemmer
  7. claude-opus-4-6 1 497 · 82 189 stemmer
  8. gemini-3.8-flash-high 1 495 testet av oss · 26 298 stemmer
  9. muse-spark-1.3-max 1 494 · 12 343 stemmer
  10. claude-opus-4-7 1 494 · 66 058 stemmer

Arena kode (WebDev)

  1. claude-opus-5.5-max 1 815 testet av oss · 2 062 stemmer
  2. gpt-6-astra-max 1 788 · 6 123 stemmer
  3. claude-sonnet-5.5-xhigh 1 786 · 1 531 stemmer
  4. gpt-6.1-sol-max 1 758 · 1 620 stemmer
  5. claude-fable-5.1-max 1 749 testet av oss · 6 318 stemmer
  6. claude-sonnet-5.5-high 1 715 · 2 527 stemmer
  7. claude-opus-5-max 1 695 · 16 954 stemmer
  8. gpt-6-sol-max 1 689 testet av oss · 3 411 stemmer
  9. gemini-4-argon-high 1 680 · 2 422 stemmer
  10. qwen3.8-max 1 671 · 3 454 stemmer

Arena agent

  1. Claude Fable 5.1 (Max) 0,143 testet av oss · 15 130 økter
  2. Claude Opus 5.5 (High) 0,138 testet av oss · 5 359 økter
  3. Claude Sonnet 5.5 (Max) 0,125 · 5 219 økter
  4. GPT 6 Astra (Max) 0,123 · 11 717 økter
  5. GPT 6.1 Sol (Max) 0,112 · 6 278 økter
  6. GPT 6 Sol (Max) 0,097 testet av oss · 6 106 økter
  7. Claude Opus 5 (High) 0,087 · 27 560 økter
  8. Claude Fable 5 (High) 0,082 · 41 832 økter
  9. Claude Opus 5 (Max) 0,079 · 22 781 økter
  10. Gemini 4 Argon (High) 0,076 · 10 030 økter

Epoch Capabilities Index (ECI)

  1. Claude Opus 5.5 167,3 testet av oss
  2. GPT-6 Astra 166,5
  3. Claude Sonnet 5.5 165,2
  4. Claude Fable 5.1 164,8 testet av oss
  5. Claude Opus 5 162,9
  6. GPT-5.5 Pro 162,4
  7. Claude Fable 5 162,2
  8. GPT-5.6 Sol 161,8
  9. GPT-5.6 Terra 159,8
  10. GPT-5.5 159,2

GPQA Diamond

  1. GPT-6 Astra (max) 95,8 %
  2. Claude Sonnet 5.5 (max) 95,6 %
  3. GPT-6.1 Sol (max) 95,4 %
  4. Gemini 3.8 Flash (high) 95,4 % testet av oss
  5. Gemini 3.7 Flash (high) 94,8 %
  6. GPT-5.4 Pro (xhigh) 94,6 %
  7. Gemini 3.1 Pro Preview (high) 94,4 % testet av oss
  8. GPT-6 Sol (max) 94,3 % testet av oss
  9. Gemini 3.6 Flash (high) 94,1 %
  10. Gemini 3.1 Pro Preview 94,1 % testet av oss

ARC-AGI-2

  1. GPT-6 Astra (max) 95,0 %
  2. GPT-6 Astra (xhigh) 93,3 %
  3. GPT-5.6 Sol (max) 92,5 %
  4. Claude Opus 5.5 (xhigh) 92,5 %
  5. GPT-6 Astra (high) 92,1 %
  6. GPT-6 Astra (medium) 92,1 %
  7. Claude Opus 5.5 (max) 91,7 % testet av oss
  8. Claude Opus 5 (max) 90,4 %
  9. GPT-5.6 Sol (xhigh) 90,0 %
  10. Claude Fable 5.1 (max) 90,0 % testet av oss

Humanity's Last Exam

  1. GPT-6 Astra (unknown thinking) 54,8 %
  2. Claude Fable 5.1 (xhigh) 46,5 % testet av oss
  3. Gemini 3.1 Pro Preview 46,4 % testet av oss
  4. Gemini 3.8 Flash (unknown) 44,5 % testet av oss
  5. GPT-5.4 Pro 44,3 %
  6. Muse Spark 40,6 %
  7. Gemini 3 Pro Preview 37,5 %
  8. GPT-5.4 (xhigh) 36,2 %
  9. Claude Opus 4.7 (unknown) 36,2 %
  10. Claude Opus 4.6 (max) 34,4 %

METR tidshorisont

  1. Claude Mythos Preview (Early) 17 t 25 min
  2. Claude Opus 4.6 (unknown thinking) 11 t 59 min
  3. Gemini 3.1 Pro Preview 6 t 24 min testet av oss
  4. GPT-5.2 (high) 5 t 52 min
  5. GPT-5.3 Codex 5 t 50 min
  6. GPT-5.4 (xhigh) 5 t 42 min
  7. Claude Opus 4.5 (no thinking) 4 t 53 min
  8. Claude Opus 4.5 (16k thinking) 4 t 49 min
  9. Gemini 3 Pro Preview 3 t 44 min
  10. GPT-5.1-Codex-Max 3 t 44 min

SWE-bench Verified

  1. Claude Opus 4.7 (max) 83,5 %
  2. GPT-5.5 (xhigh) 80,6 %
  3. Gemini 3.5 Flash (high) 79,3 %
  4. Claude Opus 4.6 (no thinking) 78,7 %
  5. GLM-5.2 (max) 78,7 %
  6. DeepSeek v4 Pro (max) 77,6 %
  7. Qwen3.7 Max 77,3 %
  8. GPT-5.4 (high) 76,9 %
  9. Qwen 3.6 Max (Preview) 76,7 %
  10. Kimi K2.6 76,7 %

Kilder

Kilder og lisens

Tallene hentes på serveren vår og vises uten innhold fra kildenes egne nettsider. Tall fra Epoch og Arena er delt under CC BY 4.0 og gjengis med kreditering. Vi har valgt ut målinger og modeller, avrundet tallene og regnet ut plasseringene i Epochs tall selv.

  • Epoch AI

    Lisens: CC BY 4.0

    Epoch AI, ‘Capabilities & benchmarking’. Published online at epoch.ai. Retrieved from ‘https://epoch.ai/benchmarks’ [online resource].

    Opprinnelig kilde: Center for AI Safety og Scale AI (lastexam.ai) (Humanity's Last Exam); ARC Prize Foundation (ARC-AGI-2); METR (METR tidshorisont). Tallene er samlet inn av Epoch AI.

    Sist hentet 4. oktober 2026 · hentet direkte

  • Arena (LMArena)

    Lisens: CC BY 4.0

    Arena (LMArena), leaderboard-dataset, CC BY 4.0. https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset

    Sist hentet 4. oktober 2026 · hentet direkte

Andre kilder vi har vurdert

  • Artificial Analysis: Vilkårene tillater ikke at tallene vises i tabeller for andre uten skriftlig avtale.
  • Scale SEAL: Har ingen åpen datalisens eller maskinlesbar flate, så vi lenker i stedet for å gjengi.
  • Vals AI: Har ingen åpen datalisens eller maskinlesbar flate, så vi lenker i stedet for å gjengi.
  • LiveBench: Resultatene har ingen lisens, og den siste offentlige tabellen mangler modellene vi tester.