Sist oppdatert: 2026-09-02

AI-benchmark på norsk: dagens beste modeller

Over 350 AI-modeller evalueres hver morgen — de beste på norsk språkkvalitet, hastighet og verdi presenteres her.

Les ukesrapporter → Sammenlign modeller → ChatGPT vs Claude → Gemini vs ChatGPT →

Slik leser du benchmarken

Benchmarken er laget for praktiske valg, ikke bare rangering. Se først på oppgaven din, deretter på språk, pris, fart og stabilitet.

Skal du skrive eller jobbe på norsk?

Start med språk-score og hvilkenAI-score. Høy totalscore er nyttig, men språk-kvalitet bør veie tyngst når svaret skal publiseres eller sendes videre.

Skal du bruke AI ofte eller via API?

Se på pris per million tokens og verdi-score. En rimelig modell kan være best når du kjører mange oppgaver eller bygger produkt.

Trenger du raske svar?

Se på tokens per sekund og stabilitet. Rask modell gir bedre flyt i chat, kundeservice, automasjoner og verktøy der ventetid merkes.

Beste i sin klasse

🏆
Høyest score
Cohere: Command R+ (08-2024)
8.4/10
🇳🇴
Best på norsk
Google: Gemini 3.5 Flash Lite
9.7/10
Raskest
OpenAI: GPT-5.6 Luna Pro
1020 t/s
💰
Billigst (score ≥ 3)
Meta: Llama 3.2 1B Instruct
$0.03/1M
📊
Beste verdi
IBM: Granite 4.0 Micro
Verdi 316.7
🔗
Beste orkestrator
Cohere: Command R+ (08-2024)
Orch 9.7/10

Er premium verdt det?

Premium norsk-score
8.3/10
Mid-range norsk-score
8.9/10
Prisforskjell
~24×

For norsk tekst og enkle oppgaver holder mid-range svært godt. Premium lønner seg ved kompleks resonnering, lange dokumenter og når presisjon er kritisk.

Alle resultater

# Modell Tier t/s TTFT norsk Instr Score Orch. Verdi EU Pris/1M
1
Cohere: Command R+ (08-2024)
cohere
Stabil
Premium 173 115 ms 9.7 10.0 8.4 9.7 3.9 $2.50
≈23 kr
2
Google: Gemini 3.5 Flash Lite
google
Stabil
Mid-range 171 98 ms 9.7 10.0 8.4 9.7 31.7 ~EU $0.30
≈3 kr
3
Anthropic: Claude Haiku 4.5
anthropic
Stabil
Mid-range 139 101 ms 9.7 10.0 8.3 9.7 9.7 🇪🇺 EU $1.00
≈9 kr
4
Cohere: Command R7B (12-2024)
cohere
Stabil
Budsjett 276 57 ms 9.7 9.3 7.2 9.0 190.0 $0.04
≈0 kr
5
IBM: Granite 4.0 Micro
ibm-granite
Stabil
Budsjett 220 73 ms 9.0 10.0 7.1 9.0 316.7 $0.02
≈0 kr
6
Google: Gemma 3 4B
google
Budsjett 267 57 ms 9.0 9.3 8.0 8.4 152.8 ~EU $0.05
≈0 kr
7
Meta: Llama 4 Maverick
meta-llama
Stabil
Mid-range 226 91 ms 8.3 10.0 7.5 8.3 43.7 $0.20
≈2 kr
8
OpenAI: GPT-5.6 Luna Pro
openai
Mid-range 1020 18 ms 8.0 9.3 7.6 7.5 41.3 $0.20
≈2 kr
9
Claude Opus 5
anthropic
Premium 234 84 ms 8.0 9.3 7.2 7.5 1.7 🇪🇺 EU $5.00
≈47 kr
10
OpenAI: GPT-5.5 Pro
openai
Premium 301 57 ms 8.0 8.7 7.3 6.9 0.3 $30.00
≈280 kr
11
Perplexity: Sonar Pro
perplexity
Stabil
Premium 72 245 ms 7.7 10.0 6.6 7.7 2.9 ~EU $3.00
≈28 kr
12
Meta: Llama 3.2 1B Instruct
meta-llama
Stabil
Budsjett 281 101 ms 7.7 7.3 4.7 5.6 187.5 $0.03
≈0 kr

Responstid siste 14 dager

Slik tester vi

Vi evaluerer over 350 AI-modeller og presenterer de beste resultatene hver morgen. Scoren kombinerer språkforståelse, kvalitet, hastighet, pris og stabilitet. Den nøyaktige vektingen er proprietær.

Les mer om metodikken →

Vanlige spørsmål

Vi evaluerer over 350 tilgjengelige modeller og presenterer de beste resultatene fra siste benchmark. Utvalget oppdateres dynamisk når markedet endrer seg.

Språk-scoren viser hvor godt modellen leverer svar på riktig språk og med god språkkvalitet. Scoren vises som et normalisert tall.

Instruksjons-scoren viser hvor godt modellen følger oppgaven den får. Vi viser resultatet som en enkel, normalisert score.

Scoren kombinerer språkforståelse, kvalitet, hastighet, pris og stabilitet. Den nøyaktige vektingen er proprietær.

Beste verdi peker på modeller som gir sterke resultater i forhold til pris. Den nøyaktige beregningen er proprietær.