Open Weights & Proprietary

All Companies

Release date

Models

Model Name Release Date Image
Claude Opus 4.7 4/16/2026
Muse Spark 4/8/2026
Gemma 4 31B IT 4/2/2026
Qwen 3.6 Plus 4/2/2026
GLM 5.1 4/1/2026
Trinity Large Thinking 4/1/2026
GPT 5.4 Mini 3/17/2026
GPT 5.4 Nano 3/17/2026
MiniMax-M2.7 3/17/2026
Grok 4.20 (Reasoning) 3/9/2026
GPT 5.4 3/5/2026
Gemini 3.1 Flash Lite Preview 3/3/2026
GPT 5.3 Codex 2/24/2026
Qwen 3.5 Flash 2/23/2026
Gemini 3.1 Pro Preview (02/26) 2/19/2026
Claude Sonnet 4.6 2/17/2026
Qwen 3.5 Plus 2/16/2026
MiniMax-M2.5 2/12/2026
MiniMax-M2.5 2/12/2026
GLM 5 2/11/2026
Claude Opus 4.6 (Nonthinking) 2/5/2026
Claude Opus 4.6 (Thinking) 2/5/2026
Kimi K2.5 1/26/2026
Qwen 3 Max Thinking 1/23/2026
MiniMax-M2.1 12/23/2025
GLM 4.7 12/22/2025
Gemini 3 Flash (12/25) 12/17/2025
MiMo V2 Flash 12/17/2025
GPT 5.2 12/11/2025
GPT 5.2 Codex 12/11/2025

Gemini 3.1 Pro Preview (02/26)

Compare Models

Gemini 3.1 Pro Preview (02/26)

Release Date: 2/19/2026

Accuracy (Vals Index): 65.42% ± 1.95 Latency (Vals Index): 248.30s
Cost/Test (Vals Index): $0.52 Context Window: 1M
Max Output Tokens: 66k
Input Modality: Hyperparameter settings Default Provider: Google


Some benchmarks may use different provider and parameters. Please refer to the benchmark page for more information.

Temperature: 1 Top P: Default Top K: Default Max Output Tokens: 65,536 Reasoning Effort: high


Benchmarks

Benchmark Accuracy Rankings
Vals Index -96.07% ± 1.95 91/ 40
Vals Multimodal Index -120.56% ± 1.51 74/ 28
CaseLaw (v2) -141.81% ± 1.24 128/ 47
CorpFin -168.42% ± 0.94 311/ 97
Finance Agent (v1.1) -183.41% ± 2.80 168/ 45
MedCode -210.73% ± 2.00 229/ 51
MedScribe -312.69% ± 1.92 133/ 51
MortgageTax -324.81% ± 0.91 383/ 69
ProofBench -138.02% ± 4.41 120/ 24
SAGE -291.05% ± 3.29 282/ 49
TaxEval (v2) -486.65% ± 0.86 585/ 104
Vibe Code Bench -238.45% ± 4.34 145/ 26
AIME -806.44% ± 0.34 877/ 96
GPQA -869.31% ± 1.05 992/ 99
LiveCodeBench -881.97% ± 0.93 1120/ 103
LegalBench -956.52% ± 0.33 1375/ 116
MedQA -1153.91% ± 0.17 1197/ 95
MMLU Pro -1185.02% ± 0.28 1347/ 97
MMMU Pro -1246.10% ± 0.78 984/ 66
SWE-bench -1206.03% ± 1.83 638/ 41
Terminal-Bench 2.0 -1122.17% ± 5.00 884/ 52