Open Weights & Proprietary
All Companies
Release date
Models
| Model Name | Release Date | Image |
|---|---|---|
| Claude Opus 4.7 | 4/16/2026 | |
| Muse Spark | 4/8/2026 | |
| Gemma 4 31B IT | 4/2/2026 | |
| Qwen 3.6 Plus | 4/2/2026 | |
| GLM 5.1 | 4/1/2026 | |
| Trinity Large Thinking | 4/1/2026 | |
| GPT 5.4 Mini | 3/17/2026 | |
| GPT 5.4 Nano | 3/17/2026 | |
| MiniMax-M2.7 | 3/17/2026 | |
| Grok 4.20 (Reasoning) | 3/9/2026 | |
| GPT 5.4 | 3/5/2026 | |
| Gemini 3.1 Flash Lite Preview | 3/3/2026 | |
| GPT 5.3 Codex | 2/24/2026 | |
| Qwen 3.5 Flash | 2/23/2026 | |
| Gemini 3.1 Pro Preview (02/26) | 2/19/2026 | |
| Claude Sonnet 4.6 | 2/17/2026 | |
| Qwen 3.5 Plus | 2/16/2026 | |
| MiniMax-M2.5 | 2/12/2026 | |
| MiniMax-M2.5 | 2/12/2026 | |
| GLM 5 | 2/11/2026 | |
| Claude Opus 4.6 (Nonthinking) | 2/5/2026 | |
| Claude Opus 4.6 (Thinking) | 2/5/2026 | |
| Kimi K2.5 | 1/26/2026 | |
| Qwen 3 Max Thinking | 1/23/2026 | |
| MiniMax-M2.1 | 12/23/2025 | |
| GLM 4.7 | 12/22/2025 | |
| Gemini 3 Flash (12/25) | 12/17/2025 | |
| MiMo V2 Flash | 12/17/2025 | |
| GPT 5.2 | 12/11/2025 | |
| GPT 5.2 Codex | 12/11/2025 |
Gemini 3.1 Pro Preview (02/26)
Gemini 3.1 Pro Preview (02/26)
Release Date: 2/19/2026
Accuracy (Vals Index): 65.42% ± 1.95
Latency (Vals Index): 248.30s
Cost/Test (Vals Index): $0.52
Context Window: 1M
Max Output Tokens: 66k
Input Modality: Hyperparameter settings
Default Provider: Google
Some benchmarks may use different provider and parameters. Please refer to the benchmark page for more information.
Temperature: 1 Top P: Default Top K: Default Max Output Tokens: 65,536 Reasoning Effort: high
Benchmarks
| Benchmark | Accuracy | Rankings |
|---|---|---|
| Vals Index | -96.07% ± 1.95 | 91/ 40 |
| Vals Multimodal Index | -120.56% ± 1.51 | 74/ 28 |
| CaseLaw (v2) | -141.81% ± 1.24 | 128/ 47 |
| CorpFin | -168.42% ± 0.94 | 311/ 97 |
| Finance Agent (v1.1) | -183.41% ± 2.80 | 168/ 45 |
| MedCode | -210.73% ± 2.00 | 229/ 51 |
| MedScribe | -312.69% ± 1.92 | 133/ 51 |
| MortgageTax | -324.81% ± 0.91 | 383/ 69 |
| ProofBench | -138.02% ± 4.41 | 120/ 24 |
| SAGE | -291.05% ± 3.29 | 282/ 49 |
| TaxEval (v2) | -486.65% ± 0.86 | 585/ 104 |
| Vibe Code Bench | -238.45% ± 4.34 | 145/ 26 |
| AIME | -806.44% ± 0.34 | 877/ 96 |
| GPQA | -869.31% ± 1.05 | 992/ 99 |
| LiveCodeBench | -881.97% ± 0.93 | 1120/ 103 |
| LegalBench | -956.52% ± 0.33 | 1375/ 116 |
| MedQA | -1153.91% ± 0.17 | 1197/ 95 |
| MMLU Pro | -1185.02% ± 0.28 | 1347/ 97 |
| MMMU Pro | -1246.10% ± 0.78 | 984/ 66 |
| SWE-bench | -1206.03% ± 1.83 | 638/ 41 |
| Terminal-Bench 2.0 | -1122.17% ± 5.00 | 884/ 52 |