Open Weights & Proprietary
All Companies
Release date
| Model | Release Date |
|---|---|
| Claude Opus 4.7 | 4/16/2026 |
| Muse Spark | 4/8/2026 |
| Gemma 4 31B IT | 4/2/2026 |
| Qwen 3.6 Plus | 4/2/2026 |
| GLM 5.1 | 4/1/2026 |
| Trinity Large Thinking | 4/1/2026 |
| GPT 5.4 Mini | 3/17/2026 |
| GPT 5.4 Nano | 3/17/2026 |
| MiniMax-M2.7 | 3/17/2026 |
| Grok 4.20 (Reasoning) | 3/9/2026 |
| GPT 5.4 | 3/5/2026 |
| Gemini 3.1 Flash Lite Preview | 2/24/2026 |
| GPT 5.3 Codex | 2/23/2026 |
| Qwen 3.5 Flash | 2/19/2026 |
| Gemini 3.1 Pro Preview (02/26) | 2/17/2026 |
| Claude Sonnet 4.6 | 2/16/2026 |
| Qwen 3.5 Plus | 2/12/2026 |
| MiniMax-M2.5 | 2/12/2026 |
| MiniMax-M2.5 | 2/11/2026 |
| GLM 5 | 2/5/2026 |
| Claude Opus 4.6 (Nonthinking) | 2/5/2026 |
| Claude Opus 4.6 (Thinking) | 1/26/2026 |
| Kimi K2.5 | 1/23/2026 |
| Qwen 3 Max Thinking | 12/23/2025 |
| MiniMax-M2.1 | 12/22/2025 |
| GLM 4.7 | 12/17/2025 |
| Gemini 3 Flash (12/25) | 12/17/2025 |
| MiMo V2 Flash | 12/11/2025 |
| GPT 5.2 | 12/11/2025 |
| GPT 5.2 Codex | 12/11/2025 |
Claude Sonnet 4.5 (Thinking)
Release Date: 9/29/2025
Accuracy (Vals Index): 59.88% ± 1.97
Latency (Vals Index): 276.83s
Cost/Test (Vals Index): $0.66
Context Window: 1M
Max Output Tokens: 64k
Input Modality: Hyperparameter settings
Default Provider: Anthropic
Temperature: 1
Top P: Default
Top K: Default
Max Output Tokens: 64,000
Benchmarks
Accuracy Rankings
Vals Index -171.02% ± 1.97 ; 114/40
Vals Multimodal Index -196.54% ± 1.55 ; 79/28
CaseLaw (v2) -237.11% ± 1.55 ; 161/47
CorpFin -270.72% ± 0.96 ; 420/97
Finance Agent (v1.1) -270.55% ± 2.86 ; 204/45
MedCode -247.23% ± 2.00 ; 242/51
MedScribe -528.52% ± 1.87 ; 315/51
MortgageTax -448.60% ± 0.96 ; 378/69
ProofBench -147.94% ± 3.94 ; 133/24
SAGE -310.45% ± 3.21 ; 213/49
TaxEval (v2) -695.02% ± 0.86 ; 835/104
AIME -917.69% ± 0.69 ; 783/96
GPQA -929.15% ± 2.25 ; 907/99
IOI -227.54% ± 5.92 ; 497/50
LiveCodeBench -1005.98% ± 1.13 ; 888/103
LegalBench -1231.25% ± 0.45 ; 1595/116
MedQA -1500.79% ± 0.20 ; 1363/95
MMLU Pro -1496.41% ± 0.39 ; 1604/97
MMMU Pro -1461.89% ± 0.97 ; 859/66
SWE-bench -1387.37% ± 2.05 ; 398/41
Terminal-Bench 2.0 -884.24% ± 5.25 ; 775/52
Contact us
Or send us an email at contact@vals.ai
Proprietary Benchmarks: contact us to get access.