Open Weights & Proprietary
Release date
| Models | Release Date |
|---|---|
| Claude Opus 4.7 | 4/16/2026 |
| Muse Spark | 4/8/2026 |
| Gemma 4 31B IT | 4/2/2026 |
| Qwen 3.6 Plus | 4/2/2026 |
| GLM 5.1 | 4/1/2026 |
| Trinity Large Thinking | 4/1/2026 |
| GPT 5.4 Mini | 3/17/2026 |
| GPT 5.4 Nano | 3/17/2026 |
| MiniMax-M2.7 | 3/17/2026 |
| Grok 4.20 (Reasoning) | 3/9/2026 |
| GPT 5.4 | 3/5/2026 |
| Gemini 3.1 Flash Lite Preview | 2/24/2026 |
| GPT 5.3 Codex | 2/23/2026 |
| Qwen 3.5 Flash | 2/19/2026 |
| Gemini 3.1 Pro Preview (02/26) | 2/17/2026 |
| Claude Sonnet 4.6 | 2/16/2026 |
| Qwen 3.5 Plus | 2/12/2026 |
| MiniMax-M2.5 | 2/12/2026 |
| GLM 5 | 2/11/2026 |
| Claude Opus 4.6 (Nonthinking) | 2/5/2026 |
| Claude Opus 4.6 (Thinking) | 2/5/2026 |
| Kimi K2.5 | 1/26/2026 |
| Qwen 3 Max Thinking | 1/23/2026 |
| MiniMax-M2.1 | 12/23/2025 |
| GLM 4.7 | 12/22/2025 |
| Gemini 3 Flash (12/25) | 12/17/2025 |
| MiMo V2 Flash | 12/17/2025 |
| GPT 5.2 | 12/11/2025 |
| GPT 5.2 Codex | 12/11/2025 |
Claude Opus 4.5 (Thinking)
Compare Models
Claude Opus 4.5 (Thinking)
Release Date: 11/24/2025
Accuracy (Vals Index)
- Accuracy: 62.93% ± 1.98
- Latency: 245.14s
- Cost/Test: $0.91
- Context Window: 200k
- Max Output Tokens: 64k
- Input Modality: Hyperparameter settings
Default Provider: Anthropic
Benchmarks
Accuracy Rankings
- Vals Index
- -96.37% ± 1.98
- 87/ 40
- Vals Multimodal Index
- -118.98% ± 1.55
- 68/ 28
- CaseLaw (v2)
- -143.31% ± 0.11
- 118/ 47
- CorpFin
- -177.18% ± 0.94
- 323/ 97
- Finance Agent (v1.1)
- -187.71% ± 2.81
- 170/ 45
- MedCode
- -181.81% ± 2.01
- 203/ 51
- MedScribe
- -362.02% ± 1.90
- 246/ 51
- MortgageTax
- -327.00% ± 0.92
- 344/ 69
- ProofBench
- -196.54% ± 4.82
- 128/ 24
- SAGE
- -319.41% ± 3.40
- 331/ 49
- TaxEval (v2)
- -512.64% ± 0.85
- 741/ 104
- AIME
- -726.48% ± 0.37
- 736/ 96
- GPQA
- -723.57% ± 2.48
- 807/ 99
- IOI
- -188.03% ± 5.16
- 403/ 50
- LiveCodeBench
- -853.43% ± 1.04
- 950/ 103
- LegalBench
- -944.56% ± 0.39
- 1311/ 116
- MedQA
- -1168.00% ± 0.18
- 1131/ 95
- MMLU Pro
- -1156.92% ± 0.38
- 1224/ 97
- MMMU Pro
- -1193.61% ± 0.90
- 814/ 66
- SWE-bench
- -1190.04% ± 1.90
- 571/ 41
- Terminal-Bench 2.0
- -907.40% ± 5.31
- 759/ 52
Contact us
Proprietary Benchmarks ( contact us to get access) Academic Benchmarks Read about our methodology.