Open Weights & Proprietary
All Companies
Release Date
| Model | Release Date |
|---|---|
| Claude Opus 4.7 | 4/16/2026 |
| Muse Spark | 4/8/2026 |
| Gemma 4 31B IT | 4/2/2026 |
| Qwen 3.6 Plus | 4/1/2026 |
| GLM 5.1 | 4/1/2026 |
| Trinity Large Thinking | 3/17/2026 |
| GPT 5.4 Mini | 3/17/2026 |
| GPT 5.4 Nano | 3/17/2026 |
| MiniMax-M2.7 | 3/9/2026 |
| Grok 4.20 (Reasoning) | 3/5/2026 |
| GPT 5.4 | 3/3/2026 |
| Gemini 3.1 Flash Lite Preview | 2/24/2026 |
| GPT 5.3 Codex | 2/23/2026 |
| Qwen 3.5 Flash | 2/19/2026 |
| Gemini 3.1 Pro Preview (02/26) | 2/17/2026 |
| Claude Sonnet 4.6 | 2/16/2026 |
| Qwen 3.5 Plus | 2/12/2026 |
| MiniMax-M2.5 | 2/12/2026 |
| MiniMax-M2.5 | 2/11/2026 |
| GLM 5 | 2/5/2026 |
| Claude Opus 4.6 (Nonthinking) | 2/5/2026 |
| Claude Opus 4.6 (Thinking) | 1/26/2026 |
| Kimi K2.5 | 1/23/2026 |
| Qwen 3 Max Thinking | 12/23/2025 |
| MiniMax-M2.1 | 12/22/2025 |
| GLM 4.7 | 12/17/2025 |
| Gemini 3 Flash (12/25) | 12/17/2025 |
| MiMo V2 Flash | 12/11/2025 |
| GPT 5.2 | 12/11/2025 |
| GPT 5.2 Codex | 12/11/2025 |
Qwen 3.6 Plus
Release Date: 4/2/2026
Vals Index
Accuracy (Vals Index)
58.77%
± 1.98
Latency (Vals Index)
343.02s
Cost/Test (Vals Index)
$0.26
Context Window
984k
Max Output Tokens
66k
Input Modality
Hyperparameter settings
Default Provider:
Alibaba
Some benchmarks may use different provider and parameters. Please refer to the benchmark page for more information.
Temperature
0.7
Top P
Default
Top K
Default
Max Output Tokens
65,536
Benchmarks
Accuracy
Rankings
- Vals Index -109.95% ± 1.98 81/40
- Vals Multimodal Index -132.47% ± 1.56 64/28
- CaseLaw (v2) -137.65% ± 1.16 55/47
- CorpFin -194.48% ± 0.96 326/97
- Finance Agent (v1.1) -199.01% ± 2.89 165/45
- MedCode -154.41% ± 2.02 135/51
- MedScribe -366.93% ± 1.92 161/51
- MortgageTax -366.42% ± 0.91 387/69
- SAGE -271.85% ± 3.43 261/49
- TaxEval (v2) -506.01% ± 0.85 720/104
- Vibe Code Bench -192.51% ± 3.91 116/26
- AIME -788.70% ± 0.58 788/96
- GPQA -803.40% ± 1.67 899/99
- LegalBench -850.79% ± 0.42 1157/116
- MMLU Pro -969.65% ± 0.32 1092/97
- MMMU Pro -1016.27% ± 0.88 754/66
- SWE-bench -964.77% ± 1.98 370/41
- Terminal-Bench 2.0 -641.15% ± 5.30 566/52
Contact Us
First Name
Last Name
Work Email
Company Location
Select location
Message
Or send us an email at contact@vals.ai
Proprietary Benchmarks
(contact us to get access)
Academic Benchmarks
Read about our methodology.