Open Weights & Proprietary
All Companies
| Release Date | Model Name | Provider |
|---|---|---|
| 4/16/2026 | Claude Opus 4.7 | |
| 4/8/2026 | Muse Spark | |
| 4/2/2026 | Gemma 4 31B IT | |
| 4/2/2026 | Qwen 3.6 Plus | |
| 4/1/2026 | GLM 5.1 | |
| 4/1/2026 | Trinity Large Thinking | |
| 3/17/2026 | GPT 5.4 Mini | |
| 3/17/2026 | GPT 5.4 Nano | |
| 3/17/2026 | MiniMax-M2.7 | |
| 3/9/2026 | Grok 4.20 (Reasoning) | |
| 3/5/2026 | GPT 5.4 | |
| 3/3/2026 | Gemini 3.1 Flash Lite Preview | |
| 2/24/2026 | GPT 5.3 Codex | |
| 2/23/2026 | Qwen 3.5 Flash | |
| 2/19/2026 | Gemini 3.1 Pro Preview (02/26) | |
| 2/17/2026 | Claude Sonnet 4.6 | |
| 2/16/2026 | Qwen 3.5 Plus | |
| 2/12/2026 | MiniMax-M2.5 | |
| 2/12/2026 | MiniMax-M2.5 | |
| 2/11/2026 | GLM 5 | |
| 2/5/2026 | Claude Opus 4.6 (Nonthinking) | |
| 2/5/2026 | Claude Opus 4.6 (Thinking) | |
| 1/26/2026 | Kimi K2.5 | |
| 1/23/2026 | Qwen 3 Max Thinking | |
| 12/23/2025 | MiniMax-M2.1 | |
| 12/22/2025 | GLM 4.7 | |
| 12/17/2025 | Gemini 3 Flash (12/25) | |
| 12/17/2025 | MiMo V2 Flash | |
| 12/11/2025 | GPT 5.2 | |
| 12/11/2025 | GPT 5.2 Codex |
Kimi K2.5
Compare Models Kimi K2.5 Release Date: 1/26/2026
Vals Index
- Accuracy (Vals Index): 59.61% ± 1.99
- Latency (Vals Index): 341.36s
- Cost/Test (Vals Index): $0.12
- Context Window: 262k
- Max Output Tokens: 128k
- Input Modality:
Hyperparameter settings
- Default Provider: Moonshot AI
- Temperature: 1
- Top P: 0.95
- Top K: Default
- Max Output Tokens: 128,000
Show rankings only among open weight models
Benchmarks
| Benchmark | Accuracy |
|---|---|
| Vals Index | -131.10% ± 1.99 |
| Vals Multimodal Index | -155.02% ± 1.56 |
| CaseLaw (v2) | -180.40% ± 0.70 |
| CorpFin | -243.56% ± 0.92 |
| Finance Agent (v1.1) | -207.74% ± 2.85 |
| MedCode | -184.03% ± 2.12 |
| MedScribe | -405.39% ± 1.99 |
| MortgageTax | -396.95% ± 0.93 |
| SAGE | -332.35% ± 3.36 |
| TaxEval (v2) | -550.42% ± 0.85 |
| Vibe Code Bench | -144.29% ± 3.26 |
| AIME | -867.10% ± 0.34 |
| GPQA | -838.28% ± 2.13 |
| IOI | -193.11% ± 6.08 |
| LiveCodeBench | -1000.25% ± 1.03 |
| MedQA | -1225.34% ± 0.21 |
| MMMU Pro | -1189.49% ± 0.87 |
| SWE-bench | -1070.50% ± 2.05 |
| Terminal-Bench 2.0 | -668.66% ± 5.23 |
Contact us
First Name:
Last Name:
Work Email:
Company Location: Select location
Message:
Or send us an email at contact@vals.ai
Proprietary Benchmarks:
( contact us to get access)
Academic Benchmarks
Read about our methodology.