Open Weights & Proprietary
All Companies
Models
| Release Date | Company | Model Name |
|---|---|---|
| 4/16/2026 | Claude Opus 4.7 | |
| 4/8/2026 | Muse Spark | |
| 4/2/2026 | Gemma 4 31B IT | |
| 4/2/2026 | Qwen 3.6 Plus | |
| 4/1/2026 | GLM 5.1 | |
| 4/1/2026 | Trinity Large Thinking | |
| 3/17/2026 | GPT 5.4 Mini | |
| 3/17/2026 | GPT 5.4 Nano | |
| 3/17/2026 | MiniMax-M2.7 | |
| 3/9/2026 | Grok 4.20 (Reasoning) | |
| 3/5/2026 | GPT 5.4 | |
| 3/3/2026 | Gemini 3.1 Flash Lite Preview | |
| 2/24/2026 | GPT 5.3 Codex | |
| 2/23/2026 | Qwen 3.5 Flash | |
| 2/19/2026 | Gemini 3.1 Pro Preview (02/26) | |
| 2/17/2026 | Claude Sonnet 4.6 | |
| 2/16/2026 | Qwen 3.5 Plus | |
| 2/12/2026 | MiniMax-M2.5 | |
| 2/12/2026 | MiniMax-M2.5 | |
| 2/11/2026 | GLM 5 | |
| 2/5/2026 | Claude Opus 4.6 (Nonthinking) | |
| 2/5/2026 | Claude Opus 4.6 (Thinking) | |
| 1/26/2026 | Kimi K2.5 | |
| 1/23/2026 | Qwen 3 Max Thinking | |
| 12/23/2025 | MiniMax-M2.1 | |
| 12/22/2025 | GLM 4.7 | |
| 12/17/2025 | Gemini 3 Flash (12/25) | |
| 12/17/2025 | MiMo V2 Flash | |
| 12/11/2025 | GPT 5.2 | |
| 12/11/2025 | GPT 5.2 Codex |
Muse Spark
- Release Date: 4/8/2026
Vals Index
- Accuracy (Vals Index): 65.66% ± 1.96
- Latency (Vals Index): 329.52s
- Avg. Cost (In/Out): N/A
- Context Window: 1M
- Max Output Tokens: 131k
- Input Modality: Hyperparameter settings
- Default Provider: Meta
Some benchmarks may use different provider and parameters. Please refer to the benchmark page for more information.
- Temperature: Default
- Top P: Default
- Top K: Default
- Max Output Tokens: 131,072
Benchmarks
| Benchmarks | Score | Ranking |
|---|---|---|
| Vals Index | -89.73% | 89/40 |
| CaseLaw (v2) | -108.02% | 102/47 |
| CorpFin | -136.22% | 273/97 |
| Finance Agent (v1.1) | -151.95% | 150/45 |
| MedCode | -151.79% | 184/51 |
| MedScribe | -296.04% | 213/51 |
| TaxEval (v2) | -308.61% | 513/104 |
| Vibe Code Bench | -89.29% | 67/26 |
| AIME | -498.67% | 575/96 |
| GPQA | -519.81% | 638/99 |
| LegalBench | -546.89% | 778/116 |
| MMLU Pro | -631.61% | 719/97 |
| MMMU Pro | -701.23% | 556/66 |
| SWE-bench | -659.23% | 289/41 |
| Terminal-Bench 2.0 | -580.50% | 520/52 |
Contact us
For inquiries, please reach out to us via email: contact@vals.ai
Proprietary Benchmarks to get access
Academic Benchmarks: Read about our methodology.