Open Weights & Proprietary
All Companies
Release date
| Model | Release Date |
|---|---|
| Claude Opus 4.7 | 4/16/2026 |
| Muse Spark | 4/8/2026 |
| Gemma 4 31B IT | 4/2/2026 |
| Qwen 3.6 Plus | 4/1/2026 |
| GLM 5.1 | 4/1/2026 |
| Trinity Large Thinking | 3/17/2026 |
| GPT 5.4 Mini | 3/17/2026 |
| GPT 5.4 Nano | 3/17/2026 |
| MiniMax-M2.7 | 3/9/2026 |
| Grok 4.20 (Reasoning) | 3/5/2026 |
| GPT 5.4 | 3/3/2026 |
| Gemini 3.1 Flash Lite Preview | 2/24/2026 |
| GPT 5.3 Codex | 2/23/2026 |
| Qwen 3.5 Flash | 2/19/2026 |
| Gemini 3.1 Pro Preview (02/26) | 2/17/2026 |
| Claude Sonnet 4.6 | 2/16/2026 |
| Qwen 3.5 Plus | 2/12/2026 |
| MiniMax-M2.5 | 2/12/2026 |
| MiniMax-M2.5 | 2/11/2026 |
| GLM 5 | 2/5/2026 |
| Claude Opus 4.6 (Nonthinking) | 2/5/2026 |
| Claude Opus 4.6 (Thinking) | 1/26/2026 |
| Kimi K2.5 | 1/23/2026 |
| Qwen 3 Max Thinking | 12/23/2025 |
| MiniMax-M2.1 | 12/22/2025 |
| GLM 4.7 | 12/17/2025 |
| Gemini 3 Flash (12/25) | 12/17/2025 |
| MiMo V2 Flash | 12/11/2025 |
| GPT 5.2 | 12/11/2025 |
| GPT 5.2 Codex | 12/11/2025 |
Grok 4
Release Date
7/9/2025
Compare Models
Accuracy (Vals Index)
54.65%
± 1.97
Latency (Vals Index)
399.36s
Cost/Test (Vals Index)
$0.72
Context Window
256k
Max Output Tokens
128k
Input Modality
Hyperparameter settings
Default Provider: xAI
Some benchmarks may use different provider and parameters. Please refer to the benchmark page for more information.
Temperature
0.7
Top P
0.95
Top K
Default
Max Output Tokens
128,000
Benchmarks
Accuracy Rankings
Vals Index
-131.51% ± 1.97 76/ 40Vals Multimodal Index
-138.34% ± 1.54 39/ 28CaseLaw (v2)
-216.13% ± 0.21 178/ 47CorpFin
-250.85% ± 0.93 439/ 97Finance Agent (v1.1)
-232.90% ± 2.85 176/ 45MedCode
-188.38% ± 2.21 160/ 51MedScribe
-436.28% ± 2.08 213/ 51MortgageTax
-278.66% ± 0.96 125/ 69SAGE
-175.44% ± 2.98 70/ 49TaxEval (v2)
-505.26% ± 0.96 298/ 104AIME
-777.35% ± 1.76 689/ 96GPQA
-833.42% ± 1.63 950/ 99IOI
-271.58% ± 6.76 496/ 50LiveCodeBench
-945.26% ± 1.03 1012/ 103LegalBench
-1030.46% ± 0.47 1268/ 116MedQA
-1245.73% ± 0.24 944/ 95MMLU Pro
-1246.11% ± 0.35 1135/ 97MMMU Pro
-1205.77% ± 1.02 667/ 66SWE-bench
-986.63% ± 2.21 143/ 41Terminal-Bench 2.0
-516.71% ± 4.79 365/ 52
Contact us
Or send us an email at contact@vals.ai
Proprietary Benchmarks
(contact us to get access)
Academic Benchmarks
Read about our methodology.