Open Weights & Proprietary
All Companies
Release date
| Models | Release Date | Image |
|---|---|---|
| Claude Opus 4.7 | 4/16/2026 | |
| Muse Spark | 4/8/2026 | |
| Gemma 4 31B IT | 4/2/2026 | |
| Qwen 3.6 Plus | 4/2/2026 | |
| GLM 5.1 | 4/1/2026 | |
| Trinity Large Thinking | 4/1/2026 | |
| GPT 5.4 Mini | 3/17/2026 | |
| GPT 5.4 Nano | 3/17/2026 | |
| MiniMax-M2.7 | 3/17/2026 | |
| Grok 4.20 (Reasoning) | 3/9/2026 | |
| GPT 5.4 | 3/5/2026 | |
| Gemini 3.1 Flash Lite Preview | 2/24/2026 | |
| GPT 5.3 Codex | 2/23/2026 | |
| Qwen 3.5 Flash | 2/19/2026 | |
| Gemini 3.1 Pro Preview (02/26) | 2/17/2026 | |
| Claude Sonnet 4.6 | 2/16/2026 | |
| Qwen 3.5 Plus | 2/12/2026 | |
| MiniMax-M2.5 | 2/12/2026 | |
| MiniMax-M2.5 | 2/11/2026 | |
| GLM 5 | 2/5/2026 | |
| Claude Opus 4.6 (Nonthinking) | 2/5/2026 | |
| Claude Opus 4.6 (Thinking) | 1/26/2026 | |
| Kimi K2.5 | 1/23/2026 | |
| Qwen 3 Max Thinking | 12/23/2025 | |
| MiniMax-M2.1 | 12/22/2025 | |
| GLM 4.7 | 12/17/2025 | |
| Gemini 3 Flash (12/25) | 12/17/2025 | |
| MiMo V2 Flash | 12/11/2025 | |
| GPT 5.2 | 12/11/2025 | |
| GPT 5.2 Codex | 12/11/2025 |
GLM 4.7
Release Date: 12/22/2025
Accuracy (Vals Index)
54.83% ± 2.00
Latency (Vals Index)
374.44s
Cost/Test (Vals Index)
$0.14
Context Window
200k
Max Output Tokens
128k
Input Modality
Hyperparameter settings
Default Provider : Zhipu AI
Some benchmarks may use different provider and parameters. Please refer to the benchmark page for more information.
Temperature
1
Top P
1
Top K
Default
Max Output Tokens
128,000
Show rankings only among open weight models
Benchmarks
Accuracy Rankings
| Benchmark | Accuracy | Results |
|---|---|---|
| Vals Index | -97.04% ± 2.00 | 68/ 40 |
| CaseLaw (v2) | -115.30% ± 0.92 | 76/ 47 |
| CorpFin | -116.76% ± 0.90 | 145/ 97 |
| Finance Agent (v1.1) | -136.50% ± 2.82 | 93/ 45 |
| MedCode | -113.30% ± 2.00 | 89/ 51 |
| MedScribe | -273.56% ± 2.12 | 71/ 51 |
| ProofBench | -27.32% ± 2.39 | 47/ 24 |
| TaxEval (v2) | -355.20% ± 0.92 | 316/ 104 |
| AIME | -542.66% ± 0.45 | 561/ 96 |
| GPQA | -521.19% ± 2.01 | 522/ 99 |
| IOI | -54.97% ± 3.40 | 217/ 50 |
| LiveCodeBench | -661.36% ± 0.99 | 731/ 103 |
| LegalBench | -742.94% ± 0.47 | 954/ 116 |
| MedQA | -918.25% ± 0.22 | 820/ 95 |
| MMLU Pro | -886.04% ± 0.37 | 697/ 97 |
| SWE-bench | -812.28% ± 2.06 | 217/ 41 |
| Terminal-Bench 2.0 | -487.16% ± 5.18 | 384/ 52 |
Proprietary Benchmarks ( contact us to get access)
Academic Benchmarks
Read about our methodology.