Open Weights & Proprietary
Models
| Release Date | Model Name | Provider |
|---|---|---|
| 4/16/2026 | Claude Opus 4.7 | |
| 4/8/2026 | Muse Spark | |
| 4/2/2026 | Gemma 4 31B IT | |
| 4/2/2026 | Qwen 3.6 Plus | |
| 4/1/2026 | GLM 5.1 | |
| 4/1/2026 | Trinity Large Thinking | |
| 3/17/2026 | GPT 5.4 Mini | |
| 3/17/2026 | GPT 5.4 Nano | |
| 3/17/2026 | MiniMax-M2.7 | |
| 3/9/2026 | Grok 4.20 (Reasoning) | |
| 3/5/2026 | GPT 5.4 | |
| 3/3/2026 | Gemini 3.1 Flash Lite Preview | |
| 2/24/2026 | GPT 5.3 Codex | |
| 2/23/2026 | Qwen 3.5 Flash | |
| 2/19/2026 | Gemini 3.1 Pro Preview (02/26) | |
| 2/17/2026 | Claude Sonnet 4.6 | |
| 2/16/2026 | Qwen 3.5 Plus | |
| 2/12/2026 | MiniMax-M2.5 | |
| 2/12/2026 | MiniMax-M2.5 | |
| 2/11/2026 | GLM 5 | |
| 2/5/2026 | Claude Opus 4.6 (Nonthinking) | |
| 2/5/2026 | Claude Opus 4.6 (Thinking) | |
| 1/26/2026 | Kimi K2.5 | |
| 1/23/2026 | Qwen 3 Max Thinking | |
| 12/23/2025 | MiniMax-M2.1 | |
| 12/22/2025 | GLM 4.7 | |
| 12/17/2025 | Gemini 3 Flash (12/25) | |
| 12/17/2025 | MiMo V2 Flash | |
| 12/11/2025 | GPT 5.2 | |
| 12/11/2025 | GPT 5.2 Codex |
Gemma 4 31B IT
Release Date: 4/2/2026
Accuracy (Vals Index): 38.94% ± 1.53
Latency (Vals Index): 323.18s
Avg. Cost (In/Out): N/A
Context Window: 262k
Max Output Tokens: 33k
Input Modality:
Hyperparameter settings
Default Provider: Google
Some benchmarks may use different provider and parameters. Please refer to the benchmark page for more information.
- Temperature: 1
- Top P: Default
- Top K: Default
- Max Output Tokens: 32,768
- Reasoning Effort: high
Benchmarks
Accuracy Rankings
- Vals Index: -42.41% ± 1.53, Rank: 44/40
- Vals Multimodal Index: -63.29% ± 1.36, Rank: 29/28
- CaseLaw (v2): -91.36% ± 1.34, Rank: 63/47
- Finance Agent (v1.1): -107.64% ± 2.86, Rank: 96/45
- MortgageTax: -155.75% ± 0.97, Rank: 163/69
- SAGE: -164.61% ± 3.41, Rank: 190/49
- Terminal-Bench 2.0: -136.94% ± 5.21, Rank: 149/52