Open Weights & Proprietary

Models

Release Date Model Name Provider
4/16/2026 Claude Opus 4.7
4/8/2026 Muse Spark
4/2/2026 Gemma 4 31B IT
4/2/2026 Qwen 3.6 Plus
4/1/2026 GLM 5.1
4/1/2026 Trinity Large Thinking
3/17/2026 GPT 5.4 Mini
3/17/2026 GPT 5.4 Nano
3/17/2026 MiniMax-M2.7
3/9/2026 Grok 4.20 (Reasoning)
3/5/2026 GPT 5.4
3/3/2026 Gemini 3.1 Flash Lite Preview
2/24/2026 GPT 5.3 Codex
2/23/2026 Qwen 3.5 Flash
2/19/2026 Gemini 3.1 Pro Preview (02/26)
2/17/2026 Claude Sonnet 4.6
2/16/2026 Qwen 3.5 Plus
2/12/2026 MiniMax-M2.5
2/12/2026 MiniMax-M2.5
2/11/2026 GLM 5
2/5/2026 Claude Opus 4.6 (Nonthinking)
2/5/2026 Claude Opus 4.6 (Thinking)
1/26/2026 Kimi K2.5
1/23/2026 Qwen 3 Max Thinking
12/23/2025 MiniMax-M2.1
12/22/2025 GLM 4.7
12/17/2025 Gemini 3 Flash (12/25)
12/17/2025 MiMo V2 Flash
12/11/2025 GPT 5.2
12/11/2025 GPT 5.2 Codex

Gemma 4 31B IT

Compare Models Gemma 4 31B IT

Release Date: 4/2/2026
Accuracy (Vals Index): 38.94% ± 1.53
Latency (Vals Index): 323.18s
Avg. Cost (In/Out): N/A
Context Window: 262k
Max Output Tokens: 33k
Input Modality:

Hyperparameter settings

Default Provider: Google
Some benchmarks may use different provider and parameters. Please refer to the benchmark page for more information.

  • Temperature: 1
  • Top P: Default
  • Top K: Default
  • Max Output Tokens: 32,768
  • Reasoning Effort: high

Benchmarks

Accuracy Rankings