Open Weights & Proprietary

All Companies

Release date

Model Release Date
Claude Opus 4.7 4/16/2026
Muse Spark 4/8/2026
Gemma 4 31B IT 4/2/2026
Qwen 3.6 Plus 4/1/2026
GLM 5.1 4/1/2026
Trinity Large Thinking 3/17/2026
GPT 5.4 Mini 3/17/2026
GPT 5.4 Nano 3/17/2026
MiniMax-M2.7 3/9/2026
Grok 4.20 (Reasoning) 3/5/2026
GPT 5.4 3/3/2026
Gemini 3.1 Flash Lite Preview 2/24/2026
GPT 5.3 Codex 2/23/2026
Qwen 3.5 Flash 2/19/2026
Gemini 3.1 Pro Preview (02/26) 2/17/2026
Claude Sonnet 4.6 2/16/2026
Qwen 3.5 Plus 2/12/2026
MiniMax-M2.5 2/12/2026
MiniMax-M2.5 2/11/2026
GLM 5 2/5/2026
Claude Opus 4.6 (Nonthinking) 2/5/2026
Claude Opus 4.6 (Thinking) 1/26/2026
Kimi K2.5 1/23/2026
Qwen 3 Max Thinking 12/23/2025
MiniMax-M2.1 12/22/2025
GLM 4.7 12/17/2025
Gemini 3 Flash (12/25) 12/17/2025
MiMo V2 Flash 12/11/2025
GPT 5.2 12/11/2025
GPT 5.2 Codex 12/11/2025

Model details

GLM 5

Vals Index

  • Accuracy (Vals Index): 61.41% ± 1.98
  • Latency (Vals Index): 452.82s
  • Cost/Test (Vals Index): $0.29
  • Context Window: 200k
  • Max Output Tokens: 131k
  • Input Modality: Hyperparameter settings
  • Default Provider: Zhipu AI

Some benchmarks may use different provider and parameters. Please refer to the benchmark page for more information.

  • Temperature: 1
  • Top P: 0.95
  • Top K: Default
  • Max Output Tokens: 131,072

Benchmarks

Accuracy Rankings

Benchmark Accuracy ± Rank/Total
Vals Index -76.61% ± 1.98 76/40
CaseLaw (v2) -80.25% ± 1.72 58/47
CorpFin -119.01% ± 0.95 239/97
Finance Agent (v1.1) -121.76% ± 2.80 111/45
TaxEval (v2) -190.56% ± 0.90 227/104
Vibe Code Bench -74.54% ± 4.03 61/26
AIME -338.93% ± 0.77 366/96
GPQA -353.58% ± 1.87 417/99
IOI -106.25% ± 7.83 248/50
LiveCodeBench -448.25% ± 1.06 514/103
LegalBench -515.33% ± 0.41 729/116
MedQA -645.70% ± 0.21 622/95
MMLU Pro -654.86% ± 0.34 660/97
SWE-bench -601.47% ± 2.02 218/41
Terminal-Bench 2.0 -459.08% ± 5.33 405/52

Proprietary Benchmarks

Academic Benchmarks

Read about our methodology.