Open Weights & Proprietary

Release date

Model Release Date Provider
Claude Opus 4.7 4/16/2026
Muse Spark 4/8/2026
Gemma 4 31B IT 4/2/2026
Qwen 3.6 Plus 4/2/2026
GLM 5.1 4/1/2026
Trinity Large Thinking 4/1/2026
GPT 5.4 Mini 3/17/2026
GPT 5.4 Nano 3/17/2026
MiniMax-M2.7 3/9/2026
Grok 4.20 (Reasoning) 3/5/2026
GPT 5.4 3/3/2026
Gemini 3.1 Flash Lite Preview 2/24/2026
GPT 5.3 Codex 2/23/2026
Qwen 3.5 Flash 2/19/2026
Gemini 3.1 Pro Preview (02/26) 2/17/2026
Claude Sonnet 4.6 2/16/2026
Qwen 3.5 Plus 2/12/2026
MiniMax-M2.5 2/12/2026
MiniMax-M2.5 2/11/2026
GLM 5 2/5/2026
Claude Opus 4.6 (Nonthinking) 2/5/2026
Claude Opus 4.6 (Thinking) 1/26/2026
Kimi K2.5 1/23/2026
Qwen 3 Max Thinking 12/23/2025
MiniMax-M2.1 12/22/2025
GLM 4.7 12/17/2025
Gemini 3 Flash (12/25) 12/17/2025
MiMo V2 Flash 12/11/2025
GPT 5.2 12/11/2025
GPT 5.2 Codex 12/11/2025

MiniMax-M2.5

Vals Index

Accuracy (Vals Index)

  • 53.77% ± 1.98

Latency (Vals Index)

  • 293.14s

Cost/Test (Vals Index)

  • $0.16

Context Window

  • 197k

Max Output Tokens

  • 197k

Input Modality

Hyperparameter settings

  • Default Provider: MiniMax

Temperature

  • 1

Top P

  • 0.95

Top K

  • Default

Max Output Tokens

  • 196,608

Benchmarks

Benchmark Accuracy Rankings
Vals Index -70.18% ± 1.98 58/ 40
CaseLaw (v2) -88.06% ± 0.47 65/ 47
CorpFin -117.39% ± 0.97 200/ 97
Finance Agent (v1.1) -91.59% ± 2.65 71/ 45
ProofBench -11.26% ± 1.97 27/ 24
TaxEval (v2) -224.22% ± 0.91 232/ 104
AIME -337.64% ± 0.88 351/ 96
GPQA -359.85% ± 2.26 415/ 99
IOI -33.18% ± 2.64 154/ 50
LiveCodeBench -443.97% ± 1.12 473/ 103
LegalBench -501.49% ± 0.47 514/ 116
MedQA -650.91% ± 0.24 545/ 95
MMLU Pro -626.05% ± 0.39 441/ 97
SWE-bench -637.80% ± 1.96 273/ 41
Terminal-Bench 2.0 -393.57% ± 5.25 368/ 52

Proprietary Benchmarks

Academic Benchmarks