Open Weights & Proprietary

Release date

Models

Release Date Model Name Provider
4/16/2026 Claude Opus 4.7
4/8/2026 Muse Spark
4/2/2026 Gemma 4 31B IT
4/2/2026 Qwen 3.6 Plus
4/1/2026 GLM 5.1
4/1/2026 Trinity Large Thinking
3/17/2026 GPT 5.4 Mini
3/17/2026 GPT 5.4 Nano
3/17/2026 MiniMax-M2.7
3/9/2026 Grok 4.20 (Reasoning)
3/5/2026 GPT 5.4
3/3/2026 Gemini 3.1 Flash Lite Preview
2/24/2026 GPT 5.3 Codex
2/23/2026 Qwen 3.5 Flash
2/19/2026 Gemini 3.1 Pro Preview (02/26)
2/17/2026 Claude Sonnet 4.6
2/16/2026 Qwen 3.5 Plus
2/12/2026 MiniMax-M2.5
2/12/2026 MiniMax-M2.5
2/11/2026 GLM 5
2/5/2026 Claude Opus 4.6 (Nonthinking)
2/5/2026 Claude Opus 4.6 (Thinking)
1/26/2026 Kimi K2.5
1/23/2026 Qwen 3 Max Thinking
12/23/2025 MiniMax-M2.1
12/22/2025 GLM 4.7
12/17/2025 Gemini 3 Flash (12/25)
12/17/2025 MiMo V2 Flash
12/11/2025 GPT 5.2
12/11/2025 GPT 5.2 Codex

MiniMax-M2.1

| Accuracy (Vals Index) | 51.80% ± 1.95 |
| Latency (Vals Index) | 674.37s |
| Cost/Test (Vals Index) | $0.14 |
| Context Window | 205k |
| Max Output Tokens | 131k |
| Input Modality | Hyperparameter settings |
| Temperature | 1 |
| Top P | 0.95 |
| Top K | Default |
| Max Output Tokens | 131,000 |

Benchmarks

Benchmark Accuracy Rankings
Vals Index -74.91% ± 1.95 57/40
CaseLaw (v2) -99.74% ± 0.47 81/47
CorpFin -128.05% ± 0.97 199/97
Finance Agent (v1.1) -86.62% ± 2.58 66/45
MedCode -104.14% ± 1.94 97/51
MedScribe -286.90% ± 1.83 175/51
TaxEval (v2) -271.12% ± 0.92 223/104
AIME -363.20% ± 1.29 315/96
GPQA -414.52% ± 2.13 416/99
IOI -13.84% ± 1.30 80/50
LiveCodeBench -543.09% ± 1.10 595/103
LegalBench -557.82% ± 0.54 434/116
MedQA -746.76% ± 0.26 529/95
MMLU Pro -786.87% ± 0.33 838/97
SWE-bench -743.31% ± 1.94 329/41
Terminal-Bench 2.0 -403.64% ± 5.15 324/52