Open Weights & Proprietary

Release date

Models Release Date
Claude Opus 4.7 4/16/2026
Muse Spark 4/8/2026
Gemma 4 31B IT 4/2/2026
Qwen 3.6 Plus 4/2/2026
GLM 5.1 4/1/2026
Trinity Large Thinking 4/1/2026
GPT 5.4 Mini 3/17/2026
GPT 5.4 Nano 3/17/2026
MiniMax-M2.7 3/17/2026
Grok 4.20 (Reasoning) 3/9/2026
GPT 5.4 3/5/2026
Gemini 3.1 Flash Lite Preview 2/24/2026
GPT 5.3 Codex 2/23/2026
Qwen 3.5 Flash 2/19/2026
Gemini 3.1 Pro Preview (02/26) 2/17/2026
Claude Sonnet 4.6 2/16/2026
Qwen 3.5 Plus 2/12/2026
MiniMax-M2.5 2/12/2026
GLM 5 2/11/2026
Claude Opus 4.6 (Nonthinking) 2/5/2026
Claude Opus 4.6 (Thinking) 2/5/2026
Kimi K2.5 1/26/2026
Qwen 3 Max Thinking 1/23/2026
MiniMax-M2.1 12/23/2025
GLM 4.7 12/22/2025
Gemini 3 Flash (12/25) 12/17/2025
MiMo V2 Flash 12/17/2025
GPT 5.2 12/11/2025
GPT 5.2 Codex 12/11/2025

Claude Opus 4.5 (Thinking)

Compare Models
Claude Opus 4.5 (Thinking)
Release Date: 11/24/2025

Accuracy (Vals Index)

  • Accuracy: 62.93% ± 1.98
  • Latency: 245.14s
  • Cost/Test: $0.91
  • Context Window: 200k
  • Max Output Tokens: 64k
  • Input Modality: Hyperparameter settings

Default Provider: Anthropic

Benchmarks

Accuracy Rankings

Contact us

Proprietary Benchmarks ( contact us to get access) Academic Benchmarks Read about our methodology.