Open Weights & Proprietary Models
Release Dates and Models
2026 Models
Claude Opus 4.7
Release date: 4/16/2026
Muse Spark
Release date: 4/8/2026
Gemma 4 31B IT
Release date: 4/2/2026
Qwen 3.6 Plus
Release date: 4/2/2026
GLM 5.1
Release date: 4/1/2026
Trinity Large Thinking
Release date: 3/17/2026
GPT 5.4 Mini
Release date: 3/17/2026
GPT 5.4 Nano
Release date: 3/17/2026
MiniMax-M2.7
Release date: 3/9/2026
Grok 4.20 (Reasoning)
Release date: 3/5/2026
GPT 5.4
Release date: 3/3/2026
Gemini 3.1 Flash Lite Preview
Release date: 2/24/2026
GPT 5.3 Codex
Release date: 2/23/2026
Qwen 3.5 Flash
Release date: 2/19/2026
Gemini 3.1 Pro Preview (02/26)
Release date: 2/17/2026
Claude Sonnet 4.6
Release date: 2/16/2026
Qwen 3.5 Plus
Release date: 2/12/2026
MiniMax-M2.5
Release date: 2/12/2026
MiniMax-M2.5
Release date: 2/11/2026
GLM 5
Release date: 2/5/2026
Claude Opus 4.6 (Nonthinking)
Release date: 2/5/2026
Claude Opus 4.6 (Thinking)
Release date: 1/26/2026
Kimi K2.5
Release date: 1/23/2026
Qwen 3 Max Thinking
Release date: 12/23/2025
MiniMax-M2.1
Release date: 12/22/2025
GLM 4.7
Release date: 12/17/2025
Gemini 3 Flash (12/25)
Release date: 12/17/2025
MiMo V2 Flash
Release date: 12/11/2025
GPT 5.2
Release date: 12/11/2025
GPT 5.2 Codex
Release date: 12/11/2025
Model Details - DeepSeek V3.2 (Thinking)
- Release Date: 12/1/2025
- Default Provider: Fireworks AI
- Accuracy (Vals Index): 37.58% ± 1.50
- Latency (Vals Index): 831.80s
- Cost/Test (Vals Index): $0.24
- Context Window: 160k
- Max Output Tokens: 20k
- Input Modality: Hyperparameter settings
Hyperparameter Settings
- Temperature: 1
- Top P: Default
- Top K: Default
- Max Output Tokens: 20,480
- Reasoning Effort: high
Benchmarks
Accuracy Rankings
- Vals Index
- CaseLaw (v2)
- CorpFin
- Finance Agent (v1.1)
- ProofBench
- TaxEval (v2)
- Vibe Code Bench
- AIME
- GPQA
- IOI
- LiveCodeBench
- LegalBench
- MedQA
- MMLU Pro
- SWE-bench
Contact Information
Email: contact@vals.ai
For access to proprietary benchmarks, contact us.