Open Weights & Proprietary
All Companies
Release Date
Models
- Release Date: 4/16/2026
Claude Opus 4.7 - Release Date: 4/8/2026
Muse Spark - Release Date: 4/2/2026
Gemma 4 31B IT - Release Date: 4/2/2026
Qwen 3.6 Plus - Release Date: 4/1/2026
GLM 5.1 - Release Date: 4/1/2026
Trinity Large Thinking - Release Date: 3/17/2026
GPT 5.4 Mini - Release Date: 3/17/2026
GPT 5.4 Nano - Release Date: 3/17/2026
MiniMax-M2.7 - Release Date: 3/9/2026
Grok 4.20 (Reasoning) - Release Date: 3/5/2026
GPT 5.4 - Release Date: 3/3/2026
Gemini 3.1 Flash Lite Preview - Release Date: 2/24/2026
GPT 5.3 Codex - Release Date: 2/23/2026
Qwen 3.5 Flash - Release Date: 2/19/2026
Gemini 3.1 Pro Preview (02/26) - Release Date: 2/17/2026
Claude Sonnet 4.6 - Release Date: 2/16/2026
Qwen 3.5 Plus - Release Date: 2/12/2026
MiniMax-M2.5 - Release Date: 2/12/2026
MiniMax-M2.5 - Release Date: 2/11/2026
GLM 5 - Release Date: 2/5/2026
Claude Opus 4.6 (Nonthinking) - Release Date: 2/5/2026
Claude Opus 4.6 (Thinking) - Release Date: 1/26/2026
Kimi K2.5 - Release Date: 1/23/2026
Qwen 3 Max Thinking - Release Date: 12/23/2025
MiniMax-M2.1 - Release Date: 12/22/2025
GLM 4.7 - Release Date: 12/17/2025
Gemini 3 Flash (12/25) - Release Date: 12/17/2025
MiMo V2 Flash - Release Date: 12/11/2025
GPT 5.2 - Release Date: 12/11/2025
GPT 5.2 Codex
Qwen 3.5 Plus
Qwen 3.5 Plus
Release Date: 2/16/2026
Vals Index
- Accuracy (Vals Index): 59.08%
± 2.00 - Latency (Vals Index): 570.93s
- Cost/Test (Vals Index): $0.31
- Context Window: 991k
- Max Output Tokens: 66k
- Input Modality: Hyperparameter settings
Default Provider:
Alibaba
Some benchmarks may use different providers and parameters. Please refer to the benchmark page for more information.
- Temperature: 0.6
- Top P: Default
- Top K: Default
- Max Output Tokens: 65,536
Benchmarks
- Accuracy Rankings:
- Vals Index
-116.83% ± 2.00 85/ 40 - Vals Multimodal Index
-128.92% ± 1.57 58/ 28 - CaseLaw (v2)
-164.07% ± 1.13 113/ 47 - CorpFin
-207.50% ± 0.94 370/ 97 - Finance Agent (v1.1)
-200.59% ± 2.89 159/ 45 - MortgageTax
-256.89% ± 0.97 204/ 69 - SAGE
-146.34% ± 3.15 92/ 49 - Vibe Code Bench
-85.63% ± 3.18 64/ 26 - AIME
-525.80% ± 1.11 481/ 96 - GPQA
-596.50% ± 1.67 700/ 99 - LiveCodeBench
-647.65% ± 1.00 801/ 103 - LegalBench
-714.89% ± 0.41 1023/ 116 - MedQA
-881.88% ± 0.19 855/ 95 - MMLU Pro
-886.94% ± 0.33 941/ 97 - MMMU Pro
-253.55% ± 1.01 66/ 66 - SWE-bench
-865.41% ± 2.03 284/ 41 - Terminal-Bench 2.0
-549.77% ± 5.25 475/ 52
- Vals Index
Contact Us
- First Name
- Last Name
- Work Email
- Company LocationSelect location
- Message
- Or send us an email at contact@vals.ai
Proprietary Benchmarks
Contact us to get access
Academic Benchmarks
Read about our methodology.