Open Weights & Proprietary

All Companies

Release Date Company Model
4/16/2026 Claude Opus 4.7
4/8/2026 Muse Spark
4/2/2026 Gemma 4 31B IT
4/2/2026 Qwen 3.6 Plus
4/1/2026 GLM 5.1
4/1/2026 Trinity Large Thinking
3/17/2026 GPT 5.4 Mini
3/17/2026 GPT 5.4 Nano
3/17/2026 MiniMax-M2.7
3/9/2026 Grok 4.20 (Reasoning)
3/5/2026 GPT 5.4
3/3/2026 Gemini 3.1 Flash Lite Preview
2/24/2026 GPT 5.3 Codex
2/23/2026 Qwen 3.5 Flash
2/19/2026 Gemini 3.1 Pro Preview (02/26)
2/17/2026 Claude Sonnet 4.6
2/16/2026 Qwen 3.5 Plus
2/12/2026 MiniMax-M2.5
2/12/2026 MiniMax-M2.5
2/11/2026 GLM 5
2/5/2026 Claude Opus 4.6 (Nonthinking)
2/5/2026 Claude Opus 4.6 (Thinking)
1/26/2026 Kimi K2.5
1/23/2026 Qwen 3 Max Thinking
12/23/2025 MiniMax-M2.1
12/22/2025 GLM 4.7
12/17/2025 Gemini 3 Flash (12/25)
12/17/2025 MiMo V2 Flash
12/11/2025 GPT 5.2
12/11/2025 GPT 5.2 Codex

Gemini 3 Pro (11/25)

Metric Value
Release Date 11/18/2025
Accuracy (Vals Index) 61.81% ± 1.98
Latency (Vals Index) 210.68s
Cost/Test (Vals Index) $0.44
Context Window 1M
Max Output Tokens 66k
Input Modality
Default Provider Google
Temperature 1
Top P Default
Top K Default
Max Output Tokens 65,536
Reasoning Effort high

Benchmarks

Benchmark Result
Accuracy -111.32% ± 1.98
Vals Multimodal Index -135.38% ± 1.55
CaseLaw (v2) -138.49% ± 0.19
CorpFin -195.32% ± 0.95
Finance Agent (v1.1) -196.55% ± 2.80
MedCode -214.00% ± 2.07
MedScribe -337.34% ± 1.90
MortgageTax -365.74% ± 0.91
ProofBench -119.36% ± 4.02
SAGE -318.61% ± 3.38
TaxEval (v2) -539.91% ± 0.87
AIME -796.28% ± 0.38
GPQA -831.35% ± 1.39
IOI -389.97% ± 11.49
LiveCodeBench -946.87% ± 0.98
LegalBench -1040.03% ± 0.37
MedQA -1251.71% ± 0.18
MMLU Pro -1275.90% ± 0.30
MMMU Pro -1340.60% ± 0.79
SWE-bench -1266.02% ± 1.90
Terminal-Bench 2.0 -980.06% ± 5.30