Open Weights & Proprietary
All Companies
Release date
| Model | Release Date |
|---|---|
| Claude Opus 4.7 | 4/16/2026 |
| Muse Spark | 4/8/2026 |
| Gemma 4 31B IT | 4/2/2026 |
| Qwen 3.6 Plus | 4/2/2026 |
| GLM 5.1 | 4/1/2026 |
| Trinity Large Thinking | 4/1/2026 |
| GPT 5.4 Mini | 3/17/2026 |
| GPT 5.4 Nano | 3/17/2026 |
| MiniMax-M2.7 | 3/17/2026 |
| Grok 4.20 (Reasoning) | 3/9/2026 |
| GPT 5.4 | 3/5/2026 |
| Gemini 3.1 Flash Lite Preview | 2/24/2026 |
| GPT 5.3 Codex | 2/23/2026 |
| Qwen 3.5 Flash | 2/19/2026 |
| Gemini 3.1 Pro Preview (02/26) | 2/17/2026 |
| Claude Sonnet 4.6 | 2/16/2026 |
| Qwen 3.5 Plus | 2/12/2026 |
| MiniMax-M2.5 | 2/12/2026 |
| MiniMax-M2.5 | 2/11/2026 |
| GLM 5 | 2/5/2026 |
| Claude Opus 4.6 (Nonthinking) | 2/5/2026 |
| Claude Opus 4.6 (Thinking) | 1/26/2026 |
| Kimi K2.5 | 1/23/2026 |
| Qwen 3 Max Thinking | 12/23/2025 |
| MiniMax-M2.1 | 12/22/2025 |
| GLM 4.7 | 12/17/2025 |
| Gemini 3 Flash (12/25) | 12/17/2025 |
| MiMo V2 Flash | 12/11/2025 |
| GPT 5.2 | 12/11/2025 |
| GPT 5.2 Codex | 12/11/2025 |
Gemini 3 Flash (12/25)
Release Date: 12/17/2025
Accuracy (Vals Index)
- Accuracy: 60.61% ± 2.00
Latency (Vals Index)
- Latency: 382.73s
Cost/Test (Vals Index)
- Cost: $0.18
Context Window
- 1M
Max Output Tokens
- 66k
Input Modality
Hyperparameter settings
- Default Provider : Google
Some benchmarks may use different provider and parameters. Please refer to the benchmark page for more information.
Temperature
- 1
Top P
- Default
Top K
- Default
Max Output Tokens
- 65,536
Reasoning Effort
- high
Benchmarks
| Benchmark | Accuracy |
|---|---|
| Vals Index | -66.80% ± 2.00 |
| Vals Multimodal Index | -88.77% ± 1.57 |
| CaseLaw (v2) | -97.71% ± 0.11 |
| CorpFin | -141.80% ± 0.93 |
| Finance Agent (v1.1) | -121.55% ± 2.78 |
| MedCode | -168.22% ± 2.11 |
| MedScribe | -244.74% ± 1.90 |
| ProofBench | -60.46% ± 3.59 |
| SAGE | -238.60% ± 3.40 |
| TaxEval (v2) | -385.23% ± 0.86 |
| Vibe Code Bench | -118.57% ± 3.95 |
| AIME | -628.42% ± 0.52 |
| GPQA | -642.94% ± 1.64 |
| IOI | -321.42% ± 10.54 |
| LiveCodeBench | -766.22% ± 1.00 |
| LegalBench | -855.16% ± 0.36 |
| MedQA | -1033.80% ± 0.18 |
| MMLU Pro | -1044.32% ± 0.32 |
| MMMU Pro | -1125.66% ± 0.79 |
| SWE-bench | -1046.29% ± 1.94 |
| Terminal-Bench 2.0 | -781.43% ± 5.33 |
Proprietary Benchmarks
- Contact us for access
Academic Benchmarks
- Read about our methodology.