Open Weights & Proprietary

All Companies

Release date

Model Name Release Date
Claude Opus 4.7 4/16/2026
Muse Spark 4/8/2026
Gemma 4 31B IT 4/2/2026
Qwen 3.6 Plus 4/1/2026
GLM 5.1 4/1/2026
Trinity Large Thinking 3/17/2026
GPT 5.4 Mini 3/17/2026
GPT 5.4 Nano 3/17/2026
MiniMax-M2.7 3/9/2026
Grok 4.20 (Reasoning) 3/5/2026
GPT 5.4 3/3/2026
Gemini 3.1 Flash Lite Preview 2/24/2026
GPT 5.3 Codex 2/23/2026
Qwen 3.5 Flash 2/19/2026
Gemini 3.1 Pro Preview (02/26) 2/17/2026
Claude Sonnet 4.6 2/16/2026
Qwen 3.5 Plus 2/12/2026
MiniMax-M2.5 2/12/2026
MiniMax-M2.5 2/11/2026
GLM 5 2/5/2026
Claude Opus 4.6 (Nonthinking) 2/5/2026
Claude Opus 4.6 (Thinking) 1/26/2026
Kimi K2.5 1/23/2026
Qwen 3 Max Thinking 12/23/2025
MiniMax-M2.1 12/22/2025
GLM 4.7 12/17/2025
Gemini 3 Flash (12/25) 12/17/2025
MiMo V2 Flash 12/11/2025
GPT 5.2 12/11/2025
GPT 5.2 Codex 12/11/2025

Compare Models

GPT OSS 120B
Release Date: 8/5/2025

Accuracy (Vals Index)
36.07% ± 1.75

Latency (Vals Index)
202.33s

Cost/Test (Vals Index)
$0.08

Context Window
128k

Max Output Tokens
33k

Input Modality
Hyperparameter settings

Default Provider :
Fireworks AI

Some benchmarks may use different provider and parameters. Please refer to the benchmark page for more information.

  • Temperature Default
  • Top P Default
  • Top K Default
  • Max Output Tokens
    32,768

Benchmarks

Benchmark Name Accuracy Rankings
CaseLaw (v2) -92.13% ± 0.88 51/ 47
CorpFin -133.11% ± 0.97 200/ 97
Finance Agent (v1.1) -58.54% ± 2.24 64/ 45
TaxEval (v2) -228.08% ± 0.88 292/ 104
AIME -341.98% ± 1.22 384/ 96
GPQA -332.90% ± 2.25 358/ 99
LiveCodeBench -401.46% ± 1.06 484/ 103
LegalBench -414.10% ± 0.52 361/ 116
MedQA -559.45% ± 0.24 438/ 95
MMLU Pro -541.57% ± 0.40 337/ 97
SWE-bench -255.55% ± 2.11 49/ 41
Terminal-Bench 2.0 -160.77% ± 4.19 111/ 52