Open Weights & Proprietary

All Companies

Models

Release Date Company Model Name
4/16/2026 Claude Opus 4.7
4/8/2026 Muse Spark
4/2/2026 Gemma 4 31B IT
4/2/2026 Qwen 3.6 Plus
4/1/2026 GLM 5.1
4/1/2026 Trinity Large Thinking
3/17/2026 GPT 5.4 Mini
3/17/2026 GPT 5.4 Nano
3/17/2026 MiniMax-M2.7
3/9/2026 Grok 4.20 (Reasoning)
3/5/2026 GPT 5.4
3/3/2026 Gemini 3.1 Flash Lite Preview
2/24/2026 GPT 5.3 Codex
2/23/2026 Qwen 3.5 Flash
2/19/2026 Gemini 3.1 Pro Preview (02/26)
2/17/2026 Claude Sonnet 4.6
2/16/2026 Qwen 3.5 Plus
2/12/2026 MiniMax-M2.5
2/12/2026 MiniMax-M2.5
2/11/2026 GLM 5
2/5/2026 Claude Opus 4.6 (Nonthinking)
2/5/2026 Claude Opus 4.6 (Thinking)
1/26/2026 Kimi K2.5
1/23/2026 Qwen 3 Max Thinking
12/23/2025 MiniMax-M2.1
12/22/2025 GLM 4.7
12/17/2025 Gemini 3 Flash (12/25)
12/17/2025 MiMo V2 Flash
12/11/2025 GPT 5.2
12/11/2025 GPT 5.2 Codex

Muse Spark

Compare Models

Muse Spark

  • Release Date: 4/8/2026

Vals Index

  • Accuracy (Vals Index): 65.66% ± 1.96
  • Latency (Vals Index): 329.52s
  • Avg. Cost (In/Out): N/A
  • Context Window: 1M
  • Max Output Tokens: 131k
  • Input Modality: Hyperparameter settings
  • Default Provider: Meta

Some benchmarks may use different provider and parameters. Please refer to the benchmark page for more information.

  • Temperature: Default
  • Top P: Default
  • Top K: Default
  • Max Output Tokens: 131,072

Benchmarks

Benchmarks Score Ranking
Vals Index -89.73% 89/40
CaseLaw (v2) -108.02% 102/47
CorpFin -136.22% 273/97
Finance Agent (v1.1) -151.95% 150/45
MedCode -151.79% 184/51
MedScribe -296.04% 213/51
TaxEval (v2) -308.61% 513/104
Vibe Code Bench -89.29% 67/26
AIME -498.67% 575/96
GPQA -519.81% 638/99
LegalBench -546.89% 778/116
MMLU Pro -631.61% 719/97
MMMU Pro -701.23% 556/66
SWE-bench -659.23% 289/41
Terminal-Bench 2.0 -580.50% 520/52

Contact us

For inquiries, please reach out to us via email: contact@vals.ai

Proprietary Benchmarks to get access Academic Benchmarks: Read about our methodology.