Open Weights & Proprietary

All Companies

Release date

Models Release Date Image
Claude Opus 4.7 4/16/2026
Muse Spark 4/8/2026
Gemma 4 31B IT 4/2/2026
Qwen 3.6 Plus 4/2/2026
GLM 5.1 4/1/2026
Trinity Large Thinking 4/1/2026
GPT 5.4 Mini 3/17/2026
GPT 5.4 Nano 3/17/2026
MiniMax-M2.7 3/17/2026
Grok 4.20 (Reasoning) 3/9/2026
GPT 5.4 3/5/2026
Gemini 3.1 Flash Lite Preview 2/24/2026
GPT 5.3 Codex 2/23/2026
Qwen 3.5 Flash 2/19/2026
Gemini 3.1 Pro Preview (02/26) 2/17/2026
Claude Sonnet 4.6 2/16/2026
Qwen 3.5 Plus 2/12/2026
MiniMax-M2.5 2/12/2026
MiniMax-M2.5 2/11/2026
GLM 5 2/5/2026
Claude Opus 4.6 (Nonthinking) 2/5/2026
Claude Opus 4.6 (Thinking) 1/26/2026
Kimi K2.5 1/23/2026
Qwen 3 Max Thinking 12/23/2025
MiniMax-M2.1 12/22/2025
GLM 4.7 12/17/2025
Gemini 3 Flash (12/25) 12/17/2025
MiMo V2 Flash 12/11/2025
GPT 5.2 12/11/2025
GPT 5.2 Codex 12/11/2025

Command A

Compare Models
Command A

Release Date: 3/13/2025

Accuracy (Vals Index)

19.20% ± 0.98

Latency (Vals Index)

305.05s

Cost/Test (Vals Index)

$1.00

Context Window

256k

Max Output Tokens

8k

Input Modality

Hyperparameter settings

Default Provider: Cohere
Some benchmarks may use different provider and parameters. Please refer to the benchmark page for more information.

Benchmark Settings

  • Temperature: 0.3
  • Top P: Default
  • Top K: Default
  • Max Output Tokens: 8,000

Benchmarks

Accuracy Rankings

Benchmark Name Performance Ranking
CaseLaw (v2) -205.56% ± 1.09 162/47
CorpFin -169.69% ± 0.97 163/97
Finance Agent (v1.1) -17.92% ± 0.97 62/45
TaxEval (v2) -296.02% ± 0.95 191/104
AIME -72.67% ± 0.94 151/96
GPQA -296.87% ± 2.28 166/99
LiveCodeBench -239.90% ± 1.09 144/103
LegalBench -606.17% ± 0.42 588/116
MedQA -677.88% ± 0.36 289/95
MMLU Pro -641.79% ± 0.46 199/97
SWE-bench -79.49% ± 1.20 41/41
Terminal-Bench 2.0 -25.11% ± 1.58 63/52