Open Weights & Proprietary

Models

Release Date Model Name Company Image
4/16/2026 Claude Opus 4.7 Anthropic
4/8/2026 Muse Spark Meta
4/2/2026 Gemma 4 31B IT Google
4/2/2026 Qwen 3.6 Plus Alibaba
4/1/2026 GLM 5.1 zAI
4/1/2026 Trinity Large Thinking Arcee AI
3/17/2026 GPT 5.4 Mini OpenAI
3/17/2026 GPT 5.4 Nano OpenAI
3/17/2026 MiniMax-M2.7 MiniMax
3/9/2026 Grok 4.20 (Reasoning) xAI
3/5/2026 GPT 5.4 OpenAI
3/3/2026 Gemini 3.1 Flash Lite Preview Google
2/24/2026 GPT 5.3 Codex OpenAI
2/23/2026 Qwen 3.5 Flash Alibaba
2/19/2026 Gemini 3.1 Pro Preview (02/26) Google
2/17/2026 Claude Sonnet 4.6 Anthropic
2/16/2026 Qwen 3.5 Plus Alibaba
2/12/2026 MiniMax-M2.5 MiniMax
2/11/2026 MiniMax-M2.5 MiniMax
2/5/2026 GLM 5 zAI
2/5/2026 Claude Opus 4.6 (Nonthinking) Anthropic
2/5/2026 Claude Opus 4.6 (Thinking) Anthropic
1/26/2026 Kimi K2.5 Moonshot AI
1/23/2026 Qwen 3 Max Thinking Alibaba
12/23/2025 MiniMax-M2.1 MiniMax
12/22/2025 GLM 4.7 zAI
12/17/2025 Gemini 3 Flash (12/25) Google
12/17/2025 MiMo V2 Flash Xiaomi
12/11/2025 GPT 5.2 OpenAI
12/11/2025 GPT 5.2 Codex OpenAI

Trinity Large Thinking

  • Release Date: 4/1/2026
  • Default Provider: Arcee-Ai

Benchmarks

Metric Value
Accuracy (Vals Index) 42.60% ± 1.88
Latency (Vals Index) 380.48s
Cost/Test (Vals Index) $0.14
Context Window 262k
Max Output Tokens 80k
  • Temperature: 0.3
  • Top P: 0.95
  • Top K: Default
  • Max Output Tokens: 80,000

Accuracy Rankings

Benchmark Accuracy
Vals Index -53.33% ± 1.88
CaseLaw (v2) -88.40% ± 1.86
CorpFin -103.42% ± 0.98
Terminal-Bench 2.0 -41.17% ± 4.09

Proprietary Benchmarks

Academic Benchmarks: Read about our methodology.