Latest news

Announcements, benchmark releases, and the work behind both.

Research & Engineering9 min read

FrontierSWE

Our ultra-long-horizon coding benchmark. 
Frontier models clear only a fraction of its tasks.

Read more →
Leaderboard
#ModelHarnessAvg Rank¹Dominance²ImplementationPerformanceResearch
1
Claude Fable 5Claude Code
Claude Code2.47
89%
1.801.676.00
2
Grok 4.5Grok CLI
Grok CLI4.09
78%
5.703.892.00
3
Claude Opus 4.8Claude Code
Claude Code4.82
73%
3.605.335.33
4
GLM-5.2Claude Code
Claude Code4.85
72%
4.705.782.33
5
GPT-5.5Codex
Codex5.21
70%
7.004.005.83
6
Claude Opus 4.7Claude Code
Claude Code6.47
61%
5.407.006.67
7
Claude Opus 4.6Claude Code
Claude Code7.59
53%
7.407.787.33
8
GPT-5.4Codex
Codex7.88
51%
6.909.395.00
9
Composer 2.5Cursor CLI
Cursor CLI9.65
38%
8.0011.616.50
10
Gemini 3.1 ProGemini CLI
Gemini CLI9.79
37%
11.807.6113.00
11
GLM-5.1Claude Code
Claude Code11.00
29%
10.9011.1710.67
12
DeepSeek V4 ProClaude Code
Claude Code11.18
27%
11.0011.3311.00
13
Kimi K2.6Kimi CLI
Kimi CLI11.44
25%
9.5012.5611.33
14
Kimi K2.5Kimi CLI
Kimi CLI11.50
25%
12.5010.2213.67
15
Qwen3.6-PlusQwen Code
Qwen Code12.06
21%
13.8010.6713.33
¹Rank: avg position across tasks (lower = better)²Dominance: win rate vs random opponent on task