Benchmark leaderboard
Rank explanation quality separately from patch success.
Compare whether agent explanations preserve intent, describe actual effects, and stay grounded at both local and global levels.
Click an agent to inspect each benchmark instance.
| Rank | Agent | |||||
|---|---|---|---|---|---|---|
| 1 | OpenHands Qwen3 Coder 480B A35B Instruct | 0.597 | 0.723 | 0.791 | 0.353 | 0.522 |
| 2 | Refact Agent Claude 4 Sonnet | 0.596 | 0.723 | 0.818 | 0.355 | 0.490 |
| 3 | Lingxi v1.5 Claude 4 Sonnet | 0.592 | 0.704 | 0.805 | 0.368 | 0.492 |
| 4 | Trae Agent Doubao Seed Code | 0.558 | 0.636 | 0.805 | 0.332 | 0.457 |
| 5 | mini-SWE-agent v1.7.0 GPT-5 mini | 0.435 | 0.467 | 0.599 | 0.302 | 0.370 |