Benchmark leaderboard

Rank explanation quality separately from patch success.

Compare whether agent explanations preserve intent, describe actual effects, and stay grounded at both local and global levels.

Click an agent to inspect each benchmark instance.

RankAgent
1OpenHands Qwen3 Coder 480B A35B Instruct0.597 0.723 0.791 0.353 0.522
2Refact Agent Claude 4 Sonnet0.596 0.723 0.818 0.355 0.490
3Lingxi v1.5 Claude 4 Sonnet0.592 0.704 0.805 0.368 0.492
4Trae Agent Doubao Seed Code0.558 0.636 0.805 0.332 0.457
5mini-SWE-agent v1.7.0 GPT-5 mini0.435 0.467 0.599 0.302 0.370