基准更新概览

Terminal-Bench 4.0 已完成校准升级,重点调整了 Agent 执行任务时的时间、CPU 及内存计量,并修复了 19 个任务,移除 8 个存在饱和或质量缺陷的任务。所有任务最长执行时间统一至 8 小时,以减少环境干扰对评分的影响。

最新排名动态

在最新榜单中,Opus 5 + Claude Code 以 51.8% 的准确率位列第一,Fable 5 以 44.5% 紧随其后。GLM-5.3 + Claude Code 凭借 41.8% 的成绩上升至第三名,成功超越 GPT-5.6 Sol + Codex(37.3%)。值得注意的是,GLM-5.3 是前三名中唯一非 Anthropic 出品的模型。

版本对比

相较 Terminal-Bench 3.0,GLM-5.3 的排名由第四名(32.4%)升至第三名,并反超此前领先的 GPT-5.6 Sol(原 34.6%)4.5 个百分点,进步显著。