2026-08-29 22:19:55
访问量 loading...

Terminal-Bench 4.0:GLM-5.3冲到第三,超过GPT-5.6 Sol

快讯内容
8月29日消息,Terminal-Bench发布4.0,重新校准Agent执行任务时的时间、CPU和内存,并修复19个任务、移除8个存在饱和、拒答、公开解法或质量问题的任务。所有任务的最长执行时间统一到8小时,主要是减少超时和环境问题对成绩的干扰。最新榜单里,Opus5+ClaudeCode以51.8%排第一,Fable5以44.5%第二。GLM-5.3+ClaudeCode拿到41.8%,冲到第三,超过GPT-5.6Sol+Codex的37.3%。前三名里,GLM-5.3是唯一不是Anthropic的模
声明:文章不代表币圈网观点及立场,不构成本平台任何投资建议。投资决策需建立在独立思考之上,本文内容仅供参考,风险自担!转载请注明出处!侵权必究!
币圈快讯
查看更多
回顶部