📌 📄 内容摘要:
研究人员于2026年1月17日发布Terminal-Bench2.0,这是一个评估AI智能体在命令行界面执行复杂任务的硬基准。该测试包含89个源自真实工作流的任务,涵盖软件工程与网络安全等领域。测试显示,当前顶尖模型胜率均低于65%。其中,GPT-5.2配合CodexCLI取得63%的最高分,ClaudeOpus4
────────── 链接信息 ──────────
🔗 论坛链接: www.nodeseek.com
📎 访问地址: https://www.nodeseek.com/post-594770-1
─────────────────────────────
📢 来源:NODESEEK