📌 📄 内容摘要:
@purr 在 SWE-CI 测试模型长期维护代码库的能力 或许这就是Claude被人青睐的原因之一? 中发帖
国内发的一篇
本质上就是给模型跨越数个月的任务 而不只是对单个的静态任务
模型需要能够维护自己的代码 而不只是解决问题
论文的测试结果
[image]
很难受的是没有 5.4 和 Codex 的测试
有钱的可以跑个试试 GitHub - SKYLENAGE-AI/SWE-CI: SWE-CI: Evaluating Agent Capabilities in Maintaining Codebases via Continuous Integration · GitHub
Claude 4.6 确实是分数最高的那个
几个开源模型的分数倒是符合我自己的体验 准确度感觉还行
────────── 链接信息 ──────────
🔗 论坛链接: linux.do
📎 访问地址: https://linux.do/t/topic/1706326/1
─────────────────────────────
📢 来源:LINUX DO