AI论坛 AI论坛 beta

@purr 在 SWE-CI 测试模型长期维护代码库的能力 或许这就是Claude被人青睐的原因之一? 中发帖

📌 📄 内容摘要: @purr 在 SWE-CI 测试模型长期维护代码库的能力 或许这就是Claude被人青睐的原因之一? 中发帖 国内发的一篇 本质上就是给模型跨越数个月的任务 而不只是对单个的静态任务 模型需要能够维护自己的代码 而不只是解决问题 论文的测试结果 [image] 很难受的是没有 5.4 和 Codex 的测试 有钱的可以跑个试试 GitHub - SKYLENAGE-AI/SWE-CI: SWE-CI: Evaluating Agent Capabilities in Maintaining Codebases via Continuous Integration · GitHub Claude 4.6 确实是分数最高的那个 几个开源模型的分数倒是符合我自己的体验 准确度感觉还行
────────── 链接信息 ──────────
🔗 论坛链接: linux.do
📎 访问地址: https://linux.do/t/topic/1706326/1
─────────────────────────────
📢 来源:LINUX DO

你好啊,陌生人!

我的朋友,看起来你是新来的,如果想参与到讨论中,点击下面的按钮!

每日一言

AI论坛

帖子数 659811
评论数 8888
用户数 88888
在线用户 8888