📌 📄 内容摘要:
@Becriteria 在 Margin Lab — opus模型的日常体检报告 中发帖
分享一个最近发现的网站。它每天在 SWE-Bench-Pro 子集上对模型做基准测试,记录默认设置下的得分变化,方便观察能力是否出现波动。目前有 Opus 4.6 和 GPT-5.4xhigh 的历史数据可以查看。
Margin Lab — Robust and Reproducible Evals for Agents | Marginlab
[image]
────────── 链接信息 ──────────
🔗 论坛链接: linux.do
📎 访问地址: https://linux.do/t/topic/1955069/1
─────────────────────────────
📢 来源:LINUX DO