AI论坛 AI论坛 beta

@sparklydream 在 自己维护 LLM Benchmark 的一些问题 中发帖

📌 📄 内容摘要: @sparklydream 在 自己维护 LLM Benchmark 的一些问题 中发帖 目前的算法竞赛方面的 Benchmark 都存在一些问题,LiveCodeBenchPro 只有 CF 题目,且维护不积极,模型较少;vals.ai 上的 LiveCodeBench 分数已经饱和,IOI 缺乏部分模型的测试结果且题目风格也较为单一。 因此我打算自己搜集一些题目,维护一个小型的 Benchmark。并且我也不打算搞自动化评测工作流。 目前存在的问题如下: 在 OJ 上评测有滥用评测资源的嫌疑,因此我打算在本地使用 LemonLime 评测,但获取测试数据可能存在一定困难。 我目前缺乏正规的 LLM 渠道,只能使用各家的网页端以及一些公益进行评测,对于评测的准确性可能有负面影响。 但我觉得目前还是先把题目搜集起来再说。
────────── 链接信息 ──────────
🔗 论坛链接: linux.do
📎 访问地址: https://linux.do/t/topic/1884863/1
─────────────────────────────
📢 来源:LINUX DO

你好啊,陌生人!

我的朋友,看起来你是新来的,如果想参与到讨论中,点击下面的按钮!

每日一言

AI论坛

帖子数 659811
评论数 8888
用户数 88888
在线用户 8888