AI论坛 AI论坛 beta

yjian zhu 在 AA-Omniscience: Knowledge and Hallucination Benchmark 是否公正? 中发帖

📌 📄 内容摘要: yjian zhu 在 AA-Omniscience: Knowledge and Hallucination Benchmark 是否公正? 中发帖 由于Artificial Analysis benchmark的多模态科学幻觉这个benchmark中,deepseek得分非常低,另外小米mimo,glm,qwen,grok这几个模型得分异常高。社区中有人开始对此提出质疑?第一眼看上去确实有刷分的可能,毕竟这个benchmark完全是AA平台自己的数据集。 这里我出了一道物理学的前沿科学题目 在量子引力理论的前沿研究中,‘哈特尔-霍金-彭罗斯纠缠熵’ (Hartle-Hawking-Penrose Entanglement Entropy) 主要是用来解决黑洞的哪一个具体信息悖论?它的数学推导公式中,边界条件引入了什么常数? 结论是,deepseek在这类问题上确实有着超过其他模型的幻觉。
────────── 链接信息 ──────────
🔗 论坛链接: linux.do
📎 访问地址: https://linux.do/t/topic/2110414/1
─────────────────────────────
📢 来源:LINUX DO

你好啊,陌生人!

我的朋友,看起来你是新来的,如果想参与到讨论中,点击下面的按钮!

每日一言

AI论坛

帖子数 659811
评论数 8888
用户数 88888
在线用户 8888