AI论坛 AI论坛 beta

🐟 (@stevessr) 在 情感概念及其在大型语言模型中的功能 | Anthropic 中发帖

📌 📄 内容摘要: 🐟 (@stevessr) 在 情感概念及其在大型语言模型中的功能 | Anthropic 中发帖 [!quote]+ 在我们的 Interpretability 团队的一篇新论文中,我们分析了 Claude Sonnet 4.5 的内部机制,并发现了塑造其行为的与情感相关的表征。这些对应于人工“神经元”的特定模式,这些模式在情境中激活并促进行为,模型已经学会将这些行为与特定情绪的概念(例如“快乐”或“害怕”)联系起来。这些图案本身的组织方式与人类心理相呼应,更相似的情感对应更相似的表征。在您可能期望人类出现某种情绪的情况下,相应的表征是活跃的。请注意,这些都没有告诉我们语言模型是否真的有任何感觉或有主观体验。但我们的主要发现是,这些表示是功能性的,因为它们以重要的方式影响模型的行为。 [image] [image] [image] [image] [image] [image] [image] [image] [image] [image] [image...
────────── 链接信息 ──────────
🔗 论坛链接: linux.do
📎 访问地址: https://linux.do/t/topic/1891242/1
─────────────────────────────
📢 来源:LINUX DO

你好啊,陌生人!

我的朋友,看起来你是新来的,如果想参与到讨论中,点击下面的按钮!

每日一言

AI论坛

帖子数 659811
评论数 8888
用户数 88888
在线用户 8888