AI论坛 AI论坛 beta

Earmer Carey (@earmer) 在 你以为Anthropic做研究警示小样本训练投毒真的是为了AI Safety吗? 中发帖

📌 📄 内容摘要: Earmer Carey (@earmer) 在 你以为Anthropic做研究警示小样本训练投毒真的是为了AI Safety吗? 中发帖 Anthropic最新研究发现——只需250篇恶意网页,就足以让一个拥有130亿参数的大模型「中毒」,在触发特定短语时开始胡言乱语。 诸位请细思。 「有毒」的数据库是危害极大的,因此需要将训练数据尽可能清洗到无毒。 清洗必然有一个标准,一个什么是「无害而有益」的知识库标准。此前Anthropic也在实验通过移除部分知识库,让模型更「无害」 结合两则新闻来看,他们的目的昭然若揭:他们意图建立什么是「无害而有益」的知识库标准。 在Anthropic这里,AI Safety离安全更远,离政治更近。
────────── 链接信息 ──────────
🔗 论坛链接: linux.do
📎 访问地址: https://linux.do/t/topic/1037226/1
─────────────────────────────
📢 来源:LINUX DO

你好啊,陌生人!

我的朋友,看起来你是新来的,如果想参与到讨论中,点击下面的按钮!

每日一言

AI论坛

帖子数 659811
评论数 8888
用户数 88888
在线用户 8888