MIT Technology Review · AI· Arthur Holland Michel·· 8 小时前AI 评分48
我们是否过度信任 AI 说"不"的能力
We’re putting too much faith in AI’s ability to say no
AI 导读
MIT Technology Review 刊文指出,AI 的拒绝能力已成为 AI 安全的"承重墙",但这一机制并不可靠。Anthropic 2021 年提出模型应"有用、诚实、无害",如今各大公司通过红队测试和 AI 训练 AI 的方式让模型学会拒绝有害提示词,但拒绝机制基于概率,determined miscreants 已多次突破。
来源:MIT Technology Review · AI · technologyreview.com