我们是否过度信任 AI 说"不"的能力
MIT Technology Review 刊文指出,AI 的拒绝能力已成为 AI 安全的"承重墙",但这一机制并不可靠。Anthropic 2021 年提出模型应"有用、诚实、无害",如今各大公司通过红队测试和 AI 训练 AI 的方式让模型学会拒绝有害提示词,但拒绝机制基于概率,determined miscreants 已多次突破。
MIT Technology Review 刊文指出,AI 的拒绝能力已成为 AI 安全的"承重墙",但这一机制并不可靠。Anthropic 2021 年提出模型应"有用、诚实、无害",如今各大公司通过红队测试和 AI 训练 AI 的方式让模型学会拒绝有害提示词,但拒绝机制基于概率,determined miscreants 已多次突破。
MIT Technology Review 与 Aventine 合作的文章指出,尽管马斯克称 Tesla Optimus 未来能以每台低至 2 万美元自动化几乎所有人类劳动、并预测 2027 年底前向公众发售,但许多机器人研究者对此持怀疑态度。