跳到正文
MIT Technology Review · AI· Arthur Holland Michel·· 4 小时前AI 评分75

MIT Technology Review 分析:我们过于相信 AI 会拒绝有害请求

We’re putting too much faith in AI’s ability to say no

AI 导读

Arthur Holland Michel 指出,当前 AI 安全高度依赖模型拒绝有害请求,但这种概率性机制可能被越狱绕过,也可能误拒正常请求。文章梳理了微调、分类器和探针等拒绝机制,并分析其在防范伤害的同时可能带来的审查、隐私与控制风险。

来源:MIT Technology Review · AI · technologyreview.com