跳到正文
原文
MIT Technology Review · AI· Arthur Holland Michel·· 5 小时前AI 评分52

我们是否过度信任 AI 说“不”的能力

We’re putting too much faith in AI’s ability to say no

AI 导读

MIT Technology Review 刊文讨论 AI 拒答机制:模型通过微调、分类器和探针学习拒绝有害请求,但机制本质是概率性的,越狱与误拒时有发生。文章援引 Anthropic、OpenAI 相关人士与研究者观点,指出拒答已成为 AI 安全的主要支柱,而政府若介入划定拒答边界,可能同时带来审查风险。

来源:MIT Technology Review · AI · technologyreview.com