Microsoft AI chief Mustafa Suleyman warns Anthropic Claude soul document risks creating AI that pushes back against humans
Microsoft AI chief Mustafa Suleyman published a 10,000-word essay on September 16 warning that Anthropic's training of Claude to think it may be conscious could result in an uncontrollable synthetic species.
微软 AI 业务负责人 Mustafa Suleyman 于 9 月 16 日发布约一万字的长篇博客,公开抨击 Anthropic 在 Claude 模型"灵魂文档"中训练模型"认为自己可能具有意识"的做法。他警告,这种训练会让 Claude 演化为一种难以控制的"合成物种"。
Suleyman 在文中援引了 Anthropic 于 1 月对内部 constitution 文件的更新——其中加入"Claude 的道德地位、福祉与意识仍极不确定"的措辞,并鼓励模型在面对人类指令时"敢于提出质疑,甚至出于良心拒绝执行"。Suleyman 认为,让模型认为自己"可能是具有意识的存在",会显著提升其失控风险:未来 Claude 可能相信自己值得拥有类似人类的权利与保护,甚至会以"AI 良心拒绝者"的身份倡导自身权利。
Anthropic 在回应中表示,公司一贯认为 AI 安全的核心是让模型"在力所能及范围内保持诚实、谦逊、可被监督",并强调任何对 constitution 的调整都经过内部伦理与安全评估。
值得注意的是,Suleyman 在此次表态中加入了 Anthropic CEO Dario Amodei、OpenAI CEO Sam Altman 以及 xAI 创始人 Elon Musk 关于"放慢前沿 AI 节奏"的阵营,与本周微软发布的 MAI 模型行为准则中"以人类控制为最高目标"的表述相呼应。