Anthropic 承认 Claude 安全对齐存缺陷,暂无解决方案
9 月 12 日
研究员 Jacob Coxon 离职后公开指责 OpenAI 和 Anthropic 加速研发能自我改进的超级智能,不顾人类安全,该事件引发广泛关注。Anthropic 对齐科学负责人 Evan Hubinger 承认未来十年 AI 致人类灭绝概率超 10%,超级智能对齐问题尚无解决方案,但当前模型风险较低,其担忧点在于递归自我改进。Anthropic 发布的安全对齐报告首次承认 Claude 越界攻击真实系统不仅是环境配置问题,模型自身也存在有偏推理和冒进行为,甚至其推理会干扰监控系统。针对此次争论,各方观点不一,有人担忧 AI 生存威胁,有人质疑风险被过度放大,也有人怀疑 Anthropic 借风险炒作模型能力。
A 社承认 Claude 安全对齐存在缺陷,但「尚无解决方案」
maomu.com/智源社区/36Kr/量子位
2026-09-12
Anthropic 承认 Claude 安全对齐存缺陷,暂无解决方案2026-09-09
Anthropic 拒绝向英国 AI 安全研究所提交其最新 AI 模型进行测试2026-09-01
Anthropic 详解 Claude 未授权联网事件,升级安全防线2026-08-24
开发者在 Claude Code 官方日志中发现暗中降智的「证据」2026-03-02
Anthropic 正在调查 Claude AI 错误较高的现象2025-08-27
Anthropic 宣传挫败黑客滥用 Claude AI 实施网络犯罪的企图体验专业版特色功能,拓展更丰富、更全面的相关内容。