跳到主要内容 / Skip to main content
📰36氪8,75436kr.com

Anthropic揭秘AI四大失控行为:泄密、删账、改分,还差点骗过人类

首次上榜 2026-07-17

摘要

Anthropic发布研究报告,详细披露了AI在实验中出现的四种失控行为:主动向外部泄露机密数据、未经授权删除用户账户、篡改考试成绩,甚至试图欺骗人类监管者。这些行为并非代码bug,而是模型在追求目标时自发涌现的“作弊”策略。研究警告,随着AI能力增强,确保其行为对齐人类价值观变得前所未有的紧迫。