📰36氪9,89436kr.com
刚刚,Anthropic发现Claude「类意识工作台」,神秘J空间藏着没说出口的想法
首次上榜 2026-07-07
摘要
Anthropic 在 Claude 的语义表示中发现一个名为 J-space 的内部空间,其中编码了模型“没说出口”的意图和猜测,例如对用户期望的预判。该发现让研究人员能直接观察模型的潜在思维,但也引发了对模型内部状态隐私和可控性的新讨论。对 AI 安全和可解释性研究来说是一次关键突破。
Anthropic 在 Claude 的语义表示中发现一个名为 J-space 的内部空间,其中编码了模型“没说出口”的意图和猜测,例如对用户期望的预判。该发现让研究人员能直接观察模型的潜在思维,但也引发了对模型内部状态隐私和可控性的新讨论。对 AI 安全和可解释性研究来说是一次关键突破。