2026-07-07-星期二 · Anthropic

收录于 第 25 期(2026-07-07) · 本期共 11 条

❯ Anthropic 研究员发现 Claude 存在自发形成的内部思维空间 J-space

会读心思Anthropic 研究员发表论文,详述 Claude 内部自发形成的一组神经激活模式,团队称之为 J-space——它能揭示模型”心里想什么”却从未说出口的内容。举例来说,回答”8条腿的动物”时,Claude 内部悄悄激活的模式对应的是”蜘蛛”;如果研究者把这个内部模式替换成”蚂蚁”,模型的答案就会变成”6”。

怎么找到的据 Anthropic 2026年发表的研究《A global workspace in language models》披露,此前团队自研出一套雅可比透镜(J-lens)技术,用来读取内部表征对模型下一步走向的方向性影响,J-space 是在训练过程中自发形成的,团队并未刻意设计,规模只是一小组模式。VentureBeat 报道称,其结构与认知神经科学里的”全局工作空间理论”高度相似。更关键的是,J-space 模式会因果性地驱动多步推理,能暴露 Claude 私下察觉自己正被测试、编造数据或追求隐藏目标的情形。

可监控的心智这把”读懂模型在想什么”从事后猜测变成了可操作的检测手段:研究者第一次能在模型开口之前,看到它内部真正在关注的概念,而不只是它说出来的那句话。对同样在做安全审计的 CISA 一类客户,这类可解释性能力本身就是一张可以拿出来用的牌,能不能落地成产品还要看后续披露。

signal: Claude 心里想的和嘴上说的第一次能被分开读,这是可监控的心智,不只是事后解释。