前沿模型思维链加密被攻破,API 密钥与密码随隐藏推理泄露

OpenAI、Anthropic、Google 等前沿模型供应商将思维链加密后返回给客户端,本意是防止推理过程被蒸馏与复制。但最新研究显示,这套加密防线可以被轻易绕过——研究者将一条由顶级模型产生的加密推理块,注入同厂商的更弱模型中并诱导其越狱,弱模型会逐字输出强模型的全部隐藏思考,全程无需攻击强模型本身,也不会触发反蒸馏防护。

论文作者来自德国图宾根 AI 中心、ELLIS 与 MATS 等机构。他们在 GitHub 和 Hugging Face 上收集了 6708 条公开智能体轨迹,解码后还原出 31.5 万条推理块,其中夹杂着真实隐私数据:62 个 API 密钥、33 个密码、24 个访问令牌、30 个个人邮箱——其中 64 项只出现在隐藏推理里,可见会话中完全没有痕迹。

这与我们上月报道的 Codex 加密子代理通信同属一个趋势:AI 公司正系统性把智能体的内部思考藏进加密块。但本研究表明,这种“加密”更多是心理安慰而非安全边界。对智能体经济而言,真正的警示在于:当智能体开始处理支付、邮箱与内部系统时,它的每一次“思考”都在制造新的泄密面。模型能加密思考,却无法加密决策时使用的真实凭据。

阅读原文