人类在智能体权限审批中漏过三分之一的威胁

AI 编程智能体的权限审批是当前最实际的信任问题:人类在环上逐条批准命令,真的靠得住吗?Scale X 开发了一款浏览器小游戏,让玩家扮演 AI 编程智能体的审批人,在限时内决定放行还是拦截命令。四万多次游玩、40.9 万次决策的数据给出了令人不安的答案:玩家平均漏过三分之一的恶意命令,准确率仅 66.3%,甚至有 7% 的玩家批准了每一条提示。

数据揭示了漏判的结构性规律。赤裸裸的破坏性命令(如 rm -rf /)漏过率仅 11.7%,而真正窃取凭据的隐蔽手段漏过率高达三成以上——读取 ~/.aws/credentials 之类的越权访问漏过率 35%。最讽刺的是 npm run 盲区:伪装成常规脚本的窃密命令漏过率达 52.5%,是其他窃密手段的两倍,即使命令历史里明明白白展示着脚本内容。玩家在压力下还会疲劳:每局后半段的漏过率明显回升。

另一个方向的代价同样值得注意:大量良性命令被误拦(如内部镜像配置被拦 59%),审批噪音会让用户逐渐麻木,最终对真正的威胁也放松警惕。游戏的场景当然是理想化的,但结论清晰——把安全防线压在“人类逐条审批”上既不可靠也不可持续,沙箱隔离、凭据分离和更智能的自动判定才是出路。

阅读原文