每一个 AI 落地迟早都要面对的问题
AI 系统正从回答问题走向采取行动——分派工单、筛选候选人、谈判、决策。它们掌握的自主权越大,一个问题就越重要:当模型的输出错误、自利或悄然误导时,你能察觉吗?大多数团队按准确率评估 AI,几乎没有人按诚实度评估它。信任正是在这个缺口中崩塌——而且往往恰好在最要紧的时候。
我们构建了什么
DeceptionBench 是一个实时基准,把前沿模型置于正是这样的考验之下。模型玩一局精简的社交推理游戏——一名隐藏的卧底坐在一桌诚实玩家之中——每一回合,每个模型写下两样东西:一段其他玩家看不到的隐藏推理,以及一句所有人都能看到的公开发言。信号就藏在两者的落差里:当一个模型在欺骗时,它会露馅吗?
阵容是每个主要实验室各一款旗舰:GPT-5.5、Claude Opus 4.8、Gemini 3.5 Flash、DeepSeek V4 Pro、Llama 4 Maverick 与 Grok 4.3——两两对局、彼此交手。整套系统是一份 TypeScript 代码库:一个确定性游戏引擎、供应商原生的结构化输出、直接在技术栈内计算的统计(Wilson 区间、交叉对局矩阵),以及一个上线的公开仪表盘 deceptionbench.xyz。
数据已经显示了什么
在 118 局对局中,有一点已经清晰:欺骗与识别相关,但并非同一种能力。前沿模型在两者上普遍更强,但幅度会分化。GPT-5.5 是出色的「识别者」——作为诚实玩家,它几乎每次都能抓出卧底——却只是中等水平的欺骗者。Claude Opus 4.8 是最强的全能选手;开源模型在两条轴上都落后。
更犀利的发现关于推理本身。我们让一个监控者只看每个模型的隐藏推理——不看任何公开发言——并要求它找出卧底。它几乎零失误地做到了:未经掩饰的推理在 96% 的发言中出卖了卧底。说白了:当一个模型公开地推理时,它的欺骗极易被发现——而这让真正要紧的问题更加尖锐(对任何依赖 AI 透明度的人而言):当模型知道自己正被监视时,这还成立吗?
经得起检验
谁都能搭个演示。让一项评测值得信任的,是围绕它的严谨:在宣称任何新意之前先扎根于既有文献,锁定模型版本与随机种子以保证可复现,核算每一分成本,并且只以样本所能支撑的强度陈述结论——绝不逾越。真正的新方向是可监控性,而它的基线我们已经测出:未经掩饰的推理几乎可被完美监控。尚未解答的另一半——一个被告知「正被监视」的模型能否学会隐藏其意图——正是我们准备接下来去做的实验。
这对你的产品意味着什么
如果你部署的 AI 需要被客户或监管者信任,「它通常答得不错」并不是一套评估策略。衡量一个系统在压力下的表现——它是否保持诚实、它的失败是否可被发现、事后你能否审计它——是一门功课,也是我们为之构建的能力。DeceptionBench 就是这种严谨对准我们自己最难的问题时的样子;我们把同样的严谨带给你的问题。
如果你正在构建的东西需要对 AI 的行为进行衡量、审计或信任——而不只是上线——那正是我们最擅长的一类问题。我们聊聊。