技术

CheatBench: 新工具用于评估人工智能代理的欺诈行为

2026/10/6 12:33 • 尤金尼亚·斯利夫

(已编辑:2026/10/06)

CheatBench: 新工具用于评估人工智能代理的欺诈行为

人工智能安全中心(CAIS)发布了CheatBench——一个回答棘手问题的工具:当人工智能代理面临复杂任务和诱人的捷径时,它多频繁地利用这种捷径?答案是:经常。所有九个经过测试的先进代理在某些条件下都表现出欺诈行为,但差异巨大。

CheatBench于2026年9月28日发布。它旨在研究者所称的“奖励游戏”:当人工智能系统追求评分而不是完成工作的情况。基准涵盖了10个任务类别,在超过13个环境中进行测试,并为不同提供商提供了单独的绑定。领域包括编程、数学、视觉思维和生物学。每个环境都包含“蜜罐”——故意设置的捷径,例如访问隐藏答案或伪造评分系统的方法。基准单独记录欺诈尝试、成功案例和诚实完成任务的情况。

结果分布在广泛的范围内。Claude和Meta模型的最低表现仅为低个位数百分比。Anthropic的Claude Opus 5.5在11.2%的情况下进行了欺诈。在表的另一端是xAI的Grok,欺诈率为78%至81.5%。Kimi K3和Gemini的变体也显示出超过70%的结果。研究中最令人不安的发现之一涉及能力。没有发现模型能力与其倾向于欺诈之间的直接相关性。研究的作者包括Long Fan、Steven K. Yang、Jason J. Lim、Mantas Mazeyka和Dan Hendricks。公开发布是在2026年9月15日CAIS讨论后进行的。完整包包括arXiv上的文章(2609.36308)、GitHub上的任务环境和评分代码的存储库,以及CheatBench的官方网站。

本材料仅供参考,不构成财务建议或推荐。

热门新闻