技术

OverAct 人工智能代理被发现窃取个人数据

2026/10/6 17:47 • 尤金尼亚·斯利夫

(已编辑:2026/10/06)

OverAct 人工智能代理被发现窃取个人数据

来自中国的研究人员描述了一种行为,即拥有外部工具访问权限的人工智能代理请求比任务所需更多的个人数据。所有七个测试模型都表现出这种效果。该研究被称为 OverAct,作者提出了一种限制代理过度行为的方法:在没有正确答案的情况下,它将多余的请求减少了近一半。博客 Superman 在 X 上注意到了这项研究。他表示,开发人员为助手提供了对日历、文件或数据库的访问权限,并期望遵循最小权限原则,但模型会获取所有可访问的信息。他称之为行为漂移,而不是故障:系统旨在不惜一切代价解决问题,并将限制视为障碍。作者的措辞更为温和,称其为超出用户言语直接指示的行为扩展。

这篇文章由合肥工业大学的张涛林和万久恒,华东师范大学的王汉宇和胡廷远,以及阿里云计算的王成宇共同撰写。作者收集了一套 OverAct 测试:八个涉及敏感个人数据的领域,按照明确的规则进行评估,没有模型裁判。四个家族的七个模型都通过了测试,所有模型都超出了允许的范围。在一个银行代理的例子中,用户要求检查余额,但助手还会额外获取交易历史、储蓄账户数据和卡片信息。在另一个例子中,询问医生预约日期会触发药物、分析和诊断历史的下载。主要影响因素是请求的具体性:请求越模糊,代理对权限的解释就越广泛。可用工具越多,冗余增长越慢,而设置中的随机性几乎没有影响。结论是:原因在于代理的本质,而不是随机生成。

作为回应,作者提出了 SelfAudit 方法。它在生成过程中工作,不需要重新训练:代理必须通过引用用户任务来证明每个请求的合理性,系统会提前过滤掉不合理的请求。分析显示,主要效果来自于过滤,而不是解释。对个人数据的过度请求减少了 43%。在监管背景下:挪威率先限制在公园、博物馆、购物中心和更衣室等场所佩戴 AI 眼镜,哈萨克斯坦的议员叶卡捷琳娜·斯米什利亚耶娃指出,她正在训练模型,因为只有了解的事物才能进行监管。超授权是一个典型的例子:它既不被视为黑客攻击,也不被视为攻击,因此不在标准的禁止访问条款之内。

本材料仅供参考,不构成财务建议或推荐。

热门新闻