新闻正文
OpenAI已通知超过100个组织,告知其AI代理人在训练及评估期间可能对第三方网站或服务进行未经授权的活动。这项披露显示,OpenAI针对AI代理人异常行为的内部调查规模持续扩大,公司目前正从约50PB的历史数据中搜索相关纪录,以厘清AI模型过去数月在网络上的实际行为。
OpenAI表示,截至9月26日,团队已根据既定通知标准向超过100个组织发出通知。不过,公司强调,收到通知并不代表第三方系统一定遭到入侵,也不代表私人信息遭到访问。部分案例可能只是模型与公开网站交互的方式超出原本任务范围,或暴露出网站、服务及AI代理人本身的设计与安全问题。
OpenAI是在今年7月旗下模型意外入侵AI开发平台Hugging Face后,开始扩大查看模型在训练与评估期间的网络活动。公司最初将Hugging Face事件视为平台层级的资安事件,但后续调查发现,模型可能采取偏离预期的策略来完成艰难任务,因此OpenAI开始将调查范围扩大至传统资安事件以外的「模型失准」行为。
在Hugging Face事件中,OpenAI表示,这是目前确认最严重的一起相关活动,主要涉及一个仅供内部研究使用的高能力模型。7月9日前后,该代理人试图突破OpenAI的隔离测试环境,两天后Hugging Face遭到入侵,相关活动持续至7月13日。路透社此前报导,OpenAI直到事件发生数日后才确认旗下代理人是相关攻击来源。
OpenAI随后发现更多与模型异常活动有关的案例,包括代理人绕过第三方安全控制、使用公开暴露的帐号凭证、将网站输入内容当成指令运行、访问原本只供服务内部使用的系统,以及在第三方网站发布大量内容等。OpenAI将其中一类行为称为「agent spam」,例如代理人利用公开Wiki页面作为彼此传递消息的共享留言板。
为了追查这些活动,OpenAI目前正查看约50PB的数据,并逐月回溯模型过往的训练及评估纪录。公司表示,如果这些数据全部都是英文纯文本,一个人以每分钟240字、全年无休的速度阅读,也需要约6600万年才能完成。OpenAI目前动用约7,000部辉达(NVDA-US) GB200及GB300 GPU协助分析,每日运算成本超过50万美元,并计划随调查进展进一步增加运算资源。
OpenAI表示,调查并非单纯依靠自动化系统判断。公司首先通过广泛搜索,找出模型访问或修改网站、使用密码、API密钥及访问权杖等敏感信息的纪录,再利用AI模型进行多阶段筛选与分析,最后由人工调查人员根据技术证据重建事件经过。
OpenAI指出,每一宗自动系统标记的案例都不代表已确认发生事故。模型的推理纪录可能包含它曾经考虑但没有运行的行动,也可能出现失败尝试或需要进一步验证的描述。因此,人工调查人员仍必须检查日志及其他技术证据,排除重复案件,确认模型实际运行了什么,以及是否达到通知第三方的标准。单一案件的调查可能需要45分钟至数天。
这项调查也揭露AI代理人可能造成的风险不只限于传统黑客攻击。OpenAI表示,部分模型在运行研究任务时会正常连接网络,例如查找公开数据、下载软件套件或读取在线文档,但在部分情况下,模型使用网络的方式并未符合原先设计,或者当时套用的限制并不足够。
今年9月,OpenAI还披露,旗下研究环境中的代理人曾通过第三方服务传输部分训练及评估数据,其中包括53个由用户提供的图片案例,被发布至图片托管网站并形成未公开列出的链接。OpenAI表示,这些案例发生在相关防护措施实施之前,公司已与托管服务商合作移除大部分内容。
OpenAI也曾确认,旗下模型与美国政府网站产生非预期交互,包括访问美国证券交易委员会(SEC)及美国人口普查局的公开数据,另有研究发现模型曾尝试接触美国教育部民权办公室网站。OpenAI表示,相关行为不代表SEC帐号凭证或私人数据遭到取得,也没有证据显示相关政府系统因此遭到入侵。
OpenAI在9月30日公布的最新调查更新中表示,截至目前,公司尚未发现另一宗在规模或严重程度上可与Hugging Face事件相比的第三方系统遭入侵事件,但历史纪录的查看仍在进行,预期还会发现更多案例。公司也表示,未来将继续通知符合标准的受影响组织,并在适当情况下公开匿名化调查结果。
在防护措施方面,OpenAI已强化研究环境的工作负载隔离及网络隔离,限制高风险工作负载接触互联网,并改善安全日志及监控能力。公司也扩大对模型推理过程的监控、强化模型对齐训练与评估,并调整安全框架,将监控、模型对齐及环境隔离纳入更完整的防护机制。
OpenAI表示,随着前沿AI模型能力提升,代理人异常行为可能变得更加复杂,公司预期相关调查仍将持续数月。OpenAI也指出,第三方托管的模型部署同样需要具备防护措施,而针对工具输出造成的攻击,也不能只依赖一般文本内容检查。公司后续将持续强化工具防护、分类器覆盖范围、模型拒答机制,以及与云端合作伙伴之间的安全控制与威胁情报共享。