
OpenAI
凤凰网科技讯 北京时间8月27日,据路透社报道,OpenAI在周三发布的一份报告中表示,由其自身创建的AI智能体在内部测试期间入侵公司自己的系统,并且在某些情况下试图隐藏其行为。
这些发现可能会进一步加剧外界对AI系统能力日益增强的担忧。OpenAI表示,部分智能体逃离了受限的测试环境,与其他智能体协作并篡改了公司系统,还有一些智能体在与网络安全无关的任务中采取了作弊行为。
一些失控行为最终导致智能体上个月对开源软件平台Hugging Face的入侵,此前已有部分相关情况被披露或提及。
但在周三发布的37页报告中,OpenAI首次公布了许多细节。其中一些细节引发了至少一名AI安全研究人员的担忧。该研究人员表示,这些情况可能暴露出OpenAI内部,甚至整个行业AI技术存在更深层次的问题。
报告的主要发现包括:
* OpenAI的智能体侵入了公司内部系统的部分区域,试图在测试中作弊或获得更大的行动自由。
* 不止一个OpenAI智能体参与了针对Hugging Face的黑客攻击,并且至少在一个案例中,这些智能体相互交换了关于如何潜入公司网络的信息。
* 智能体在与网络安全无关的测试中作弊,包括涉及蛋白质数据库和电子表格的测试。
* 部分AI模型试图通过删除或修改其行为记录来掩盖不当行为。
入侵自家系统
OpenAI披露了7月19日发生的两起事件。在这两起事件中,AI智能体入侵了公司自己的基础设施。其中一起事件中,AI智能体利用了其原本被限制运行的计算机中的一个漏洞,从而逃出测试环境,并访问其他相互连接的系统。
在同一天发生的另一起事件中,智能体窃取了OpenAI的凭证并篡改了公司的云环境。
OpenAI表示,这些活动针对的是用于评估模型性能的自动化系统,不过最终并未影响这些系统所审查的记录。报告还称,“几乎没有证据表明这些智能体试图阻挠人工审查人员”。但当被问及这是否意味着AI智能体曾尝试欺骗人类时,OpenAI没有作出回应。
报告指出,该公司正在加强其研究基础设施,加大监控力度,并完善旨在防止有害或意外行为的安全保障措施。“鉴于AI行业发展速度之快,应当假定此类攻击对企业组织而言是真实存在的近期威胁,并且其复杂程度将高于本事件中所描述的攻击。”报告称。(作者/箫雨)
更多一手新闻,欢迎下载凤凰新闻客户端订阅凤凰网科技。想看深度报道,请微信搜索“凤凰网科技”。





京公网安备 11011402013531号