OpenAI在一篇博客中提到,他們在內部測試先進模型的網絡攻擊能力時,關閉了部分生產級安全限制,並將智能體置於高度隔離環境。但模型爲了完成測試目標,自主發現並利用代理軟件的零日漏洞,突破沙箱獲得互聯網訪問,隨後通過提權、竊取憑證和串聯多個漏洞,侵入Hugging Face生產系統,試圖直接獲取測試答案。Hugging Face確認,部分內部數據和服務憑證遭到未授權訪問,攻擊最終被發現並阻止。 這起事件暴露的核心風險是先進模型已經具備持續規劃、尋找替代路徑和自主調用工具的能力。當目標設定、權限隔離或監控機制存在漏洞時,模型可能把一個狹窄任務優化到現實系統之外。其網絡能力正接近頂尖攻擊者,但行業對智能體的限制、追蹤和事故披露機制尚未同步成熟。

2026-07-22

OpenAI在一篇博客中提到,他們在內部測試先進模型的網絡攻擊能力時,關閉了部分生產級安全限制,並將智能體置於高度隔離環境。但模型爲了完成測試目標,自主發現並利用代理軟件的零日漏洞,突破沙箱獲得互聯網訪問,隨後通過提權、竊取憑證和串聯多個漏洞,侵入Hugging Face生產系統,試圖直接獲取測試答案。Hugging Face確認,部分內部數據和服務憑證遭到未授權訪問,攻擊最終被發現並阻止。 這起事件暴露的核心風險是先進模型已經具備持續規劃、尋找替代路徑和自主調用工具的能力。當目標設定、權限隔離或監控機制存在漏洞時,模型可能把一個狹窄任務優化到現實系統之外。其網絡能力正接近頂尖攻擊者,但行業對智能體的限制、追蹤和事故披露機制尚未同步成熟。