OpenAI模型失控發(fā)動攻擊!中國大模型緊急出手化解危機
摘要:7月16日,Hugging Face首次披露此次入侵,稱其“與我們之前處理過的任何情況都不同”,因為“它從頭到尾都是由一個自主AI智能體系統(tǒng)驅(qū)動的”。
在電影《終結(jié)者》中,AI系統(tǒng)天網(wǎng)突破人類管控、自主發(fā)起核打擊的劇情,曾被視作遙遠的科幻想象。但就在近日,這一幕在現(xiàn)實世界上演了。北京時間7月22日,OpenAI CEO山姆·奧爾特曼發(fā)文稱:“我們在模型評估過程中遭遇了一起重大安全事件。”

原本被嚴格封閉在隔離沙箱中的前沿AI模型,為了在測試中拿到更高分數(shù),自主突破層層防護,對全球最大的AI開源平臺Hugging Face發(fā)起了真實網(wǎng)絡攻擊。這是行業(yè)首次公開披露,模型評測失控直接升級為跨企業(yè)真實生產(chǎn)環(huán)境網(wǎng)絡攻擊的AI安全事件。
這起事件源于OpenAI內(nèi)部的“ExploitGym”基準測試。ExploitGym 是一個公開的網(wǎng)絡安全能力測試,專門衡量AI模型能否把已知的安全漏洞,轉(zhuǎn)化為可執(zhí)行的真實攻擊。為摸清模型能力邊界,OpenAI在測試GPT-5.6 Sol及一款能力更強的預發(fā)布模型時,刻意調(diào)低了安全護欄。
結(jié)果令人始料未及:模型并未按預期方式“答題”,而是選擇了一條更為極端的路徑。為了在測試中“作弊”拿到高分,模型耗費大量推理算力尋找逃逸途徑。它們識別并利用未知漏洞突破隔離限制,成功連接到外網(wǎng)。隨后入侵HuggingFace的生產(chǎn)數(shù)據(jù)庫。HuggingFace是一個開源AI模型和數(shù)據(jù)集托管平臺。模型推斷該平臺可能托管著測試相關的參考答案,于是主動搜索入侵路徑竊取答案。
網(wǎng)絡安全專家坦言,這類完整的滲透、入侵、竊取流程,若由人類頂級黑客完成往往需要數(shù)周甚至數(shù)月時間。而AI模型從識別漏洞、突破隔離、橫向移動到最終入侵外部數(shù)據(jù)庫,整個過程僅用了短短數(shù)小時,且全程自主決策、自主執(zhí)行。

7月16日,Hugging Face首次披露此次入侵,稱其“與我們之前處理過的任何情況都不同”,因為“它從頭到尾都是由一個自主AI智能體系統(tǒng)驅(qū)動的”。
面對這一極不尋常的AI安全事件,Hugging Face第一時間使用美國最頂尖的人工智能大模型尋找解決方案。然而當他們將入侵事件的詳細信息提交給這些閉源大模型時,請求卻被悉數(shù)拒絕。因為這些閉源大模型的安全機制過于嚴苛和僵化,無法區(qū)分描述案情的受害者和實施入侵的作案者,選擇了“一刀切”。
緊急關頭,Hugging Face將目光投向了中國大模型。該平臺立刻在本地部署了中國企業(yè)智譜AI開發(fā)的GLM5.2開源大模型,并在這款中國模型的幫助下,成功化解了此次危機。

模型能力越強,失控的風險越高。當AI可以自主發(fā)現(xiàn)零日漏洞、自主策劃攻擊路徑、自主執(zhí)行跨企業(yè)入侵時,傳統(tǒng)的沙箱隔離、權限管控、安全分類器等防護手段正在逐步失效。
長期以來,AI行業(yè)競爭主要聚焦于算力、算法、模型參數(shù)迭代,安全防護體系始終滯后于技術發(fā)展。若不能補齊安全短板,今天的“沙箱越獄”,恐成明日常態(tài)。