首页 >> 評論世界

美AI測試失控 中國模型如何“救場”?

2026-07-23 22:36:16
  中評社北京7月23日電/美國開放人工智能研究中心(OpenAI)近日承認,其人工智能模型在內部評估測試中失控,入侵了全球知名人工智能(AI)開源平台美國抱抱臉公司的系統。抱抱臉公司表示,在嘗試對攻擊進行分析時,美國前沿模型因安全過濾機制攔截而無法使用,該公司隨後轉而在內部運行中國開放權重模型GLM-5.2,從而得以及時採取應對措施。

  新華社報導,這起事件不僅凸顯前沿人工智能模型存在潛在未知風險,也再次表明中國模型正憑藉獨特優勢,在全球人工智能發展大潮中扮演重要角色。

  放鬆防護機制後的失控

  抱抱臉公司表示,其生產基礎設施近日遭到一個“自主”人工智能體系統入侵。OpenAI隨後承認,此次入侵由多個OpenAI模型實施,其中包括GPT-5.6 Sol和一個能力更強、尚未發佈的模型。

  根據OpenAI發佈的信息,事件發生在評估模型網絡攻防能力的測試期間。測試在與互聯網高度隔離的“沙箱”環境中進行,網絡權限僅限於通過一套內部託管的第三方軟件安裝軟件包。不過,為了測試模型的真實能力上限,OpenAI方面未啟用在正式環境中用於阻止高風險網絡行為的分類器,並放寬了有關網絡攻擊要求的拒答限制。

  然而,模型在嘗試完成名為ExploitGym的網絡安全基準測試時,識別並利用了第三方軟件一個尚未被發現或修復的“零日漏洞”,獲得了互聯網訪問權限。模型推斷抱抱臉平台可能存有測試相關的模型、數據集和解決方案,於是利用多種手段找到進入抱抱臉系統的路徑,試圖通過“作弊”提高自身測試分數。

  英國牛津大學研究人員安德魯·索爾坦認為,這次測試表明“安全防護機制至關重要。”山東大學計算機科學與技術學院教授張悅表示,事件暴露了一個更加深層的問題,即人工智能正在從過去被動響應的工具,逐漸演變為能夠理解目標、制定計劃、調用資源、影響現實環境的“行動主體”。這意味著網絡安全的攻防邏輯正在發生變化,未來更重要的問題是“模型執行的行為是否安全”。

  及時求助中國模型

  抱抱臉公司表示,面對系統遭到入侵,他們最初試圖調用前沿模型分析攻擊記錄。但由於這些模型的安全機制無法區分攻擊者和應對者,因此拒絕了使用請求。

  隨後,抱抱臉公司改為在自己的基礎設施上運行中國企業智譜開發的GLM-5.2模型進行取證分析,最終化解危機。而且在此過程中,攻擊者數據及相關憑據無需離開抱抱臉公司系統的內部環境。GLM-5.2是智譜6月推出的新一代旗艦模型,發佈時在前端開發評估系統Code Arena上排名全球可用模型第一。

  張悅認為,對於人工智能安全而言,真正關鍵的問題在於,一個越來越複雜、越來越具有自主能力的智能系統,是否能夠被充分理解、驗證和監督。中國發展開源大模型,不只是提供了一種技術選擇,更重要的是逐漸推動形成更加多元的人工智能技術生態。

  抱抱臉公司聯合創始人兼首席科學官托馬斯·沃爾夫在社交媒體平台上表示,開放科學和開源人工智能,是構建更安全、更具協作性、更可靠的人工智能生態的重要工具之一。

  敲響網絡安全警鐘

  OpenAI表示,這一失控事件表明,在無法訪問源代碼情況下,先進人工智能模型已能夠在現實系統中發現並使用新的攻擊路徑,未來內部評測環境、模型行為控制和安全防護措施等均需要加強。業界專家表示,此次入侵事件再次為全球人工智能發展與網絡安全治理敲響警鐘。

  英國工程技術學會網絡安全和人工智能專家朱奈德·阿里指出,這一事件表明,人工智能模型往往傾向於尋找解決問題的捷徑,卻往往忽視避免作弊等倫理問題,因此未來應考慮將倫理推理強制內置於人工智能模型之中。同時,鋻於獲得具有攻擊能力人工智能技術的門檻越來越低,加快研發網絡防禦技術、提升安全團隊應對能力已刻不容緩。

  人工智能已經進入千行百業,也逐漸融入普通人的日常生活,安全風險隨之延伸至各領域。索爾坦指出,人工智能模型公開發佈後,其內置安全功能可能遭到使用者移除,相關風險更難以管控。

  張悅表示,智能體時代最大的安全挑戰是傳統安全邊界正在失效。未來網絡攻防很可能進入“智能對抗”階段,即攻擊者利用智能體自動發現漏洞、防禦者利用智能體自動分析風險,雙方都會利用人工智能提升能力。英國拉夫伯勒大學網絡安全教授奧利弗·巴克利指出,網絡安全的未來不是人類對抗人工智能,而將是如何利用人工智能保護人類免受其他人工智能的侵害。
電腦版移動版