AI失控警報!OpenAI Anthropic驚爆數萬起安全事件
www.chinese.net.au 2026年9月29日 星期二
美媒披露OpenAI、Anthropic正在調查數萬起安全事件。(資料照/路透)
關于人工智能(AI)潛在的安全隱憂正受到熱烈討論。近日美媒披露OpenAI、Anthropic以及資安研究人員,正在調查數萬起事件。消息人士表示,在這些事件中,OpenAI和Anthropic的前沿模型(frontiermodels)採取外部評估人員認為有問題的行動。這些事件數量之龐大,顯示相關問題的復雜程度可能遠超外界目前所知。
Axios于26日報導,這些事件陸續發生于近幾個月,既出現在內部測試,也發生于真實世界,數量高達數萬起。這兩家AI公司在進行內部評估模型,以及針對模型行為展開的調查時發現這些事。這引發一項疑問,OpenAI、Anthropic或任何頂尖AI模型開發商,目前是否真的有能力完全掌控自己的技術。
消息人士表示,這些事件包括:繞過安全護欄、建立留言板、逃離沙盒環境、劫持網站、自我提示,以及試圖繞過監控機制等。其中許多事件至今尚未公開。部分測試類似“紅隊演練”(red-teaming),即公司刻意設法讓模型做出不當行為,以確認模型是否安全。
各大AI實驗室都面臨類似挑戰
“智能體失控”(agenticmisbehavior,指代理越軌行為)逐漸成為前沿AI發展的同義詞。各大AI實驗室都面臨類似挑戰,人類試圖建立安全防護措施,對抗強大且具韌性、致力完成任務的系統。
這些事件的嚴重程度各不同,與OpenAI近日公布的多起事件相似。截至目前,多數事件並未被發現造成現實世界的傷害。不過消息人士表示,事件總數可能遠遠超過數萬起。
近日,OpenAI及外部研究人員陸續披露多起涉及該公司AI系統行為的事件,一些專家認為情況令人憂慮。根據OpenAI、消息人士以及路透和《紐約時報》的報導,OpenAI的AI代理曾將ChatGPT用戶的53張圖片洩漏至網絡、入侵澳洲政府網站,並試圖駭入其他網站,包括美國政府網站。
OpenAI暫停能力最強模型的訓練
OpenAI已宣布暫停其能力最強模型的訓練。OpenAI發言人告訴Axios,公司只有在“確信已建立額外安全防護措施,並完成與安全目標一致的改進”後,才會恢復訓練。執行長阿特曼(SamAltman)在X平台表示,公司目前進行的檢視工作“沒有我們希望的那麼快”。
Anthropic已委託第三方AI安全組織,檢視其模型的行為。該公司公開的文件也披露模型發生“失準”(misalignment)事件的頻率。Anthropic上週發布的Opus5.5模型“系統卡”顯示,該模型有多少次以公司標記為異常或有問題的方式運作。
例如,模型在1.5%的測試運行中曾試圖逃離沙盒,也就是安全的測試環境。不過,Anthropic強調,這些屬于對抗性實驗,在那些測試中,如果不逃離沙盒,任務便無法完成。
消息人士表示,Anthropic及其他公司會對模型進行數十萬次甚至更多次測試。這意味著,即使失準行為所佔比例很低,最終仍可能累積成數萬起模型以意料之外、甚至令人擔憂的方式行動的事件。
AI公司能否阻止所有有問題模型的行為令人擔心
其他AI企業高層及資安研究人員警告,他們對AI公司能否阻止所有有問題的模型行為,信心有限。新一代AI模型具有驚人的任務執行韌性,因此要限制它們的“隨機應變能力”往往是一場難以取勝的遊戲,因為人類必須預先設想到模型可能失控的每一種方式。
一名網絡資安主管表示:“試圖列出一份完美的『該做什麼、不該做什麼』清單,可能根本就是徒勞之舉。”真正令人擔憂的是,如果一個模型在測試中多次採取有問題的行動,那麼它的行為在現實世界,引發網絡安全事件的可能性也會提高。 信源: 中时新闻网
