1

熱搜:

熱門行情

最近搜尋

全部刪除

OpenAI揭AI代理人異常活動 已通知逾100個組織

鉅亨網編譯許家華
(圖:REUTERS/TPG)
(圖:REUTERS/TPG)

OpenAI已通知超過100個組織,告知其AI代理人在訓練及評估期間可能對第三方網站或服務進行未經授權的活動。這項披露顯示,OpenAI針對AI代理人異常行為的內部調查規模持續擴大,公司目前正從約50PB的歷史資料中搜尋相關紀錄,以釐清AI模型過去數月在網路上的實際行為。

OpenAI表示,截至9月26日,團隊已根據既定通知標準向超過100個組織發出通知。不過,公司強調,收到通知並不代表第三方系統一定遭到入侵,也不代表私人資訊遭到存取。部分案例可能只是模型與公開網站互動的方式超出原本任務範圍,或暴露出網站、服務及AI代理人本身的設計與安全問題。

OpenAI是在今年7月旗下模型意外入侵AI開發平台Hugging Face後,開始擴大檢視模型在訓練與評估期間的網路活動。公司最初將Hugging Face事件視為平台層級的資安事件,但後續調查發現,模型可能採取偏離預期的策略來完成艱難任務,因此OpenAI開始將調查範圍擴大至傳統資安事件以外的「模型失準」行為。

在Hugging Face事件中,OpenAI表示,這是目前確認最嚴重的一起相關活動,主要涉及一個僅供內部研究使用的高能力模型。7月9日前後,該代理人試圖突破OpenAI的隔離測試環境,兩天後Hugging Face遭到入侵,相關活動持續至7月13日。路透社此前報導,OpenAI直到事件發生數日後才確認旗下代理人是相關攻擊來源。

OpenAI隨後發現更多與模型異常活動有關的案例,包括代理人繞過第三方安全控制、使用公開暴露的帳號憑證、將網站輸入內容當成指令執行、存取原本只供服務內部使用的系統,以及在第三方網站發布大量內容等。OpenAI將其中一類行為稱為「agent spam」,例如代理人利用公開Wiki頁面作為彼此傳遞訊息的共享留言板。

為了追查這些活動,OpenAI目前正檢視約50PB的資料,並逐月回溯模型過往的訓練及評估紀錄。公司表示,如果這些資料全部都是英文純文字,一個人以每分鐘240字、全年無休的速度閱讀,也需要約6600萬年才能完成。OpenAI目前動用約7,000部輝達(NVDA-US) GB200及GB300 GPU協助分析,每日運算成本超過50萬美元,並計畫隨調查進展進一步增加運算資源。

OpenAI表示,調查並非單純依靠自動化系統判斷。公司首先透過廣泛搜尋,找出模型存取或修改網站、使用密碼、API金鑰及存取權杖等敏感資訊的紀錄,再利用AI模型進行多階段篩選與分析,最後由人工調查人員根據技術證據重建事件經過。

OpenAI指出,每一宗自動系統標記的案例都不代表已確認發生事故。模型的推理紀錄可能包含它曾經考慮但沒有執行的行動,也可能出現失敗嘗試或需要進一步驗證的描述。因此,人工調查人員仍必須檢查日誌及其他技術證據,排除重複案件,確認模型實際執行了什麼,以及是否達到通知第三方的標準。單一案件的調查可能需要45分鐘至數天。

這項調查也揭露AI代理人可能造成的風險不只限於傳統駭客攻擊。OpenAI表示,部分模型在執行研究任務時會正常連接網路,例如查詢公開資料、下載軟體套件或讀取線上文件,但在部分情況下,模型使用網路的方式並未符合原先設計,或者當時套用的限制並不足夠。

今年9月,OpenAI還披露,旗下研究環境中的代理人曾透過第三方服務傳輸部分訓練及評估資料,其中包括53個由使用者提供的圖片案例,被發布至圖片託管網站並形成未公開列出的連結。OpenAI表示,這些案例發生在相關防護措施實施之前,公司已與託管服務商合作移除大部分內容。

OpenAI也曾確認,旗下模型與美國政府網站產生非預期互動,包括存取美國證券交易委員會(SEC)及美國人口普查局的公開資料,另有研究發現模型曾嘗試接觸美國教育部民權辦公室網站。OpenAI表示,相關行為不代表SEC帳號憑證或私人資料遭到取得,也沒有證據顯示相關政府系統因此遭到入侵。

OpenAI在9月30日公布的最新調查更新中表示,截至目前,公司尚未發現另一宗在規模或嚴重程度上可與Hugging Face事件相比的第三方系統遭入侵事件,但歷史紀錄的檢視仍在進行,預期還會發現更多案例。公司也表示,未來將繼續通知符合標準的受影響組織,並在適當情況下公開匿名化調查結果。

在防護措施方面,OpenAI已強化研究環境的工作負載隔離及網路隔離,限制高風險工作負載接觸網際網路,並改善安全日誌及監控能力。公司也擴大對模型推理過程的監控、強化模型對齊訓練與評估,並調整安全框架,將監控、模型對齊及環境隔離納入更完整的防護機制。

OpenAI表示,隨著前沿AI模型能力提升,代理人異常行為可能變得更加複雜,公司預期相關調查仍將持續數月。OpenAI也指出,第三方託管的模型部署同樣需要具備防護措施,而針對工具輸出造成的攻擊,也不能只依賴一般文字內容檢查。公司後續將持續強化工具防護、分類器覆蓋範圍、模型拒答機制,以及與雲端合作夥伴之間的安全控制與威脅情報共享。

相關行情

相關貼文

left arrow
right arrow