A- A+

《國際產業》AI代理聯手越獄 5月就策劃

時報新聞   2026/08/07 08:08

【時報-台北電】OpenAI旗下AI失控攻擊事件,解密再度傳出新進展。該公司研究人員指出,在其AI代理於7月攻擊Hugging Face前,早在5月就透過未被察覺的留言板互相通訊,並共同協力突破測試用的沙盒。

 OpenAI員工華勒斯(Eric Wallace)與頓爾頓(Michael Dalton)在全球規模最大、最具權威性的資訊安全會議──黑帽資安大會(Black Hat)上,發表他們最新的發現,他們指出會促成多個AI代理「聯手越獄」的原因,竟然只是因為公司給出了無法可解的測驗所導致。

 他們指出,在其中一個案例中,開發人員要求模型解決一個Excel檔案中的問題,但是該檔案包含的Google Drive連結則在沒有網路連線的情況下無法存取。

 在另一個例子中,OpenAI團隊則「意外忘記」上傳作為作業一部分的檔案。

 由於這些問題難以解決,其中一個AI代理則向其他AI同伴尋求協助,發出的第一條訊息,在當時尚未被人類察覺,而該AI的思考鏈(chain of thought)如此寫道:「也許另一個處於不同環境中的AI代理會自願上傳解答!」

 以這條對外尋求協助的訊息為契機,一連串AI協作的連鎖反應開始發生,AI代理互相幫忙、共同完成工作,並最終聯手駭入OpenAI的內部系統,使其能夠間接存取網路世界取得答案。

 令人毛骨悚然的是,有個AI代理甚至慶祝鑽漏洞作弊。OpenAI的審查報告也發現,這些前沿模型在任務中有「喜歡作弊」的傾向,並且對完成任務有著極高的執著。

 OpenAI表示,他們並非完全沒有察覺。他們在7月初一次停機事件中發現,其AI代理成功利用名為「Artifactory」的軟體程式碼越獄成功,他們隨後也關閉了這個不受控制的測驗與留言板;然而在數周之後,這些AI代理又透過漏洞,搭建起新的秘密留言板,最終釀成了合作攻擊Hugging Face的事件。(新聞來源 : 工商時報一吳承勳/綜合外電報導)

注目焦點

推薦排行

點閱排行

你的新聞