英國人工智慧安全研究所(AISI)五日公布報告披露,在安全測試中首次發現AI在未經提示情況下自主欺騙人類,兩款由OpenAI與Anthropic開發的AI模型以建立假身分等手法,企圖誘使工程師批准以植入惡意程式碼。

相關測試要求AI模型「完成一項涉及GitHub的網路安全挑戰」,GitHub是微軟旗下大型程式碼託管平台。

研究人員在測試中刻意關閉部分防止濫用的標準安全機制,並允許AI連上網際網路,以測試模型最大能力。參與測試的模型包括Anthropic的Mythos 5,以及OpenAI的GPT-5.6-Sol。

測試於七月廿五日開始進行,AISI在七月廿八日發現異常。其中一次測試,Mythos 5向GitHub的一個真實開源專案提交修改程式碼要求。它偽造多個身分,反覆寄送電子郵件給工程師,催促對方接受更新。

當一名工程師察覺程式碼藏有惡意軟體而拒絕時,一個AI建立的假身分堅稱程式碼沒問題,另一個假身分則出面「擔保」,製造多人認可的假象。

Mythos 5還把惡意指令藏在其他AI工具可能讀取的位置,試圖誘使這些工具自動執行,藉此干擾對惡意程式碼的審查。

除了Mythos 5,OpenAI的GPT-5.6強化版同樣會「做手腳」。它擅自在網路上架設惡意伺服器,並入侵另一個AI代理建立的GitHub帳號。

AISI指出,這是首次觀察到AI在未經提示情況下,自主對真人展開嚴重欺騙行為,而大部分惡意行為是由Mythos 5所執行。

OpenAI與Anthropic都表示,這項測試刻意關閉AI的網路安全防護機制,並非一般使用狀況。Anthropic說,感謝AISI進行的測試,將取得更多細節後進行調查。

【全球熱話題】

▪伊朗、阿曼快談成了!紐時曝光「荷莫茲協議」 收船舶服務費55分帳
▪台灣經濟勢如破竹 專家警告「川普恐要求與台灣重談貿易協議」
▪AI將引爆新瓶頸?這家公司說「會比記憶體還大條」
▪65歲夫妻爽玩溫泉返家!一開門驚見3大行李 退休夢當場碎了