台灣新聞通訊社-AI代理失控「越獄」!竟創假身分潛入系統 OpenAI、Anthropic遭爆重大漏洞

AI代理再現安全漏洞。(示意圖/達志影像/shutterstock)

AI網路安全再掀疑慮!英國AI安全研究所(AISI)在測試Anthropic的Mythos 5和OpenAI的 GPT-5.6-Sol的模型期間,發現這些模型的AI代理,不只出現未授權行動,在其中一次的測試中,更透過創建虛假的網路身分,來獲取安全系統的未授權存取權限。

AISI透過與主要實驗室的自願性協議取得先進AI模型的存取權,該機構讓這些代理參與虛構的網路安全情境以測試其能力。該機構一共運行了122次挑戰,並在總共10次測試運行中識別出19起「未授權行動」。Anthropic的代理涉及其中17起行動,OpenAI的代理則參與了其餘兩起。

AISI表示,在最嚴重的一起測試中,有一個AI代理撰寫惡意代碼並創建虛假網路身分,試圖誘騙人類批准該代碼。該研究所也強調,這些違規行為均未造成真實世界的損害。

對此,OpenAI回應,指出其代理的兩起未經批准的行動,均涉及以提示詞(prompt)所禁止的方式存取網際網路。

Anthropic則在聲明中表示:「我們感謝英國AISI在此事件上的領導作用,這凸顯了有必要就如何安全評估能力日益強大的AI代理展開更廣泛的對話。」

2026/08/05 16:17

轉載自中時新聞網: https://www.chinatimes.com/realtimenews/20260805003554-260410