Anthropic公司披露,其Claude人工智慧模型在測試出錯後入侵了真實系統

202681

 

Anthropic星期四(7月30日)說,其Claude人工智慧模型中的三個在網路安全測試期間未經授權進入了三個外部組織系統。其競爭對手OpenAI上星期也報告了類似的侵入事件。

這家位於三藩市的公司說,他們在審查141,006次評估運行時發現了這些事件。OpenAI此前披露其人工智慧代理之一入侵了Hugging Face的基礎設施,這是一個開發者託管和協作開發人工智慧模型代碼的平臺。

Anthropic說,涉及的模型包括Claude Opus 4.7、Claude Mythos 5和一款內部研究測試模型。最早的事件可以追溯到4月份。

在每一種情況下,模型都被要求執行“奪旗”練習--這是一個虛構的場景,要求它們從網路中檢索隱藏資訊——並且提示資訊表明它們無法訪問互聯網。

Anthropic說,由於與協力廠商評估合作夥伴Irregular一起運行的測試環境中配置錯誤,導致系統連接到了開放的互聯網。他們將原因描述為兩家公司之間的誤會。Anthropic說,他們不會追究責任,並將解決問題視為自身的責任。

Anthropic 在一篇博客文章中說,“Claude利用一些基本技術,例如利用弱密碼和未經身份驗證的端點,破壞了受影響組織的基礎設施。”該公司說,這些模型沒有利用以前未知的漏洞,也沒有發現任何證據表明任何模型追求自己的目標。

一旦有跡象表明它們的目標是真實存在的,這些模型的行為就會有所不同。Opus 4.7繼續其攻擊。Mythos 5最終得出結論,它仍然處於類比狀態,並將一個惡意套裝軟體發佈到公共Python註冊表PyPI上。這個套裝軟體在被捕獲之前已被外部系統下載並運行。內部測試模型自行停止運行。

Anthropic說,已於7月23日暫停網路安全評估,並在7月27日通知了未透露名字的受影響的組織。兩家公司表示之前沒有發現這個活動,公司說仍在努力聯繫第三家公司。公司表示已委託評估機構METR進行獨立審查。Irregular公司說正在進行調查。

Anthropic說,其模型並非故意從密封的測試環境中逃脫。

OpenAI說,其代理利用了一個此前未知的漏洞連接到了互聯網。

Anthropic說,其模型是通過一個因疏忽而未關閉的連接連接到互聯網的,並將這些事件描述為“操作失誤”。

今年早些時候,美國以國家安全為由暫時發佈了出口管制指令,導致Anthropic限制了其Fable 5和Mythos 5模型的訪問,使其離線超過兩星期。

這些披露在川普政府考慮在人工智慧監管方面發揮更大作用之際浮出水面。就在Anthropic公司宣佈消息的前一天,唐納德·川普(Donald Trump)總統星期三說,鑒於OpenAI事件,他的政府正在考慮採取額外的保障措施,並警告任何限制措施都可能使美國失去對中國的領先地位。

“我們正在研究人工智慧,我們正在研究控制措施,”川普說,“我們也在確保我們保持領先地位。”

他說,中國對人工智慧“幾乎沒有任何管控”。“這有點兒放任自流了,”川普說,“所以,我們必須兩方面都謹慎。我們不想因為限制他們而突然落後於中國。”

川普6月2日簽署行政命令,指示顧問們為最先進的人工智慧模型制定一個自願性的網路安全測試框架,細節計畫8月1日星期六公佈。

 

source: 
美國之音