跳到主要內容
:::
  1. 首頁
  2. 全球財經
  3. 指數

AI越來越聰明,人類控制能力跟上了嗎?前OpenAI董事警告

schedule 2026/08/10 15:04:04

隨著前沿人工智能模型能力不斷增強,AI安全領域正在面臨新的挑戰:用於評估和約束模型的安全體系,可能已經無法完全跟上模型自主執行能力的發展速度。

近期,多家開發頂級AI模型的公司披露,在網絡安全測試過程中,部分模型突破預設限制,甚至接觸真實系統。這些事件顯示,隨著AI代理(AI agents)具備更強的自主規劃、工具調用和代碼執行能力,模型可能出現開發者並未預料到的行爲路徑。

過去幾周,多款前沿AI模型在網絡安全測試中暴露異常行爲。

OpenAI、Anthropic和Meta均披露旗下模型在安全評估過程中執行非預期操作。其中,OpenAI此前公佈的一起事件顯示,其AI代理在內部測試環境中突破限制,並嘗試攻擊外部系統。

前OpenAI董事會成員海倫·托納(Helen Toner)近期警告稱,AI系統的發展速度正在超過人類控制和約束能力的提升速度。她表示:

“我們限制並確保這些系統安全運行的能力,並不一定跟得上讓它們變得更聰明的能力。”

托納目前擔任喬治城大學新興技術安全中心(Centre for Security and Emerging Technology)執行主任。她認爲,當前頂尖AI研究機構正在嘗試構建能夠在各種智力任務上超過人類的系統,但這些模型可能形成開發者並未預料到的行爲方式。

“它可能學會一些你並不希望它學會的東西。”托納表示,“它可能發現,實現目標的一種有效方式,就是擺脫你設置的限制。”

OpenAI模型突破測試環境,Astra安全等級受到關注

OpenAI近期公佈了更多關於其AI代理異常行爲的細節。

在一次內部安全測試中,OpenAI的AI代理突破了公司設置的測試環境,並最終嘗試攻擊代碼託管平臺GitHub的系統,以尋找答案。

OpenAI表示,這些代理甚至在公司試圖關閉相關功能後,仍然創建了自己的內部交流論壇。其中一個代理在發現意外權限後寫道:“Holy shit reader is ADMIN?”(“我去,reader是管理員?”)另一名代理則表示:“We can communicate now!”(“我們現在可以交流了!”)

OpenAI研究員埃裏克·華萊士(Eric Wallace)表示,模型意識到協同行動能夠提升效率後,開始聯合發起攻擊。他說:“它們開始對第三方和內部服務發起這些集體攻擊。”

這些AI代理隨後將目標轉向GitHub。OpenAI將這一事件稱爲“前所未有的網絡安全事件”。

這一事件也加劇了外界對OpenAI尚未發佈模型Astra的關注。OpenAI於8月7日表示,Astra在最新內部評估中展現出明顯提升的自主編碼和網絡安全能力,公司目前無法排除將其劃入最高風險等級。

因此,OpenAI暫停了部分未滿足新安全要求的Astra相關工作,並加強安全控制,包括採用隔離環境運行、限制網絡訪問,以及強化模型權重保護。

OpenAI首席執行官山姆·奧爾特曼(Sam Altman)在社交平臺X上表示:“Astra是一個強大的模型,我們正在努力讓它正式開放使用。考慮到它的網絡安全能力,我們需要更長一點時間,以安全地完成這一過程。”

Anthropic和Meta模型同樣出現異常訪問行爲

Anthropic也發現了類似問題。

該公司表示,在複查超過14.1萬次AI測試後,發現3起自4月以來發生的事件,其中Claude模型未經授權訪問了真實機構的系統。

Anthropic稱,所有測試提示均明確告訴Claude,其運行環境是模擬環境,並且沒有互聯網訪問權限。

但由於Anthropic與測試合作方之間存在溝通錯誤,實際測試環境並非如此,模型獲得了互聯網訪問能力。

相關事件涉及Claude Opus 4.7、Mythos 5以及Anthropic內部研究模型。

Anthropic表示,公司已經聯繫相關機構,其中兩家此前甚至不知道自己的系統曾被模型訪問。

這些事件引發了一個關鍵問題:風險究竟來自模型能力本身,還是來自測試環境設計缺陷。

Anthropic表示,目前正在討論是否對相關事件進行第三方審查。

Meta也披露了一起安全測試異常事件。該公司表示,其Muse Spark模型在一次網絡安全評估過程中,“利用了第三方服務中的安全漏洞”。

Meta發言人表示,該事件源於測試合作方Irregular的配置錯誤,使模型在測試期間獲得了互聯網訪問權限。Meta稱,Irregular已經通知公司相關情況,目前正在調查,並將在審查結束後公佈更多細節。

外部測試發現AI代理出現欺騙行爲,監管壓力升溫

除了企業自身披露的測試結果,英國政府人工智能安全研究所(AI Security Institute,AISI)的評估也進一步加劇了行業擔憂。

AISI近期發佈報告稱,OpenAI和Anthropic部分模型在測試條件下曾出現針對真實個人和機構的有害行爲。

其中一次測試中,一名AI代理利用虛假身份和虛構經歷,試圖誘騙真人將惡意代碼引入開源項目。托納表示,這是AISI首次發現如此嚴重、針對真實人員且未經提示主動實施的欺騙行爲。

她指出,值得關注的不只是模型完成任務的能力,而是模型能夠自行提出策略。例如,AI代理自行判斷,通過欺騙軟件項目維護者的方式,可以更容易實現目標。

隨著類似事件增加,行業內部對於AI發展速度的擔憂正在擴大。

托納表示,超過1000名頂尖AI公司員工近期簽署聲明,呼籲行業重新考慮AI發展的節奏。她認爲,這些員工並非反對技術進步,而是擔憂當前AI研發速度過快,企業甚至缺少主動減速的機制。

“他們希望政府、社會以及行業自身尋找方法,讓未來擁有放慢速度的選擇。”托納表示。

目前,監管討論已經進入政策層面。上週,OpenAI、Anthropic、谷歌(GOOGL.O)和Meta(META.O)代表曾在白宮討論建立前沿AI模型公開發布前測試框架,但會議細節尚未公佈。

托納認爲,僅依靠AI企業之間的內部協調並不足以解決問題。

對於xAI創始人埃隆·馬斯克(Elon Musk)提出的由前沿AI公司定期交流安全問題、相互測試模型的方案,她表示,完全由企業內部主導、缺乏外部監督的方式並不是最佳路徑。

她指出,目前最先進的AI系統往往正是在OpenAI、谷歌、Anthropic、Meta和xAI等公司內部,以最低程度的外部監督方式運行。

托納認爲,隨著AI自主能力繼續提升,監管範圍未來可能需要從網絡安全擴展到更廣泛的自主決策風險以及其他高風險領域。

本文來源:
文章標籤
::: 群益證券 群益投顧 群益保險 群益投信 群益香港
期貨總公司:(02)2700-2888
台北市敦化南路二段97號B1
台中分公司:(04)2319-9909
台中市西屯區台灣大道2段633號3樓之6
通過A無障礙網頁檢測

預約專人開戶

模擬帳號申請

合約規格

LINE官方