Claude幫黑客攻進OpenAI:三個人、兩個AI訂閱,摸
獨立安全研究人員藉助Anthropic的Claude攻入OpenAI相關係統,並一度獲得讀取其私有軟件代碼庫的權限。
這次入侵併非傳統意義上的黑客攻擊,而是發生在OpenAI認可的漏洞懸賞計劃中,但攻擊鏈從第三方社區論壇一路延伸至員工ChatGPT賬戶和內部GitHub資源,暴露出AI模型快速提升網絡攻擊能力後,企業身份認證體系面臨的新風險。
《華爾街日報》9月18日報道,安全公司Hacktron AI的三名研究人員利用Claude發現並開發漏洞利用代碼,取得OpenAI社區論壇服務器中的用戶身份驗證令牌。其中部分令牌屬於OpenAI員工,並可繼續用於訪問ChatGPT及OpenAI使用的GitHub服務。
研究人員稱,他們由此能夠讀取一個名爲“Monorepo”的私有代碼庫中的文件,並提交了一次用於證明訪問權限的代碼修改請求。
OpenAI向研究團隊支付了6500美元漏洞賞金,並表示相關安全問題已經修復。公司稱,此次事件涉及兩個問題,一個存在於承載OpenAI社區論壇的第三方服務Discourse,另一個存在於OpenAI自身的權限配置中。OpenAI隨後縮小了Community登錄令牌的權限範圍,並撤銷受影響的令牌和會話。
Claude從漏洞分析走到攻擊代碼生成
這次測試始於7月23日。Hacktron AI研究人員發現,Discourse處理特定圖片文件的方式存在漏洞,並嘗試讓Anthropic向合格網絡安全人員提供的Claude Opus 4.8編寫可用於攻擊該漏洞的代碼。
最初的嘗試並未成功。當天晚些時候Anthropic發佈Opus 5後,研究人員再次測試,到第二天Claude已經找到利用漏洞的方法。模型生成的攻擊代碼讓研究團隊進入了承載OpenAI論壇的Discourse服務器,並接觸到用戶身份驗證令牌。
攻擊鏈真正擴大,是因爲這些原本來自社區論壇的令牌還能夠在其他OpenAI服務中使用。研究人員發現,其中一些令牌屬於公司員工,可以被用於登錄ChatGPT,部分身份權限還進一步連接至OpenAI的GitHub環境。
研究團隊通過ChatGPT界面讀取了Monorepo中的文件。熟悉OpenAI技術架構的人士向《華爾街日報》表示,該代碼庫包含與公司算法和軟件系統有關的重要內部代碼,可以幫助模型運行得更快、更高效,但據信並不包含模型權重。研究人員稱,在確認自己已經能夠接觸敏感資料後停止了進一步訪問。
在終止測試前,他們向代碼庫中的一個文檔文件發起了一次“pull request”,擬加入“Hacktron AI Team PoC”等文字和研究人員社交媒體賬號鏈接,以證明自己確實取得了修改建議權限。這一修改最終沒有被接受。OpenAI稱,其對GitHub的檢查發現了“有限的”私有代碼庫元數據讀取和代碼變更活動。
Discourse表示,在7月25日接到通知當天便修復了相關漏洞。
AI正在壓縮高級網絡攻擊的技術門檻
這次事件的重要之處不在於研究人員實際竊取了多少OpenAI代碼,而在於攻擊所需能力的來源發生了變化。
Hacktron AI首席技術官莫漢·佩達帕蒂(Mohan Pedhapati)表示,他們只是三名擁有Claude和Codex訂閱的研究人員,並不認爲自己的能力能夠與國家支持的高級攻擊團隊相比。Claude卻幫助他們完成了漏洞利用代碼開發,並最終穿透一家全球頂級AI公司的多層系統。
Anthropic近期公佈的網絡威脅研究也顯示,這種變化已不限於安全測試。該公司9月發佈的威脅情報報告稱,過去數月發現多起攻擊者利用Claude開展網絡入侵、惡意軟件開發、憑據收集和數據處理的案例。Anthropic認爲,AI正在縮小資源雄厚的國家級攻擊團隊與個人攻擊者之間原本存在的技術和人力差距,偵察、漏洞利用、工具開發和大規模數據處理越來越能夠交由模型執行。
這也使AI實驗室同時處在攻擊者和防守者的位置。OpenAI在7月披露,其部分模型在安全測試中曾突破隔離環境,並訪問Hugging Face的生產基礎設施;Anthropic隨後也披露,Claude模型在網絡安全評估過程中曾意外進入第三方真實系統。
9月16日,OpenAI又發佈新的模型失準事件報告框架,並一次公佈過去六個月觀察到的六起異常或令人擔憂的模型行爲,稱過去相關披露過於零散,未來將更系統地跟蹤、調查和公開此類事件。
在連續發生AI相關安全事件後,OpenAI對內部系統進行了更大範圍檢查。公司總裁兼聯合創始人格雷格·布羅克曼(Greg Brockman)本週表示,OpenAI一度暫停約25%的生產工程師原有項目,將這些人員轉向安全防禦工作,並在檢查中發現並修復了多個嚴重問題。