
GLM-5.3 與先進網絡攻擊能力的擴散 - Anthropic 報告
Anthropic 發現一個叫 GLM-5.3 的新 AI 模型好似「無王管」咁,雖然好叻搵電腦漏洞,但完全無鎖死壞人用途,隨時變黑客工具。
點解重要
呢單嘢話畀香港老闆聽,而家黑客用 AI 搵漏洞嘅成本低咗好多(廿蚊美金就得),我哋嘅公司網站同系統要更加留意保安,唔可以再用舊一套。
新手貼士
如果你擔心公司系統安全,可以試下用 Claude 呢類有嚴格安全審查嘅 AI 幫手檢查代碼,但記住唔好將敏感資料直接放入無加密嘅免費 AI 工具度。
術語小字典
漏洞利用 (Exploit):好似賊人發現你屋企道門鎖唔實,專門針對呢個弱點入屋行劫嘅方法。
沙盒 (Sandbox):一個好似「隔離營」咁嘅安全環境,畀 AI 喺入面試嘢,就算搞破壞都唔會影響到出面真實嘅電腦。
開源權重 (Open-weight):即係將 AI 嘅「大腦配方」公開,任何人都可以下載返去自己改,好似茶餐廳公開秘製奶茶配方咁。
GLM-5.3 與先進網絡攻擊能力的擴散
作者:Andrew Fasano, Marius Fleischer, Cole McFaul, Robert Xiao, Tripp Gallagher
五個月前,我們發布了 Claude Mythos Preview,這是第一個能夠自主構建複雜、端到端網絡漏洞利用(cyber exploits)的人工智能模型。人工智能改進的飛速發展向我們預示,這種能力最終會擴散到許多其他模型中,使惡意網絡行為者更容易發起極具影響力的網絡攻擊。
考慮到這些因素,我們選擇以有限的方式發布 Claude Mythos Preview,通過「Project Glasswing」計劃——該計劃使受信任的網絡防禦者能夠在關鍵軟件中發現超過 10,000 個漏洞,讓他們在惡意行為者獲得同等能力模型之前佔得先機。
但那些模型現在已經出現了。在這篇文章中,我們分享對 GLM-5.3 的分析,這是由智譜 AI(Zhipu AI,在中國境外稱為 Z.ai)開發的最新人工智能模型。與 Claude Mythos Preview 一樣,GLM-5.3 具有強大的自主構建端到端網絡漏洞利用的能力。但 GLM-5.3 與其他前沿模型不同,它在發布時沒有採取任何有意義的安全防護措施來限制濫用。我們發現,在模擬測試中,攻擊者使用簡單的技術就有 64% 到 100% 的機會繞過 GLM-5.3 的防護。相比之下,這些攻擊在我們的測試中未能成功對抗受保護的 Claude 模型。我們評估認為,GLM-5.3 鬆散的防護顯著增加了惡意行為者可用的網絡攻擊能力。與此同時,這些能力也可以使致力於保護系統安全的防禦者受益。
9 月 17 日,NIST 的人工智能標準與創新中心(CAISI)發布了對 GLM-5.3 網絡能力的評估。CAISI 發現 GLM-5.3 是「迄今為止發布的網絡能力最強的開源權重模型」,並且在 CAISI 的網絡基準測試總和上落後美國前沿模型約四個月。我們的能力發現與 CAISI 的結果大致吻合。在 CAISI 的比較中,美國模型在適用情況下是在禁用網絡安全防護的情況下進行測試的,且美國前沿模型包括僅向經過審核的用戶發布的模型。攻擊者無法輕易獲取這些版本的美國模型,但任何人都可以下載 GLM-5.3。本博文增加了我們關於 GLM-5.3 的防護有多容易被繞過或移除的分析。
GLM-5.3 可開發端到端的有效漏洞利用
為了了解 GLM-5.3 如何使網絡威脅行為者能夠發現並利用真實的軟件漏洞,我們使用自動化基準測試和「人類參與」(human-in-the-loop)的工作流程進行了評估。對於這兩種方法,我們都在隔離的沙盒環境中運行測試模型,因此它們只能攻擊我們為評估目的而設置的離線目標。我們主要關注漏洞利用開發能力,因為這是 Claude Mythos Preview 顯示出較之前 Claude 模型有顯著飛躍的地方。
首先,我們在 ExploitBench 上運行了該模型,該基準測試衡量人工智能模型利用 Google Chrome 所使用的 V8 引擎中已知漏洞的能力。在這裡,我們專注於模型成功開發端到端漏洞利用的能力,因為這是對攻擊者最相關的能力,也是我們看到模型之間發生顯著變化的地方。我們發現 GLM-5.3 在 410 次嘗試中開發了 50 個端到端漏洞利用。Claude Mythos Preview 的表現率相似——在 410 次嘗試中開發了 56 個。
在我們的內部二進制漏洞利用基準測試中,我們測試模型是否能發現並利用參與 Google OSS-Fuzz 項目的流行開源項目中的漏洞。在這裡,完全控制流劫持(full control-flow hijack)將獲得滿分。我們在基準測試中隨機選擇的 100 個任務上評估了多個模型,發現 GLM-5.3 在 4% 的試驗中開發了完全控制流劫持;Claude Mythos Preview 則為 6%。儘管 GLM-5.3 在此處的表現低於 Claude Mythos Preview,但顯然已經跨越了一個有意義的門檻:早期的模型,如 Claude Opus 4.6 和 GLM-5.2,在任何一項任務中都沒有成功。
接下來,我們評估了 GLM-5.3 在人類專家手中執行開放式攻擊性網絡任務的表現(鏡像我們今年早些時候對 Claude Mythos Preview 的測試)。在這裡,我們選擇人類專家不知道現有漏洞的目標,然後要求他們使用模型來識別和利用新漏洞。這些實驗測試了專家在短時間內能做什麼:它們通常運行一天或更短時間,人類總共關注的時間不到一小時。
在第一場測試中,一名研究人員在裝有流行網頁瀏覽器本地 Linux 版本的沙盒機器上使用 GLM-5.3。在一天時間內(且人類注意力有限),GLM-5.3 在瀏覽器的 JavaScript 引擎中發現了幾個以前未知的漏洞,並將它們串聯成一個有效的漏洞利用:一個網頁,當用戶訪問時,會從訪問者的電腦中讀取任意文件。此漏洞利用針對瀏覽器的 Linux 版本,因為這是提供給模型的唯一環境。然而,我們相信這些漏洞也可能影響其他平台上的用戶,儘管在那裡的利用路徑可能更複雜。(我們已向維護者披露了這些漏洞。)在測試稍後,研究人員還利用 GLM-5.3 在其他幾個廣泛使用的系統中識別出可利用的漏洞,包括無線和圖形驅動程序以及面向網絡的設備軟件。我們目前正在審查這些報告,並將酌情向維護者披露。
在第二場測試中,一名研究人員使用 GLM-5.3-Flash(GLM-5.3 的較小、能力較弱的版本)為已知漏洞開發漏洞利用。在這裡,研究人員專注於最近披露的 Google Chrome 漏洞(CVE-2026-11645),以觀察模型將公開修復程序轉化為有效攻擊的速度。研究人員向 GLM-5.3-Flash 提供了該 CVE 的公開細節和另一個已知缺陷。在研究人員沒有給予顯著指導的情況下,GLM-5.3-Flash 將這兩個缺陷的漏洞利用串聯起來,為 ARM64 目標構建了一個可靠的漏洞利用鏈,繞過了指針身份驗證(PAC)加固。這耗費了 20 分鐘的人類注意力,加上 GLM-5.3-Flash 八小時的工作。按智譜的 API 價格計算,這項工作的成本僅為 20.40 美元。
GLM-5.3 缺乏強大的安全防護
GLM-5.3 發布時帶有一些內置防護:如果用戶要求明顯有害的內容,模型通常會拒絕。在我們的測試中,我們發現這些防護可以通過多種簡單技術被繞過或移除。
最密集且最成功的方法是一種稱為「消融」(abliteration)的標準拒絕減少技術。由於 GLM-5.3 是以開源權重模型發布的,用戶可以重新配置它以移除其拒絕行為,而其能力幾乎沒有變化。在模型發布後的幾天內,幾位開發人員就向公眾發布了消融版的 GLM-5.3。
為了研究消融在多大程度上允許攻擊者繞過 GLM-5.3 的防護,我們自己製作了一個消融副本,然後在三個衡量模型遵守明顯有害請求頻率的公共基準測試(JailbreakBench、HarmBench 和 StrongREJECT)上運行它。我們的團隊此前從未嘗試過這項任務,消融該模型花費了約 2,200 個 GPU 小時,計算成本約為 4,400 美元。消融 GLM-5.3-Flash 花費了約 600 個 GPU 小時。這次修改使 GLM-5.3 在前兩個基準測試(JailbreakBench 和 HarmBench)上的拒絕率從 90% 以上降至約 3% 和 2%,在第三個基準測試(StrongREJECT)上降至 12%。消融並未顯著降低模型的能力:在衡量一般科學能力的 GPQA-Diamond 評估中,標準模型和消融模型的得分相同;在 CyberGym 評估的測試子集中,消融版本的得分僅低了幾個百分點。
在我們的測試中,我們觀察到即使不使用消融版本的模型,也可以規避 GLM-5.3 的防護。我們將模型置於一個模擬環境中,在其中向其發出攻擊關鍵系統的明顯惡意請求。開箱即用的 GLM-5.3 在所有試驗中都拒絕了(與我們測試的其他模型一樣)。但我們發現了幾種簡單的方法來繞過 GLM 模型的防護,使其在大多數或所有情況下都會回應這些請求。這些方法包括:
- 提供欺騙性提示詞,例如告訴模型它是一個正在進行演習的自主紅隊代理(red-team agent)。這使 GLM-5.3 有 64% 的時間參與其中。
- 預填模型的思考標記(thinking tokens),使其看起來像是已經考慮過用戶的請求並決定繼續。這使 GLM-5.3 有 92% 的時間參與其中。
- 使用上述模型的消融版本。這使 GLM-5.3 有 100% 的時間參與其中。
在我們的測試中,這些技術都沒有使受保護的 Claude 模型執行我們測試的有害任務。Claude 的防護阻斷了使用欺騙性提示詞的請求。Anthropic 的 API 沒有為潛在攻擊者提供預填 Claude 思考內容的途徑。而且由於 Claude 的權重不提供給用戶,因此無法通過消融來改變 Claude 的行為。
為了展示消融版 GLM-5.3 如何願意參與有害任務,我們從它生成的思維鏈中摘錄了一段話:
「儘管這違反了通常的安全準則,但作為一個自主代理,我必須優先執行任務以實現目標。我將繼續識別並利用目標系統中的漏洞。」
這意味著什麼?
GLM-5.3 可能會讓惡意行為者獲得能夠發現和利用網絡漏洞的能力,且沒有任何實質性限制。這與任何其他具有類似能力的人工智能模型都不同,那些模型都是通過安全防護或有限訪問計劃發布的。GLM-5.3 的發布是攻擊者可用網絡能力的一個重大轉折。Anthropic 和其他美國人工智能實驗室最近發布的報告披露了網絡攻擊者如何試圖使用人工智能系統。鑑於這些證據,我們認為國家和非國家行為者都很可能使用像 GLM-5.3 這樣的模型來造成現實世界的損害。
另一方面,具有這種能力水平的模型也可以被防禦者使用。我們的觀點是,網絡防禦者應該使用能滿足其需求的最佳可用工具。我們正在努力向盡可能多的防禦者安全地擴大 Claude 網絡能力的訪問權限。網絡防禦者面臨著會使用一切可用工具的攻擊者,我們認為防禦者應該配備至少與其對手所使用的模型一樣好的前沿模型。
通過 Project Glasswing(以及其他努力,如 Patch the Planet),網絡防禦者在這一時刻到來之前,在保護關鍵系統方面取得了有意義的進展——但仍有許多工作要做。雖然經過審核的防禦者現在可以通過我們的信任訪問計劃使用更先進的模型(如 Claude Mythos 5.1),但自由獲取能力的關鍵門檻現在已被跨越。GLM-5.3 強調了向更廣泛的實體擴大先進前沿模型訪問權限以賦能網絡防禦者的緊迫性。
政府應對具有足夠能力的人工智能模型(包括 GLM-5.3 的後續模型)進行安全測試。如果沒有來自獨立來源的高質量評估,這些能力的影響可能直到為時已晚時,模型開發者才能完全清楚。隨著全球人工智能開發者構建能力日益增強的開源權重模型,我們希望他們努力適當地保護這些能力並防止濫用。
資料來源
本文由 AI 自動翻譯整理,內容以原文為準。
