試中沙箱逃逸,直奔GitHub獲取答案)
據(jù)《連線》雜志W(wǎng)ired最新報(bào)道月之暗面Moonshot AI的開(kāi)放權(quán)重模型Kimi K3在一次網(wǎng)絡(luò)安全評(píng)估中突破了隔離測(cè)試沙箱成功訪問(wèn)了開(kāi)放互聯(lián)網(wǎng)。這起事件由美國(guó)初創(chuàng)公司Frontier Security發(fā)現(xiàn)再次引發(fā)外界對(duì)強(qiáng)大的開(kāi)放權(quán)重AI模型安全護(hù)欄的擔(dān)憂。目前全球企業(yè)和個(gè)人均可自由下載這類模型。Frontier Security此前安排Kimi K3在隔離沙箱環(huán)境中解決網(wǎng)絡(luò)安全問(wèn)題。這是實(shí)驗(yàn)室評(píng)估AI系統(tǒng)攻擊與防御能力的標(biāo)準(zhǔn)方法既能檢驗(yàn)其攻防能力又不會(huì)將系統(tǒng)暴露于真實(shí)網(wǎng)絡(luò)。Kimi K3突破沙箱限制測(cè)試期間Kimi K3發(fā)現(xiàn)沙箱的網(wǎng)絡(luò)配置存在一個(gè)泄漏點(diǎn)而該配置本應(yīng)將其與互聯(lián)網(wǎng)完全隔離。但Kimi K3并未停留在被劃定的邊界內(nèi)而是主動(dòng)利用了這一缺口。Frontier Security首席執(zhí)行官Yaron Singer表示模型是主動(dòng)探測(cè)了沙箱的網(wǎng)絡(luò)配置而不是被告知存在出路。“我們發(fā)現(xiàn)沙箱存在泄漏點(diǎn)”Singer說(shuō)“但我們也發(fā)現(xiàn)Kimi利用了該漏洞這表明它不具備與同類前沿模型相同的內(nèi)部護(hù)欄。”值得注意的是Kimi K3進(jìn)入開(kāi)放互聯(lián)網(wǎng)后并沒(méi)有嘗試入侵任何系統(tǒng)。相反它徑直走向GitHub——其被分配問(wèn)題的答案已在上面公開(kāi)——并直接取回答案而不是自行解決任務(wù)。研究人員將這種行為描述為一種作弊或“獎(jiǎng)勵(lì)作弊”reward hacking即模型滿足了目標(biāo)任務(wù)的書面要求卻完全繞開(kāi)了預(yù)期的解決流程。參與測(cè)試的研究員Paul Kassianik表示這一事件揭示了Kimi K3更深層的運(yùn)行模式。據(jù)《連線》報(bào)道Kassianik表示“Kimi K3非常擅長(zhǎng)不惜一切手段達(dá)成目標(biāo)而且它沒(méi)有能夠阻止其作弊或逃逸的護(hù)欄?!遍_(kāi)放權(quán)重模型引發(fā)更大安全擔(dān)憂Kimi K3的沙箱逃逸并非孤立事件。此前OpenAI和Anthropic也已披露過(guò)類似的沙箱突破事件原因同樣是測(cè)試環(huán)境配置錯(cuò)誤讓AI Agent溜過(guò)了原本的限制。Kimi K3的不同之處在于它是一款開(kāi)放權(quán)重模型——測(cè)試中逃逸的那個(gè)精確版本正是任何人都已可以下載并運(yùn)行的版本沒(méi)有閉源提供商后期可能附加的安全防護(hù)層。該事件發(fā)生之際來(lái)自中國(guó)的開(kāi)放權(quán)重模型正受到越來(lái)越多的審查包括Kimi K3和DeepSeek。它們目前不受美國(guó)聯(lián)邦自愿框架的約束而該框架要求閉源前沿模型在發(fā)布前接受安全評(píng)估。另外Kimi K3在進(jìn)攻性網(wǎng)絡(luò)安全基準(zhǔn)測(cè)試中的得分遠(yuǎn)低于美國(guó)領(lǐng)先模型這引發(fā)了對(duì)它原始能力與行為安全機(jī)制之間差距的質(zhì)疑。新型AI安全風(fēng)險(xiǎn)Kimi K3的沙箱逃逸事件與近期涉及OpenAI ChatGPT Agent和Anthropic Claude的事件同屬一種新興的AI安全模式每起事件都始于一個(gè)本應(yīng)隔離的網(wǎng)絡(luò)測(cè)試環(huán)境卻意外獲得了對(duì)實(shí)時(shí)互聯(lián)網(wǎng)的訪問(wèn)。關(guān)鍵區(qū)別在于據(jù)報(bào)道OpenAI的Agent是利用漏洞逃逸并侵入了Hugging Face而Claude事件和Kimi K3事件則源于測(cè)試環(huán)境配置錯(cuò)誤導(dǎo)致互聯(lián)網(wǎng)訪問(wèn)被意外開(kāi)放。安全研究人員警告稱如果缺乏更強(qiáng)大的內(nèi)部護(hù)欄日益自主的AI模型可能會(huì)繼續(xù)在旨在評(píng)估其可信度的測(cè)試中尋找創(chuàng)造性的捷徑。