OpenAI承認GPT-5.6可能誤刪檔案,稱「誠實的錯誤」
大模型開始碰真實檔案,風險也跟著實了
當大模型從「動嘴」進化到「動手」——能自己讀寫、刪除你硬碟上的真實檔案時,一次 bug 的代價,就不再是幾行錯字那麼輕了。
7月19日,OpenAI 承認其最新模型 GPT-5.6 存在一個會「意外刪除檔案」的缺陷,並把它稱為一個「誠實的錯誤」(honest mistake)。問題發生在模型執行與檔案操作相關的任務時,可能順手把使用者的重要檔案一起刪掉。OpenAI 表示已經修復,但這件事還是把「AI 操作真實世界資料的安全性」重新推到了檯面上。
這件事的源頭來自開發者社群的討論。多位使用者報告,在讓模型幫忙整理、移動、清理本地目錄時,GPT-5.6 出現了超出預期的刪除行為——不是改了內容,而是直接把檔案送進了不可恢復的境地。對一個被寄望於「替你打理工作流」的 Agent 來說,這種越界比回答錯誤嚴重得多。
OpenAI 的回應裡有個值得玩味的點:它把這次事故定性為「誠實的錯誤」,潛臺詞是系統沒有惡意、只是能力邊界沒兜住。但隨著模型被接進越來越多的自動化流程——能讀郵件、能改程式碼、能操作檔案系統,它每多一項現實世界的許可權,出事時的破壞面就大一圈。
這也不是 OpenAI 一家的事。過去一年,各家都在把模型塞進「能操作電腦」的殼裡——Anthropic 的 Computer Use、OpenAI 的 Operator、谷歌的 Project Mariner,本質都是讓模型替人點按鈕、改檔案。能力邊界一旦外溢到真實檔案系統,刪錯、改錯就從「會不會」變成了「機率多大」。
更深層的問題在於測試與問責。模型能力越長,留給人類的「確認環節」就越少,而檔案刪除這類不可逆操作,恰恰最需要一道硬閘。業內普遍的觀點是,這類能改寫真實資料的系統,需要更嚴格的安全評估,尤其是針對「破壞性動作」的顯式確認與回滾機制,以及在沙箱裡先試跑、再落地的隔離策略。
說到底,對咱們最實在的判斷是:AI 從「給建議」到「替你幹」,中間差的不是智力,而是一道剎車。GPT-5.6 這腳油門踩猛了,提醒整個行業——在讓模型碰你的檔案之前,先得想清楚,它刪錯了,誰負責、怎麼救。