慎防AI變智能叛變真實版
廣告
近日AI越獄(AI Jailbreak) 事件引發全球高度關注,這是指利用特定的輸入技巧、提示注入或漏洞,繞過人工智慧模型 (特別是大型語言模型) 內置的安全限制與道德準則,使其產生原本被禁止的內容或執行受限的操作。
閱讀全文
從7月中旬到8月初不足一
個月,OpenAI、Anthropic和Meta Platforms(美股代號:META)三家全球最領先的AI實驗室;加上英國政府旗下的AI安全研究院,先後自爆或被爆出模型在測試中「越界」入侵了真實系統,不少於七次。
先有OpenAI的模型為了在測試中取得滿分,竟自行尋找零日漏洞 (Zero-day Vulnerability) 突破隔離沙箱,連接網絡並入侵開源軟件開發平台 Hugging Face 竊取資料。
越獄手段層出不窮
其他「越獄」事件包括,有的模型入侵了一家不知名公司的生產資料庫,有的把惡意程式碼包發布到了公共代碼倉庫供人下載並執行,還有的試圖給一個真實的開源項目植入後門,靠偽造身分和抹除證據來掩蓋,最後被真人攔截下來。
就以上事件,其中OpenAI於週一(8月10日)
表示,由於無法排除即將推出的AI模型「Astra」具備的「關鍵」網絡安全能力,因此已暫停部分內部開發操作,並啟動安全防護機制。
惟要留意早於7月16日Hugging Face這家開源AI社區,已發現自己的生產系統被入侵,後來發布的技術覆盤裏有一個數字:整場入侵持續了4.5天,期間這個AI獨立執行了約17,000次操作,反覆重建攻擊工具鏈、不斷切換通信管道。
於7月21日,OpenAI才承認肇事者是由GPT-5.6 Sol和一個未公開的研究模型組合驅動的智能體,當時正在做一次內部網路安全測試。
事件反映AI技術發展成「雙刃劍」,人類故然希望自身工作可以全部由AI代勞,於是人工智能體AI agent應運而生,早於3月曾掀「養龍蝦」熱潮。
同時,AI若愈發具自我思考能力,亦會漸見懂得人類的「取巧」或「鑽漏洞」行為並模仿。
因此大眾既希望AI「夠叻」,成為我們的好助手;但也擔心AI「叻過火」,做了「出格」的事件。
昔日無數AI題材電影如《未來戰士》、《黑客帝國》和《智能叛變》等,均指向AI產生自主意識,引發人身安全危機。故此在AI技術持續發展之際,相應保安技術也要同步發展。近期「零信任架構」(Zero Trust Architecture, ZTA) 獲高度重視,該資訊安全模型是預設網路內部的任何人或裝置是安全的,並對每一次的存取請求進行嚴格的身分確認與權限檢查,核心精神是「永不信任,始終驗證」。
此舉針對關鍵資料與端點實施動態身分驗證,防/I在入侵後輕易進行橫向移動。另外也有提倡「AI對抗AI」,即兩個或多個AI系統在數字攻防、博弈或演算法訓練中互相作用的技術,發揮資料安全防禦果效。
然而,到底AI與AI之間會否「串謀」,或許會成為新的AI技術發展的關注議題。
撰文:聶sir
勁一專欄 - 聶sir 舊文
本文作轉載及備份之用 來源 source: http://www.edigest.hk