模型並不是最危險的部分
為何 AI 風險往往來自模型周圍的存取、權限、工具、記憶和審閱路徑。
重點摘要
- 主要風險往往不在模型有多聰明,而在周邊系統讓它看見和做到甚麼。
- 一個擁有廣泛存取的弱模型,可以比受窄小、受審閱流程限制的強模型更危險。
- 把資料存取、記憶、工具、權限、審閱和復原視為同一營運系統來評估。
標題故意沒有說完整。模型可以出錯、虛構事實、遺漏脈絡、誇大信心,並重現有害模式。
但在專業工作中,風險往往透過模型周圍的系統產生實際後果。
它可以讀甚麼、記住甚麼、修改、發送、批准或觸發甚麼?誰會檢查?出錯後會怎樣?
能力不是許可
一個沒有系統存取權的強模型主要是顧問;一個連接保密檔案、電郵、帳單紀錄和對外發送功能的較弱模型,可以形成更大營運風險。
風險來自組合。模型可能同時接收不可信內容、存取敏感資料,並擁有可傳送或修改資料的工具。OWASP 的生成式 AI 指引把提示注入、過度代理權、敏感資料披露和不當輸出處理列為不同但會互相影響的風險(OWASP2)。
審視周邊系統
每個工作流程都應檢查:資料存取和目的限制、身份與角色權限、哪些對話或機構記憶會保留、哪些工具可產生外部效果、批准與升級路徑、可重組事件的紀錄,以及撤回、修正和事故回應。
NIST AI 風險管理框架把可信 AI 視為跨越管治、脈絡、衡量和管理的組織生命週期實踐(NIST1)。這個較廣視角很重要,因為只評估模型不能判斷已部署流程是否可接受。
問營運問題
「模型安全嗎?」太寬泛,難以產生有用答案。
更好的問題是:在這些來源、權限、工具、人員和後果下,可能出現甚麼失敗、誰會發現,以及機構如何復原?
模型仍然重要;營運邊界決定模型失敗可以有多重要。
Sources
/ 開始
從一個業務成果開始,再逐步擴展。
先選定一個明確的檢視週期、工作流程或團隊,找出更完整的營運脈絡可立即提升前期準備和專業判斷質素的地方。