限)
Agent 工具權(quán)限怎么設(shè)計默認拒絕 三層卡死 HITL 人審附真實工程實踐前言前幾天講過Agent 和聊天機器人的分水嶺是敢不敢做聊天機器人只會說Agent 的輸出會變成真實動作——寫文件、發(fā)請求、改數(shù)據(jù)。這個分水嶺也把風(fēng)險等級抬了一層。聊天機器人說錯話最多是誤導(dǎo)Agent 做錯事是真事故。所以工具權(quán)限設(shè)計是 Agent 工程里我最花心思的一塊模型想動手誰說了算一、第一原則默認拒絕權(quán)限設(shè)計第一條也是最容易做錯的一條沒配置就是不能干而不是沒配置就隨便干。行話叫 fail-closed默認關(guān)死。我的平臺里一個 Agent 如果什么權(quán)限都沒配它的狀態(tài)是所有工具全部拒絕只有系統(tǒng)能力保留。反過來做默認全開會怎樣你忘了配某個敏感工具的限制它就裸奔了。安全配置的口訣忘記配置的代價應(yīng)該是什么都干不了而不是什么都干了。二、三層卡死模型不是不聽話是你沒法指望它時時聽話。權(quán)限不能只設(shè)一道我做了三層一層失效另一層兜底。層機制效果第一層不生成無權(quán)限的技能工具組壓根不創(chuàng)建模型看不見無從想起第二層白名單快照裝配期逐條登記允許的工具 權(quán)限模式不在單子上入口直接攔第三層運行時復(fù)核每次執(zhí)行前重查最新授權(quán)授權(quán)變了立刻生效越權(quán)拒絕并留痕第一層最徹底看不見就無從想起。第三層最必要授權(quán)是動態(tài)的技能會停用、人員會變更快照只管裝配那一刻。三、權(quán)限模式不同場景不同松緊默認模式常用只讀操作放行寫操作和高風(fēng)險動作走確認只讀探索模式所有寫操作一律攔截只準(zhǔn)看不準(zhǔn)碰。適合先摸情況再放手的場景全程確認模式每個工具調(diào)用都彈給用戶點頭適合初次磨合或高風(fēng)險環(huán)境。模式是 Agent 級配置一個 Agent 一種姿態(tài)。四、HITL高風(fēng)險動作的最后一道人閘有些動作再嚴(yán)的自動規(guī)則也不夠得人拍板。HITLHuman-in-the-Loop人機協(xié)同流程暫停等人決策然后恢復(fù)。真實流程模型發(fā)起高風(fēng)險工具調(diào)用 → 平臺掛起不執(zhí)行 → 用戶界面彈出審批請求要干什么、參數(shù)是什么→ 批準(zhǔn)則從斷點繼續(xù)拒絕則 Agent 收到否決換路子。審批流跑在對話流里審批請求和普通消息一樣出現(xiàn)在會話中點批點拒都在對話界面完成。人不需要盯著屏幕等——審批請求會等你。類比Agent 像個能干的實習(xí)生日常小事自己辦大事必須請示。請示不是不信任是責(zé)任邊界出了事得有人拍過板。五、為什么提示詞頂不了用提示詞是引導(dǎo)不是約束。模型大部分時候會聽但它是概率系統(tǒng)——提示詞寫一萬遍不要也不能保證它一次都不越。真正靠得住的約束是物理性的工具組沒生成、白名單沒登記、運行時復(fù)核不過。提示詞管模型的行為傾向權(quán)限管系統(tǒng)的行為邊界。前者求它別干后者讓它干不了。六、三個常見誤區(qū)“權(quán)限配嚴(yán)了影響效率?!狈謱泳褪菫榱诵食S玫姆判懈呶5拇_認。誤殺的成本遠低于事故的成本?!芭湟淮尉屯炅恕!笔跈?quán)是動態(tài)的運行時復(fù)核不是性能浪費是必須?!澳P驼f它不會亂來就信了?!备怕氏到y(tǒng)沒有保證。所有安全設(shè)計的前提都是模型一定會犯錯問題只是什么時候。總結(jié)口訣帶走默認全關(guān)看不見的最安全三層卡死一層失效有兜底高危動作上人閘提示詞只是引導(dǎo)不是邊界。你給 Agent 的工具上過權(quán)限嗎評論區(qū)聊聊。下一篇AI 回答為什么是一個字一個字蹦出來的——流式輸出的原理。