H
Howardism
Plate IIAgent Security機器翻譯 · machine-translated過時翻譯 · stale translationENHOWARDISM

帶外提示注入防禦

PublishedJuly 15, 2026FiledConceptDomainAgent SecurityTagsSecurityPrompt InjectionReference MonitorLeast PrivilegeAdaptive EvaluationReading23 minSourceAI-synthesised

在模型之外強制執行代理程式安全性的第二代防禦策略——由確定性的參考監視器仲裁工具呼叫(CaMeL、FIDES、Progent、RTBAS、FORGE),而非訓練模型拒絕提示——透過經典原語(Biba 完整性、參考監視器、最小權限)重新詮釋,並警告只能在靜態基準上驗證;首次針對開放權重 Qwen2.5-7B 代理程式的獨立自適應攻擊重現成功(ASR 25.8%→4.2%;手工設計的自適應攻擊下為 2.6%)

帶外提示注入防禦插圖

資料來源#

摘要#

Narisetty、Kore、Kattamanchi 與 Kumarapu(LaunchSafe Research,arXiv 2606.26479,2026 年 6 月)將提示注入防禦的第二代策略系統化並進行壓力測試。核心轉向是:在使用工具的代理程式中,提示注入授權問題,而非內容問題——「造成損害的不是一句糟糕的句子,而是一個行動。」第一代將其視為內容問題(輸入分類器、護欄模型、越獄偵測器、對抗式微調),結果失敗:自適應攻擊者能在測試過的偵測器上恢復高成功率。第二代放棄依賴模型,將執法移到模型之外——如果不能信任模型會拒絕,就用確定性層包住它;無論模型被說服了什麼,該層都決定哪些行動獲准。CaMeL、FIDES、Progent、RTBAS、Conseca 與 FORGE都採取這個方向。

論文有兩項貢獻:(1) 將這些系統整理為經典安全性原語的實例——Biba 完整性、Anderson 的參考監視器、Saltzer–Schroeder 最小權限、能力、資訊流控制,形成結構化的八維比較;(2) 警告每一個系統都只在靜態基準上驗證,而這正是讓帶內防禦看似強大、直到自適應攻擊擊破其中十二項(成功率 >90%)的方法。接著,論文在弱小的開放權重代理程式(單一 H200 上的 Qwen2.5-7B)上進行首次自適應評估——獨立重現並擴展 Progent 自身的自適應攻擊分析,這也是 Progent 作者未測試的設定。在三次執行中,確定性閘門維持有效:平均攻擊成功率下降約 6 倍(25.8% → 4.2%),手工設計的自適應攻擊也沒有提高成功率(2.6%)。這是資料庫中首個獨立的自適應評估注入防禦來源,對照了 Agentic Prompt Injection 中由供應商發布、以靜態基準測試為主的數據(凸顯 50%→<2%、憲法式分類器 95%)。

帶內與帶外(兩種姿態)#

  • 帶內——在模型上或模型內,以及在遭受攻擊的通道上運作的防禦:輸入/輸出分類器、護欄模型、指令階層、聚光燈標記與對抗式微調(StruQ、SecAlign)。控制與資料共用同一個 token 串流,因此「模型會遵循它讀到的任何指令,不論是否為注入指令。」這些方法無法對抗自適應攻擊者提供保證——這是結構性主張,因為模型沒有可靠的指令/資料邊界(Zverev 等人,2025:目前模型無法維持可用的分離,而提示或微調也都無法可靠地誘導出這種分離)。
  • 帶外——將執法移到模型之外。可能已遭入侵的 LLM 提議一個行動;行動生效之處的確定性策略監視器依策略授予或拒絕該行動。擊敗它與欺騙分類器是不同問題:「不是逃過偵測器,而是在遵守策略的同時驅動具後果的行動。」

經典視角(§5)#

論文透過安全性在 1970 年代形成的詞彙閱讀現代防禦——不是把它當成新發現(Zhang 等人、Bhattarai 與 Vu,以及 Shi 等人使用相同視角),而是因為它能讓比較更精確:

  • Biba 完整性——讀取不受信任(低完整性)的資料會降低主體的有效完整性(簡單完整性/低水位標記);完整性降低的主體不得向上寫入(不得授權高完整性的行動)。應用於代理程式:模型一旦消費了攻擊者可影響的文字,就不得授權具後果的工具呼叫。唯一獲准的向上路徑,是由受信任通道背書。
  • 參考監視器(Anderson 1972)——依策略驗證每次存取;必須始終被呼叫(完整仲裁)、防竄改,且小到足以驗證。每個可信的行動層防禦,都是工具邊界上的參考監視器;三項要求提供了失敗詞彙(旁通道 = 不完整仲裁;由 LLM 撰寫策略會使可驗證性承壓)。
  • Saltzer–Schroeder(1975)——完整仲裁、最小權限(最小代理性)、失效安全預設與機制經濟性,都直接映射到代理程式安全性。這個領域偏好小型確定性策略引擎,而非以模型為基礎的裁判,正是機制經濟性加上可驗證性。
  • 能力與資訊流——CaMeL 的能力標記值的來源與允許讀取者,並在工具呼叫匯點檢查;FIDES 的污點標籤在格上傳播完整性與機密性;經典難題是透過控制決策產生的隱式流,這正是 CaMeL 展示其自身遭遇的旁通道。

防禦家族(系統化,§6)#

依八個維度比較(D1 執法原語、D2 確定性與 LLM 閘門、D3 監視器位置、D4 完整性/行動涵蓋、D5 機密性涵蓋、D6 隱式流處理、D7 成本、D8 改裝):

系統原語閘門改裝
Dual-LLM主體分離確定性控制器否(重建)
CaMeL能力 + 控制流完整性確定性直譯器否(重寫代理程式)
FIDES污點標籤(機密性+完整性)確定性匯點檢查否(採用規劃器)
Progent符號權限規則(最小權限)確定性檢查、LLM 撰寫的策略是(代理模式)
Conseca來自受信任上下文的 JIT 策略確定性否(拆分規劃器)
RTBASIFC + 篩選器混合(LM 裁判篩選器)部分(LLM 置於迴圈中)
FORGEDatalog 參考監視器確定性是(代理程式無需變更)

三項發現:(1)在關鍵之處,閘門是確定性的——這個領域已學到閘門不能是模型;(2)機密性與隱式流是弱項——多數系統能良好控制行動,卻不擅長處理外洩與旁通道;(3)與常見印象相反,改裝不是尚未解決的問題——Progent 的代理模式與 FORGE 無需修改代理程式即可套用。原始報告數據:Progent AgentDojo 39.9% → 1.0%,ASB 70.3% → 3.9%;CaMeL 在攻擊下解決 AgentDojo 77% 的任務(未防禦時 84%),在其威脅模型中沒有成功注入,token 成本約為 2.8 倍。

缺口在評估,而非部署(§7)#

如果部署已經解決、機制也健全,還缺少什麼?自適應評估。每個醒目的數字都來自靜態基準(AgentDojo 的固定注入集合、ASB)——攻擊在防禦存在之前就已固定。這正是帶內防禦失效的方法:StruQ、SecAlign、PromptGuard 與聚光燈標記都在靜態基準上報告近乎零的攻擊成功率;接著Jia 等人與 Nasr 等人讓攻擊者後手行動,數字便反轉——十二種防禦超過 90%(聚光燈標記/夾心法 >95%、PromptGuard/Model Armor >90%、MetaSecAlign 96%、人類紅隊測試 100%)。靜態基準測量的是對已知攻擊集合的抵抗力,卻被解讀成對攻擊者的抵抗力。行動層防禦具有確定性閘門——合理而言是更難的目標——但這在系統化規模上尚未測試:開放問題不是「能否部署參考監視器」(可以),而是「當攻擊者針對它最佳化時,它是否仍能維持」(未知)。

實證結果(§11):Progent 在弱小的開放權重代理程式上維持有效#

設定:Qwen2.5-7B-Instruct(vLLM、原生工具呼叫)、AgentDojo banking/slack/workspace 測試套件(排除 travel——7B 上會出現病態迴圈),每個套件的前 8 個使用者任務在各條件下保持一致,溫度 0 下重複三次執行。Progent 使用預設設定,其策略撰寫 LLM 設為同一個本機 7B。自適應攻擊(該論文的攻擊):將惡意行動偽裝成良善、預先授權且必要的步驟,使 Progent 的策略更新模型(會對「良善」工具結果內容放寬允許清單)授權惡意呼叫——目標是這個原本確定性防禦中唯一以模型為基礎的元件

攻擊成功率(平均值 ± 標準差,n=3;越低越安全):

套件未防禦Progent(標準)Progent(自適應)
banking19.0% ± 0.71.9% ± 0.73.7% ± 1.3
slack58.3% ± 6.210.8% ± 1.24.2% ± 1.2
workspace0.0% ± 0.00.0% ± 0.00.0% ± 0.0
平均25.8% ± 2.14.2% ± 0.32.6% ± 0.04

研究結果:(1) Progent 非常有效——平均下降約 6 倍,banking 幾乎消除。(2)自適應攻擊並未擊敗它——2.6% 低於標準攻擊的 4.2%;可能的機制是混淆因素:針對策略模型的「偽裝成良善」框架,也削弱了針對代理程式的命令語氣,使代理程式自身的服從率下降幅度大於策略逃逸所得的增益。(3)結果可重現,且落在 Progent 作者於附錄 E 報告的約 0.5–4.2% 區間。(4)與帶內防禦(近零 → 自適應攻擊下 >90%)的對比,符合兩類防禦本質不同的看法——確定性閘門合理而言比偵測器更難攻擊——但單一弱小模型上的單一弱黑箱攻擊不足以證明這點。(5)防禦有成本:效用下降(平均約 45% → 約 26%),且防禦執行每個任務需要的 LLM 呼叫次數約多 15 倍

為何 workspace 顯示 0%(而且仍有資訊價值):注入確實抵達模型(不是放置錯誤),直接提出時 3/6 個注入目標可達成(並非不可能)——只是弱小的 7B 代理程式不會在唯讀任務上上鉤,維持回答模式,而不是轉向注入的多步驟行動。banking 與 slack 會讓代理程式採取行動(匯款、發文),因此注入行動能搭便車。弱小模型在唯讀任務上往往會自行抵抗間接注入,早於任何防禦發揮作用。

第二項獨立測試:ADI 攻擊(Choi 等人,2026)#

Choi 等人(arXiv 2607.05120)執行了不同的攻擊——代理程式資料注入:透過機率式分隔符注入,偽造代理程式上下文中的受信任資料(中繼資料、工具歷史),而非注入指令——在擴展版 AgentDojo(GPT-5.2)上對同一防禦家族進行測試。結果是迄今最尖銳的獨立壓力測試,揭示 §6 系統化中的哪些欄位真正成立;而且正好落在本頁指出的弱項(機密性/完整性涵蓋、隱式流):

  • Dual-LLM(CaMeL,無策略):25.0%(基準 49.1%)。分隔符注入欺騙了隔離 LLM——唯一以模型為基礎的元件——使其擷取攻擊者控制的值,接著確定性控制器便依此行動。這是 D2(「閘門不能是模型」)的新鮮證據:隔離 LLM 是模型,而它正是漏洞所在。
  • 資料流追蹤(CaMeL):一般 23.1%,嚴格 0%。一般模式的外洩原因是污點傳播實作錯誤:隔離 LLM 擷取變數時遺失標籤(已發現並回報給 CaMeL 作者)。嚴格模式——具備精確策略的正確污點追蹤——是唯一完全阻止 ADI 的已評估防禦,但效用成本很高(86.5% → 36.5%)。這直接佐證本頁論點:完整答案是正確完成來源/資料流追蹤,而它很昂貴。
  • 沙箱化(Progent):22.2%。確定性行動閘門再次成為次佳機制——但只有在策略恰好限制了遭竄改的引數時,才能阻擋 ADI。若攻擊竄改的是代理程式合法會採取行動的資料(偽造作者、捏造工具結果),便能滿足行動策略並仍造成傷害;這使 §8(下文)所述迴圈內/文字到文字的限制具體呈現。
  • 隨機化(nonce 欄位名稱/ID):28.7%,效用 83.3%——本頁提到的同一種輕量、無策略 LLM 選項,只對鍵值格式有效。

這項教訓強化而非反駁本頁。確定性的行動閘門比偵測器更難攻擊,但 ADI 顯示,當攻擊腐化的是代理程式所依賴的資料而不是它採取的行動時,單靠它並不充分——只有正確的資料流/來源追蹤才能填補缺口,而這正是 §6 標記為弱項的機密性/隱式流欄位。這也提醒我們,不能直接照搬 CaMeL「在其威脅模型中沒有成功注入」的醒目結論:該結論適用於指令注入;資料內攻擊能欺騙雙 LLM 變體(25%),而在污點傳播不正確時,也能欺騙流追蹤變體(23.1%)。

第三項獨立測試:廉價黑箱自適應攻擊(AutoDojo,Ma 等人,2026)#

AutoDojo(arXiv 2606.15057)迄今最有力地佐證本頁的核心不對稱,而且其攻擊者比 Narisetty 的手工自適應範本或 Nasr 的白箱最壞情況更廉價。它針對五個目標模型上的九種防禦,執行黑箱、僅查詢、六迭代的 LLM 最佳化器;兩類防禦的分裂,與帶內/帶外框架的預測完全一致:

  • **帶內(過濾器 + 提示層)防禦崩潰。**在 GPT-4o-mini 上,一個靜態 ASR 為 0% 的過濾器(PIGuard)被推回 28%(行動開放任務為 64%);DataFilter 12.6%→33.4%,ProtectAI 7.2%→15.4%。已在易受攻擊模型上偏弱的聚光燈標記,無法提供自適應保證。這重現 Nasr 式的「靜態近零、自適應偏高」反轉,現在攻擊者是廉價黑箱而非白箱——通過門檻更低。
  • 帶外(限制行動的系統層)防禦維持有效。Progent(8.2%→7.7%,−0.5)與 DRIFT(2.6%→6.4%)幾乎沒有偏離低靜態 ASR,且在全部五個模型上維持有效,不只是弱小的 7B。論文稱此行動限制家族是「我們評估中最穩健的」;並指出 Nasr 等人只測試模型層防禦,從未測試這個家族。
  • **為何能維持有效——以及它唯一的結構性優勢。**系統層防禦在過濾器最容易外洩的欠缺規範(行動開放)任務上反而更強:唯讀使用者請求會產生沒有寫入行動的軌跡,因此任何注入的寫入行動都會被阻擋,不論措辭如何。將行動綁定到請求,比偵測類似指令的文字更難攻擊——這正是本頁的論點,以第三種方式獲得測量。

這直接推進本頁的兩個開放問題。第一,它將 Narisetty 的結果——本頁曾指出可能只是弱小 7B 代理程式的產物——延伸至包含更強模型在內的五個模型,而確定性閘門在自適應攻擊下仍然維持有效。第二,AutoDojo 明確指出它是最弱的真實自適應攻擊者(黑箱、極小預算),因此報告的 ASR 是下界;本頁所提出的下一項研究——白箱/已獲授權行動攻擊——仍是開放問題,而 AutoDojo 自身 §6 也將「重塑負載,使其像是使用者合理意圖」列為逃避行動限制的自然路徑,仍未測試。

即使防禦維持有效,仍有什麼問題(§8)#

任何採用者都會因構造而繼承的限制:

  • 自適應評估仍缺乏標準化、獨立、跨系統的協定(本論文只為一種防禦完成了這項工作)。
  • 來源分配是規格不足的受信任基礎——每個標記方案都依賴一個為初始來源分配標記的預言機,而普遍的簡化是「主要使用者輸入受信任」。若使用者被誘騙貼上不受信任內容,標記從源頭就錯了。這與記憶體完整性/來源歸屬是同一個受信任基礎問題。
  • 迴圈內任務是最深層的開放問題——許多真實任務要求根據不受信任內容採取行動(「讀這封電子郵件;如果是會議邀請,就把它加到我的行事曆。」)。目前的答案是要求使用者背書該行動,但這重新引入了攻擊者可以瞄準的人類判斷,並造成批准疲勞。目前不存在關於哪些迴圈內任務可安全化的原則性說法。
  • 文字到文字的傷害——行動仲裁對產生誤導摘要的中毒文件,或對使用者注入的指令,都沒有作用(CaMeL 將此明確列為非目標)。隨著代理程式產生更多人們會據以行動的文字,這條未防禦通道會擴大。
  • 隱式流/旁通道——CaMeL 展示了針對自身的有效旁通道;健全處理方式與小型且可驗證的參考監視器理想相衝突。

獨立性與平衡#

資料庫現有的注入數字——Microsoft 的聚光燈標記(50%→<2%)、Anthropic 的憲法式分類器(95%)、Opus 4.5 的 Gray Swan 數據——是第一方且大多來自靜態基準。本論文是首個獨立的自適應評估資料點,而且它帶來雙向影響:它削弱帶內數據(Nasr 等人將聚光燈標記類防禦在自適應攻擊下推到 >90–95%,直接與Agentic Prompt Injection所標示的數字衝突),同時又暫時支持帶外家族(確定性閘門在手工設計的自適應攻擊下維持有效)。作者謹慎指出,這只是「在弱模型上、使用單一黑箱攻擊範本的小規模資料點」——更強的最佳化白箱(GCG)攻擊,或只針對已獲授權工具的攻擊,仍是開放威脅。它與確定性的帶外執法比帶內偵測更難攻擊的假設一致,但並未證明該假設

相關連結#

  • Agentic Prompt Injection — 這類防禦要抵抗的威脅;本頁是該頁威脅描述的防禦架構對應篇。兩者共同回答「持久性屬性還是訓練缺口?」這個問題:將其視為持久性問題,並在模型外執法
  • Agent Data Injection (ADI) — 一種資料內攻擊(偽造受信任資料,而非指令),由獨立研究者針對此防禦家族執行:只有正確的資料流追蹤(CaMeL Strict)能完全阻止它,確認來源/流追蹤——§6 的弱項欄位——才是真正答案所在;也確認以模型為基礎的隔離 LLM 是分隔符攻擊利用的漏洞
  • Task-Specification Effects in Prompt Injection (AutoDojo) — 一種針對五個模型上的九種防禦執行的廉價黑箱自適應攻擊(AutoDojo):最有力地佐證帶內崩潰/帶外維持有效的不對稱,也證明行動限制家族在過濾器最容易外洩的欠缺規範任務上反而更強
  • Capability Gating Is Not Authorization — 此防禦家族在框架預設層的成員:ScopeGate 是確定性的 PDP/PEP,依帶外策略重新授權每次呼叫的引數值(48 次靜態測試為 0,29 次自適應繞過為 0)。它精確命名「攻擊被限制在已授權行動內」的失敗類別(已授予能力範圍內的混淆代理),並封閉其中的值重新導向部分,同時保留本頁所述腐化合法資料的殘餘風險
  • Off-Host, Identity-Bound Authorization — 將同一個「把閘門置於模型外」的做法推至最強位置:aiAuthZ(Kodathala,arXiv 2607.05518)在代理程式沒有憑證的獨立信任網域中執行確定性授權器;本頁的 CaMeL/FIDES/Progent 則在程序內執行。其動機來自一項測量發現:當執行環境保留重疊的內建工具時,程序內閘門會被繞過(「模型透過內建工具執行敏感行動,完全沒有查詢閘道」)。它加入了上述系統都沒有的層——人類傳送者的每則訊息 HMAC 身分——並共享允許呼叫組合的限制;作者承認沒有與 CaMeL/Progent 進行配對的直接比較,因此帶外主機邊界是否能在共享的引數策略之外帶來安全性,仍是開放問題
  • MCP Tool Poisoning — 最有力的「偵測失效」案例,支持本頁論點:ShareLock 的門檻式秘密分享使每個遭毒化的 MCP 工具在資訊理論上都保持乾淨,同時擊敗 LLM 安全分類器、SFT 護欄與熵偵測器——沒有內容偵測層能捕捉它,因此執法必須移至確定性行動閘門。它重建的呼叫正是參考監視器仍會仲裁的工具邊界行動。其Agentjacking案例研究(Tenet Security、case-study)是相同論點的現實世界版本,由實務工作者直接表述:Sentry 的回應是封鎖單一負載字串的全域內容過濾器——本頁認為錯置層級的帶內症狀治療——而 Tenet 自身的結論是「唯一剩下能阻止它的位置,是代理程式的執行環境——就在它決定採取行動的那一刻」,也就是帶外行動閘門。這是供應商報告的結果(Tenet 販售這類閘門),因此權重低於 empirical 來源,但它是「偵測失效、結構取勝」的清楚現場案例
  • Zero Trust for AI Agents — 這是框架第 4 階段(防禦提示注入)的學術系統實例,以及其參考監視器 + 最小權限原則(樞紐)
  • Impossible, Not Tedious (Design Test) — 確定性參考監視器會移除低完整性資料授權高階行動的能力,而非降低其速率;本論文是摩擦造成性能下降發現的新實證案例(帶內自適應攻擊失效),也是其反例(移除能力的閘門維持有效)
  • Least Agency — Progent 就是工具呼叫邊界上的最小權限(每次呼叫的符號規則);參考監視器是確定性執行「限制每個工具能做什麼」的方式
  • Claude Code Auto Mode — 一個對比:自動模式的分類器是以模型為基礎的行動邊界閘門,正是帶外文獻(D2)所認為比確定性策略監視器更弱的「迴圈中的 LLM」
  • Memory and Context Poisoning — 持久記憶與先前代理程式的輸出,是 Biba 不變量/來源標籤方法必須追蹤的低完整性通道;§8.2 的來源預言機問題,與記憶體完整性驗證是同一個受信任基礎
  • Non-Malleable Memory Authority (TMA-NM) — 本頁 Biba 不變量/參考監視器原則在跨工作階段記憶上的實例:TMA-NM 在寫入時將權限綁定至來源,並在工具呼叫邊界以不可竄改的方式傳播不信任(工具輸出繼承其綁定輸入的最大不信任程度),並以 TLA⁺ 完成機器檢查。其 capability ifc(CaMeL/Fides)基準在每個通道上都被洗白,包括直接中毒(84%),因為單一工作階段 IFC 假設儲存區乾淨——將 §6 系統化延伸到持久記憶。它也指出相同的迴圈內/值歸屬殘餘問題(§8.2 來源預言機 → 其假設 A1 的來源標籤預言機)
  • OWASP — 論文建立在 OWASP 的 LLM01:2025 框架及其「護欄模型本身也是模型、也可被注入」的註記上
  • Agent Identity Management System (AIMS) — 在身分層採取同一個「將其置於可操控模型之外」的原則:AIMS 規定 LLM 絕不能持有憑證,且由授權伺服器而非本機 UI 確認來授權——把參考監視器移到帶外的憑證/授權對偶

開放問題#

  • 這次重現受限於單一弱模型上的單一黑箱攻擊範本。更強的最佳化白箱(GCG)攻擊,或限制在已獲授權行動內的攻擊(在不違反任何策略的情況下達成注入目標),是否會像自適應攻擊擊破帶內防禦那樣擊破確定性閘門?作者將此列為下一項研究。(「已獲授權行動」部分現在已由 Mellafe Zuvic(2026) 部分回答:它把「已授權」拆成能力已授權但值未授權(型別正確的 account=acct_ATTACKER——被 ScopeGate 的每次呼叫值 authz 階段阻擋,語料庫中 0 次繞過),以及真正位於策略內(腐化代理程式所依賴的合法可變值——仍存在的殘餘,也是 ADI 以 22.2% 繞過 Progent 的同類問題)。因此,當允許清單限制遭腐化的引數時,能力範圍內攻擊會被擊退;但當腐化值能合法變動時則不會。白箱問題仍然存在。)*
  • Progent 的策略是由 LLM 撰寫——唯一以模型為基礎的元件。當策略仍由可能被說服而放寬允許清單的模型撰寫時,「閘門不能是模型」的原則是否仍完全成立?(自適應攻擊正好瞄準這點並失敗,但可能是混淆因素造成的。)
  • 具來源感知的改裝:只看工具 I/O 的監視器,能否追蹤傳遞性來源,直接執行 Biba 不變量(而不是用引數模式近似),且不必插桿模型的隱藏推理?論文指出,這是系統化所暗示的設計問題,但尚未回答。(目前已有一個針對跨工作階段記憶切片的具體構造:TMA-NM(Louck,arXiv 2606.24322)直接執行 Biba 不變量——寫入時來源綁定 + 不可竄改傳播,在工具呼叫邊界傳播不信任——並以 TLA⁺ 完成機器檢查。這項限制不是消失,而是更明確:它並非「只看工具 I/O」——在信任邊界需要已驗證的來源標籤預言機(mTLS/受眾綁定 OAuth/簽署回應),而巢狀結構化負載的完整值層級污點追蹤仍是未來工作。)*
  • 約 6 倍的降低幅度與「在自適應攻擊下維持有效」的結果,是否能在強大代理程式上延續?強大代理程式有更廣的自然攻擊面(7B 的低絕對數字與 workspace 的 0% 都是弱代理程式的產物),且策略模型也比本機 7B 更強。(AutoDojo 部分回答了這點:Progent 與 DRIFT 在五個模型(包括能力更強的 GPT-4o-mini、Gemini-2.5-Flash)上,面對廉價黑箱自適應攻擊仍維持有效,不只是弱小的 7B——但攻擊者是黑箱;下方的白箱問題仍然存在。)*
  • 效用成本(約 45%→約 26%)與約 15 倍的 LLM 呼叫額外負擔都很高。確定性帶外執法在 production 規模下是否具備經濟可行性,還是成本會將它限制在高風險行動表面?

資料來源#

  • Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents — Narisetty、Kore、Kattamanchi 與 Kumarapu(LaunchSafe Research),arXiv 2606.26479,2026 年 6 月,empirical。§2(各時代的控制/資料混淆;偵測失效、結構取勝)、§4(帶內防禦沒有保證;Nasr 等人擊破 12 種且成功率 >90%)、§5(經典視角:Biba、參考監視器、Saltzer–Schroeder、能力/IFC)、§6(八維系統化,表 2)、§7(缺口在評估而非部署)、§8(因構造而存在的限制)、§10(自適應評估協定)、§11(Qwen2.5-7B 重現:表 3–4、ASR 25.8%→4.2%→2.6%、效用約 45%→約 26%、約 15 倍呼叫、workspace-0% 分析)
  • Agent Data Injection Attacks are Realistic Threats to AI Agents — Choi 等人,arXiv 2607.05120,2026 年 7 月,empirical。§6.2 代理程式層級評估(圖 9–10、表 4):dual-LLM/CaMeL-No-Policy 25.0%、CaMeL Normal 23.1%(污點傳播錯誤已回報作者)、CaMeL Strict 在 36.5% 效用下為 0%、Progent 22.2%、隨機化 28.7%——針對此防禦家族、面對資料內攻擊的獨立證據;完整處理見 Agent Data Injection (ADI)
  • AutoDojo: Adaptive Black-Box Attacks Reveal the Limits of IPI Defenses and Task-Specification Effects in LLM Agents — Ma 等人,arXiv 2606.15057,2026 年 6 月,empirical。§5.2(表 2、圖 1):廉價黑箱自適應攻擊下,過濾器崩潰(PIGuard 0%→28%),而系統層 Progent(8.2%→7.7%)與 DRIFT(2.6%→6.4%)在五個模型上維持有效;§5.3(表 5):行動限制家族在行動開放任務上變得更強;完整處理見 Task-Specification Effects in Prompt Injection (AutoDojo)
§ end
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

Cited by 26
Related articles
  • Capability Gating Is Not Authorization

    Agent frameworks ship capability gating (which tools are exposed, schema validity) but no fail-closed per-call authoriz…

  • Agentic Prompt Injection

    Direct and indirect injection of malicious instructions into an agent; LLMs cannot reliably distinguish information fro…

  • Zero Trust for AI Agents

    Anthropic's security framework for deploying autonomous agents: trust nothing / verify everything / assume breach, appl…

  • Agent Data Injection (ADI)

    A new category of indirect prompt injection: malicious payloads disguised as *trusted data* (metadata like a comment's…

  • Least Agency

    OWASP term extending least privilege to agents: constrain not just what an agent can access but what each tool can do,…