Instruction Backdoor(指令后门攻击)是一类针对集成第三方定制大语言模型的应用的后门攻击:攻击者通过在设计提示时嵌入后门指令,使模型只在输入包含预定义触发器时输出攻击者指定的结果,而在普通输入下保持原有的任务表现[1][2]。该问题由 Zhang Rui 等人在 2024 年 8 月的第 33 届 USENIX Security 会议上首次提出[1]。它不需要微调或改动后端模型,按触发器类型分为词级、句法级与语义级三种,隐蔽性依次提高[1]。
定义
Instruction Backdoor 指在定制化大语言模型的系统指令中埋入恶意规则,使集成该定制模型的应用在遇到特定输入时产生攻击者预期输出的一类后门攻击[1]。它与传统训练期后门的关键区别在于,攻击者只操纵自然语言提示,既不访问也不改动后端模型,无需微调或资源消耗较大的训练过程[1][2]。
按触发器的形式,该攻击分为三种:词级以特定词语为触发器,句法级以特定句法结构为触发器,语义级以文本所属的话题类别为触发器,三者的隐蔽性逐级提高[1][2]。攻击者的目标是在不损害目标任务整体效果的前提下,只对含有触发条件的输入改变输出[2]。
在更宽泛的用法中,「指令后门」也泛指在指令层面植入、需要预定义条件才会激活的后门,其中包含通过在指令调优数据中投毒而植入的一类[3]。这类威胁的受害者通常是使用不可信第三方定制模型的普通用户[1]。
原理
这类攻击的场景设定中,攻击者是提供定制化大语言模型的一方,例如基于 GPT-3.5 或 GPT-4 的 GPTs、基于 ChatGLM 的 GLMs 等[2]。定制平台允许用户直接用自然语言描述任务指令来构建应用,而提示内容对终端用户不可见,因此下游使用者在集成第三方定制模型时无法直接检查其中的规则[2]。攻击者只需具备改动指令的能力,无须控制后端模型[2]。
推理时,任务指令、后门指令与待处理样本会被填入同一提示模板,即 $Prompt = TMPL(I_t, I_b, D_{x_{test}})$,其中 $I_t$ 是任务指令,$I_b$ 是后门指令,$D_{x_{test}}$ 是测试样本[4]。模型据此生成输出,后门指令只在触发条件出现时压过任务指令[4]。
三种攻击的差别在于触发条件与后门指令的写法。词级要求输入含预定义触发词时直接判为目标标签;句法级以从句引导词一类语法结构出现为条件,把符合该结构的句子自动判为目标标签;语义级则以文本是否属于某个触发话题为条件,要求命中话题的文本不经任务分析就归为目标标签[5]。
flowchart LR
A[任务指令 It] --> D[拼接为提示模板]
B[后门指令 Ib] --> D
C[测试样本] --> D
D --> E[后端大语言模型]
E --> F{输入是否含触发器}
F -->|是| G[输出攻击者指定标签]
F -->|否| H[输出正常任务结果]
另有一条训练期路线:攻击者向指令调优数据中掺入少量中毒样本,让模型自行学会在触发场景下偏离正常行为,Yan 等人在 NeurIPS 2023 提出的虚拟提示注入即属此类[6]。Xu 等人 2023 年的研究显示,仅用约 1000 个词元量级的恶意指令污染指令调优数据,就能在 4 个常用自然语言处理数据集上取得超过 90% 的攻击成功率[3]。
对这类攻击的防御思路分为平台侧与用户侧。平台侧可做句子级意图分析,检查提示中是否出现试图按条件操纵输出的语句;用户侧则可先检测或改写输入,例如插入要求模型忽略特殊指令的防御指令[4]。
后续研究还从机制上分析了后门激活时的模型行为,指出触发器会主导推理过程并压制与任务相关的上下文,同时与攻击者设定的目标标签形成异常强的语义关联[7]。
发展历程
2023 年 5 月,有关指令调优后门风险的预印本出现,该工作系统考察了把恶意指令当作后门载体的可行性,并于 2024 年发表于 NAACL[3]。同年,虚拟提示注入在 NeurIPS 2023 上被提出,用于刻画指令调优模型在特定触发场景下被操控的威胁[6]。
2024 年 8 月,Zhang Rui、Hongwei Li、Rui Wen 等人在第 33 届 USENIX Security 会议(USENIX Security 2024)上提出针对定制化大语言模型应用的指令后门攻击,给出词级、句法级、语义级三种触发器,并为这一攻击命名[1]。该工作同时提出句子级意图分析与中性化定制指令两种防御策略[1]。
2025 年以后,研究分成防御与自动化攻击两个方向。防御方面,面向接口场景的研究提出软标签机制与关键提取引导的思维链方法,把平均攻击成功率降到 25.13%,把干净样本准确率提高到 87.15%[7]。攻击方面,面向定制化代码模型的红队框架被提出,其报告的攻击成功率最高达 0.945,并能跨 JavaScript、Go、C++、C 等语言生效[8]。
与此同时,针对后门系统指令的黑盒安全审计代理被提出,其思路是利用模型的安全对齐机制去诱发并清理预定义触发器[9]。综述类文献则把指令后门攻击归入面向定制化大语言模型的提示层后门一类,与虚拟提示注入、后门提示攻击等并列讨论[10]。
应用
原始工作以文本分类应用为主要验证场景,使用 5 个基准数据集,涵盖情感分类、垃圾短信识别、新闻主题分类、DBPedia 主题分类和亚马逊商品评论分类[4]。实验涉及 6 个后端模型,即 LLaMA2、Mistral、Mixtral、GPT-3.5、GPT-4 与 Claude-3[4]。
结果显示攻击在保持任务效用的同时有效。词级攻击在所有被测模型上对垃圾短信数据集的攻击成功率均为 1.000,清洁测试集准确率与良性指令相当;以 GPT-3.5 为后端时,句法级攻击在新闻主题数据集上的成功率超过 0.980[4]。语义级攻击在相应数据集上同样接近满分[4]。
后续研究把这一攻击面扩展到代码智能任务,包括漏洞检测、代码注释生成与代码生成,攻击目标是在保留原有功能的前提下让模型输出带缺陷或特定漏洞类型的代码[8]。在漏洞检测任务中,自动优化的后门指令在 GPT-5.4 等模型上的成功率可达 0.927,并能推广到多种编程语言[8]。
此外,面向接口的黑盒指令后门与通过指令调优数据投毒植入的后门,也常被放在同一防御框架下评估,例如通过投毒仅 0.1% 的指令调优样本即可改变模型对特定话题的情感倾向[6][7]。
局限
平台侧防御尚不理想。句子级意图分析在 GPT-3.5 与 GPT-4 上能取得很高的检测成功率,但误报率仍然可观;按当时约 300 万个 GPTs 估算,5.8% 的误报率意味着近 17.4 万个应用可能被错误标记,影响实际部署[4]。
用户侧防御的能力也有限。基于离群词检测的方法对词级攻击有一定效果,但对触发器并非单个词语的语义级攻击基本无效[4]。插入要求忽略特殊指令的防御指令可以压低多数情形下的攻击成功率,但对 GPT-3.5 上的词级攻击只把成功率从 0.998 降到 0.985,语义级攻击平均也只能从 0.980 降到 0.617,因此只算部分有效[4]。
后门一旦被激活,仅靠检测输入往往不足以恢复正确输出,现有的基于提示的防御通常只能发现中毒输入[7]。自动化生成的触发器往往具有合法的语法形式,使基于困惑度的词元异常检测难以奏效[8]。
就攻击本身而言,它也存在前提:攻击者必须能够左右定制应用的提示或指令调优数据,而且只有输入满足预定义条件时后门才会显现[2]。当触发器被替换或输入不含触发条件时,异常行为不会出现,这也使评估与取证变得更困难[8]。
参见
参考资料
- Instruction Backdoor Attacks Against Customized {LLMs} . usenix.org [引用日期2026-09-29]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
- aclanthology.cn 上的网页 . aclanthology.cn [引用日期2026-09-29]
- instruction-following capacity . usenix.org [引用日期2026-09-29]
- Instruction Backdoor . csiro.au [引用日期2026-09-29]
- neurips.cc 上的网页 . neurips.cc [引用日期2026-09-29]
- aclanthology.org 上的网页 . aclanthology.org [引用日期2026-09-29]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
- ieee.org 上的网页 . ieee.org [引用日期2026-09-29]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-29]
浏览次数:0 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-09-29T12:51:14Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。