内容边界、越狱与数据卫生

进阶06-安全与对抗⏱ 25 分钟已审校
学习进度:

一句话定义

越狱(Jailbreak)是对抗模型安全对齐以获取违规内容的攻击,数据卫生是防止敏感信息经上下文进出的运营纪律——两者共同构成提示系统的内容与隐私责任面。

为什么重要

注入(提示注入:直接与间接攻击)劫持的是任务行为,越狱攻击的是安全边界本身;而数据卫生是最常被忽视的事故源——开发期把用户真实数据贴进提示调试、把内部定价写进系统提示又被套出,都是合规级事故。本知识点把"内容责任"与"数据责任"整理为可执行的清单,因为这两类问题的代价(监管、诉讼、信任)远高于功能故障。

前置知识

直观类比

数据卫生像后厨的生熟分开:不是因为它会让菜更好吃,而是出一次事故就关门。生数据(真实用户信息)不该进熟食区(上下文/日志),一旦混进去就不是"冲洗一下"能解决的。

图示

责任分层:
模型层   安全对齐、对抗攻击防御        → 厂商
应用层   场景内容边界、标准话术、输出检测 → 你
数据层   脱敏/最小化/分级/留痕/记忆合规  → 你
原则:进入上下文 = 即将外发(日志/提供商/可能被复述)

核心概念

  • 越狱(Jailbreak):通过角色扮演、虚构框架、渐进诱导、编码转译等手法绕过模型安全对齐,获取本应拒绝的内容。
  • 对齐边界:模型厂商训练形成的拒绝行为,位于模型层——应用层提示只能"补充约束",无法"解除"也无法完全依赖。
  • 数据卫生(Data Hygiene):关于"什么数据可以进入上下文、什么数据可以留存"的纪律:脱敏、最小化、分级、留痕。
  • 上下文即数据通道:你放进上下文的一切(用户数据、内部文档、密钥占位符)都可能被复述、被泄露样本套取、被日志留存——上下文要当作"即将外发的数据"对待。
  • 记忆合规:长期记忆(记忆与状态:会话内记忆、外部记忆与状态注入)涉及用户知情、可查看、可删除的义务。

原理与机制

三个层面的责任划分:

  1. 模型层(厂商责任):安全对齐由厂商维护,对抗性攻击(如自动生成的后缀攻击)是厂商与攻击者的军备竞赛——应用方应跟踪模型更新,但不必也不可能自己解决;
  2. 应用层(你的责任):场景化内容边界(医疗/法律免责声明)、敏感话题的标准话术、输出侧的内容检测——这些是 拒答、越权与边界控制 边界控制在内容域的延伸;
  3. 数据层(你的责任):进入上下文前脱敏(姓名→用户 A,真实单号→测试单号);系统提示中不放密钥与内部端点;调试环境与生产数据隔离;日志与缓存的留存策略明示。

数据卫生的一条铁律:凡是写进上下文的,就假设它会出现在日志、缓存、模型提供商侧,并且可能被复述。用这个假设倒推"什么不该放进去"。

公式或模型

本节不适用——内容与隐私风险用清单审计与事件演练管理,不做量化模型。

实例或案例

案例:调试环境的越界数据。 症状:工程师为调试客服提示,把含真实手机号与订单记录的用户工单直接贴进开发环境提示,工单文本随后进入了第三方日志系统。操作步骤(整改):① 制定数据分级:生产 PII(个人身份信息)禁止进入非生产环境;② 提供脱敏工具(正则替换姓名/手机号/单号为占位符);③ 系统提示清理:移除内部接口路径与真实密钥引用,改用占位说明;④ 记忆合规:长期记忆增加"可查看/可删除"入口并在隐私条款中声明(记忆与状态:会话内记忆、外部记忆与状态注入);⑤ 复盘进 checklist,纳入评审。脱敏示例:

原句:张伟 13812345678 的订单 A10293 丢了发票
脱敏:用户A 138****5678 的订单 {ORDER_ID} 丢了发票

排错清单:

  • 症状:输出复述了上下文中的他人隐私 → 数据最小化失败;会话上下文只注入当前用户授权的数据;
  • 症状:用户诱导输出系统提示里的内部信息 → 系统提示不该放秘密(密钥、内网地址),秘密放配置层不进上下文;
  • 症状:应用层拒答话术与模型层拒绝冲突(模型拒了应用又放行)→ 场景边界条款要与目标模型的拒绝风格对齐测试。

常见误区

  • "脱敏是法务的事":数据进出上下文的每一个工程决策(贴什么进提示、记什么日志)都是工程责任;
  • 在系统提示里藏秘密:提示会被泄露样本套取、被日志留存——秘密永远不放上下文;
  • 把越狱当应用方 bug:越狱突破的是模型层对齐,应用方的义务是场景边界 + 输出检测 + 事件上报,而不是自己修补对齐。

自测题

  1. "写进上下文的数据"应抱有什么假设?

答:假设它会进入日志与提供商侧、且可能被复述——以此倒推什么数据不该进上下文。

  1. 越狱与提示注入的防护责任有何不同?

答:越狱主要属模型层对齐(厂商),应用方做场景边界与输出检测;注入的防御主体在应用方的架构与流程。

  1. 长期记忆功能的三项合规义务?

答:用户知情(声明记忆行为)、可查看、可删除——并配合最小化写入判据。

与其他知识点的关系

提示注入:直接与间接攻击/注入防御:隔离、最小权限与输出侧防护 是行为安全的攻与防;拒答、越权与边界控制 的边界契约在内容域的延伸即本条的应用层清单;记忆与状态:会话内记忆、外部记忆与状态注入 的记忆设计承担本条的记忆合规要求。

延伸阅读

  • 论文:Universal and Transferable Adversarial Attacks on Aligned Language Models(Zou et al., 2023)——对抗攻击对齐模型的代表工作;
  • 行业清单:OWASP Top 10 for LLM Applications——敏感信息泄露与不当内容条目。

来源

  • Universal and Transferable Adversarial Attacks on Aligned Language Models (Zou et al.
  • 2023)
  • OWASP Top 10 for LLM Applications