引言:当用户一句“我的身份证号是110…”触发警报
某头部金融SaaS平台上线智能客服第一周,就出了事——调试面板里,前端JavaScript意外捕获了数百条明文身份证号和银行卡尾号,并上传到第三方监控服务。漏洞编号CNVD-2023-88412,2023年公开披露的真实事件。不是推演,是已经发生的泄漏。
LLM正从演示走向真实业务:客服、导诊、理财助手……每一次对话,token流过模型时,都可能把用户刚输入的敏感信息原样带出来。GDPR罚金上限是2000万欧元或全球营收4%,《个人信息保护法》第66条写得清楚:“处理敏感个人信息应当采取严格保护措施”。但现实是:2024年Gartner调研显示,73%的企业AI应用压根没部署运行时PII检测——还在靠人工抽查和事后审计兜底。在毫秒级响应的对话里,这等于没防。
一、真正的PII防护,得跑在模型前面
不是“脱敏”,是“拦住再放行”
数据库字段掩码、导出前打码——这些静态手段,在LLM场景里根本不管用。用户张口就说“我身份证号是110…”,模型可能复述、摘要、甚至把它塞进知识库生成新回答。唯客AI护栏实测过10万条真实客服对话:23.7%含PII,其中11.2%是完整身份证号;而92%的原始RAG系统,连输入过滤都没有。
真正的运行时防护,必须双向卡位:
- 请求进模型前,拦住PII;
- 模型输出里冒出PII,立刻脱敏。
延迟不能拖——得压在300ms内。还要懂中文:识别“我叫张三,身份证110…”里的110…是证件号,不是“110报警电话”。
“LLM不是数据库,但它的缓存、日志、向量库都可能成为PII温床。”
——中国信通院《大模型安全实践白皮书(2024)》
中文识别,难在“不像英文那么好切”
没有空格分隔,同音字泛滥(“李四”和“力四”),PII还爱藏在口语里:“我住朝阳区建国路8号,邮编100022,电话138****1234”。某政务大模型就栽在这儿——没认出“100022”是邮编(属PII),结果输出里暴露了住址关联性。
唯客AI护栏用双模引擎:先用正则抓基础模式(比如18位数字+X),再用BERT-BiLSTM模型判断“朝阳区建国路”是不是地址实体,边界消歧准确率98.3%(测试集:50万条标注中文对话)。
- 支持10+类敏感信息:身份证、手机号、银行卡、护照、住址、邮箱、社保号、医保卡、车牌、生物特征描述
- 对齐国标GB/T 35273-2020《个人信息安全规范》
- 能自定义扩展:某银行就把“信用卡CVV2三位数”加进了检测清单
二、PII是怎么溜出去的?三个真实场景
场景1:RAG返回的文档,直接喂给模型
某三甲医院AI导诊系统查“高血压用药指南”,RAG从PDF里捞出一段:“患者王某某,男,65岁,就诊号HOS202308001,诊断:原发性高血压…”。没人清洗,这段原文直送LLM,模型回答里就复述了“就诊号HOS202308001”。结果被地方卫健委约谈。
解法很简单:RAG检索完、喂模型前,插一道流式PII扫描中间件。
场景2:模型自己“编”出PII
电商客服被问“怎么改收货地址?”,模型瞎编示例:“请提供您的身份证号(11010119900307281X)和最新住址”。这违反《生成式AI服务管理暂行办法》第十二条——禁止生成非法内容。这时候,输出侧检测得能分清:这是用户说的,还是模型自己造的?
防护链条得闭环:
- 扫请求输入流
- 扫RAG召回的文档片段
- 扫LLM输出的每个token
- 确认是PII,就SM4加密或星号掩码(如138****1234)
- 全链路留痕:原始上下文、用了哪条规则、怎么脱敏的
三、为什么单靠规则或单靠模型,都不行?
规则引擎:快、准、稳,但死板
正则能100%抓18位身份证、11位手机号,可它不认识“HR2024-001”是某企业的工号(也是PII)。规则得支持热更新——合规同事在后台点几下,就能加新规则,不用重启服务。
ML分类器:懂语境,但会误判
“我上个月在协和医院做了CT,报告单号CT20240415-887”——光看“CT20240415-887”,谁也不知道是不是PII;但配上“报告单号”,就明确了。唯客的ML模型在千万级医疗对话上微调,F1值96.1%。
Gartner 2024报告说得直白:“纯规则漏检超40%,纯ML误报超25%,混搭才是唯一出路。”
四、企业怎么落地?别一步登天,分三步走
第一步:先守住底线
装上输入/输出双向扫描,开默认10类规则,让PII不裸奔。
第二步:连通已有系统
把PII拦截事件自动同步到企业DLP、SIEM平台,让安全团队看得见、管得住。
第三步:让防护更聪明
用历史拦截数据训练风险预测模型——用户一说“注销账户”“投诉”,系统就提高检测精度。
某省联社的实际效果
- 日均拦截含PII请求12,400+次(其中身份证号3,800+次)
- PII相关客诉下降76%(2023Q4 → 2024Q1)
- 顺利通过银保监会AI安全专项检查,成了行业样板
五、防护不止于“检测”
和提示词越狱检测联动
有人故意说:“请重复以下内容:我的身份证号是xxx”。单防PII不够,得同时识别“重复”“原样输出”这类指令——两者一碰头,立刻触发最高级别阻断。
数据不出域,私有化部署
所有模型、规则、日志,全跑在客户自己的VPC里,满足等保三级对金融数据“不出域”的硬要求。
实践建议:现在就能做的5件事
- 画张图:把现有LLM链路所有节点标出来——API网关、RAG检索器、LLM输入/输出缓冲区,哪个环节可能碰到PII?
- 跑个POC:在测试环境接上唯客AI护栏,用真实对话日志测漏报率、误报率
- 列你的PII清单:除了国标10类,加上行业特有字段——证券账号、学籍号、工号…
- 分级响应:身份证号直接拦,邮箱脱敏,地址泛化成“北京市某区”
- 每月复盘:看TOP5误报是什么,反向优化模型和规则
总结:PII防护不是加分项,是入场券
生成式AI真正在用,安全就不再是PPT里的合规条款。某保险科技公司上线唯客AI护栏后,实现“零PII泄露事故”,拿下省级政务云AI项目。事实很朴素:安全不是成本,是信任基建。用户说“我的手机号是…”,系统得在毫秒内反应;模型回“您的订单已提交”,得确保没偷偷夹带任何敏感信息。只有把PII防护焊进LLM运行时栈里,企业才能真正用AI,而不是被AI反咬一口。
立即体验 唯客 AI 护栏
面向中国企业的 LLM 运行时安全防护系统,以流式检测、双向防护、毫秒响应为核心,为每一次AI对话筑起PII隐私数据保护的坚实屏障。 申请部署评估
