引言
企业正大规模上线大模型应用,但一个被反复忽视的现实是:用户随手输入的对话里,常常夹杂着身份证号、手机号、银行卡号、住址、病历摘要、合同条款……这些信息一旦不加处理就喂给模型,轻则违反《个人信息保护法》第21条——“不得向他人提供其处理的个人信息”,重则让模型记住敏感数据、放大提示词攻击风险,甚至招来监管通报。中国信通院《2024大模型安全实践白皮书》提到,73.6%的企业AI对话系统存在PII泄露隐患,其中超过四成的问题出在前端没做输入过滤,而不是模型本身。有省级政务客服上线第一个月,就因为用户咨询里带了真实身份证号,模型在回复中不小心原样回显,被网信办约谈整改;还有一家金融SaaS厂商,客服机器人把用户上传的营业执照OCR结果里的统一社会信用代码直接写进日志,导致两千多条敏感信息外泄。这不是运气差,而是缺乏真正可用的PII防护能力。
一、PII识别:不能只靠正则,得看懂人在说什么
1.1 真实对话里的PII,根本不像教科书里写的那样规整
它常常是碎片化的:“我身份证后四位是****,麻烦查下订单”;是掩码式的:“张经理电话138****5678”;是嵌套在句子里的:“地址在杭州市西湖区文三路XXX号(邮编310012)”。这种表达方式,让纯靠正则匹配的系统疲于奔命——误报率62%,漏报率38%(CNVD-AI-2024 Q1测试集)。真正的识别,得结合命名实体识别(NER)、上下文指代消解,还要能跨字段推理。比如用户说“我刚用尾号5678的卡付了款”,系统得翻回去找前几轮有没有出现过手机号或银行卡号,才能判断这个“5678”是不是可还原的敏感片段。
1.2 图片里也藏PII,而且更难发现
现在用户不光发文字,还会传B超图、手写作业照片、证件扫描件。一张B超截图角落可能带患者姓名和检查日期;学生证一角露在作业照片边缘;营业执照上的统一社会信用代码清清楚楚。这时候光靠文本识别已经不够,得配上OCR+图像区域敏感信息定位。唯客AI护栏目前支持身份证、驾驶证、社保卡、营业执照、病历单、银行回单等十多种证件图像的跨模态识别,内部红队测试F1-score达99.2%。
1.3 不同行业,对“敏感”的定义完全不同
“住院号”在医院是强PII,在酒店预订系统里可能只是普通订单号;“工号”在国企要严管,在互联网公司未必算敏感。所以一套死板的黑白名单行不通。系统得能热加载动态词典,按需切换策略包——比如金融模式、医疗模式、政务模式,或者直接套用GB/T 35273-2020标准。
二、脱敏不是打码,是保留业务价值的精细活
2.1 打星号容易,但会把业务逻辑一起抹掉
“订单号SH20240517-8892”如果全打成“”,后续工单就断链了;“北京朝阳区建国路8号”变成“”,地图服务就废了一半。专业脱敏得分类处理:结构化字段(比如身份证第7-14位替换成“19900101”),非结构化上下文(比如“我住在北京市朝阳区”改成“我住在某直辖市某行政区”)。
2.2 有些场景必须能“还原”,但得可控
风控复核、审计回溯时,需要知道原始数据是什么。这时就得用密钥托管式可逆脱敏(比如AES-256加密哈希),脱敏记录只对授权人员开放。唯客AI护栏会在每个脱敏token里埋水印,带上策略ID和时间戳,满足等保2.0三级的日志要求。
2.3 大模型对话等不了两秒
批处理式脱敏动辄两秒起步,根本没法用。我们做的双向I/O防护,是在token流里实时标注PII位置,输出阶段在生成完成前就完成语义感知脱敏,端到端延迟压在300ms以内——这才是兼顾安全与体验的底线。
三、防护不能只守一道门,得贯穿整个AI流程
3.1 输入侧:拦得住,也得问得清
- API网关层先跑轻量检测,明文身份证号这类高置信度PII直接拒掉;
- 遇到模糊表述,比如“我的卡号是前面六位”,不急着拦截,先弹个确认:“您是指哪张卡?需要帮您查余额吗?”;
- 还得看上下文——连续三轮提到同一个手机号,基本可以认定是真实信息,该记该脱敏就别手软。
3.2 模型侧:让模型自己长点记性
- System Prompt里明确写死:“你不得处理、记忆或生成任何含身份证号、银行卡号、生物特征等PII的内容”;
- 用LoRA微调,在训练里加入PII识别损失函数,逼模型学会绕开敏感词;
- 评估集里专门塞进PII泄漏测试题,比如PII-LeakBench基准,真刀真枪练。
3.3 输出侧:最后一步,也最容易翻车
“90%的PII泄露发生在模型输出阶段,而非输入采集环节。”
——中国人工智能产业发展联盟(AIIA)《2024大模型安全治理年报》
四、看不见的防护,不如不防
- 全链路仪表盘盯住几个关键数:PII检出率、脱敏覆盖率、策略命中TOP5、误报/漏报趋势;
- 支持按部门、业务线、模型版本下钻,比如发现某客服Bot漏检率达12.7%,立马定位是规则没覆盖新话术,还是OCR没适配新格式;
- 合规报告自动生成,GB/T 35273、DSAR响应时效、DPO审计项全在里面,不用人工凑。
实践建议
- 别等出事再盘点——马上扫一遍所有AI接口、知识库、训练语料,标出PII在哪、密度多高;
- 运行时防护优先选能私有化部署、支持流式检校、规则引擎还能自己写的方案;
- 定PII响应SLA:高风险PII必须50ms内阻断,中风险200ms内脱敏;
- 每季度拉一次红蓝对抗,用PII-Fuzzer造一批刁钻样本,试试防线到底脆不脆。
总结
PII从来不是数据治理的收尾工作,而是AI落地的第一道门槛。在大模型时代,它早已不是“要不要做”的合规选项,而是“不做就停摆”的生存刚需。指望加一条正则就想过关,早就不够用了。真正管用的方案,得把NLP、OCR、规则引擎和可观测性拧在一起,一层一层扎进去。只有让PII防护成为AI基础设施的出厂设置,才敢说一句:我们的AI,既安全,又可信。
立即体验 唯客 AI 护栏
面向中国企业的 LLM 运行时安全防护系统,以流式检测、双向防护与毫秒响应为核心,为企业每一次AI对话筑起包含PII隐私数据保护在内的全维度安全防线。
申请部署评估
