GEO 实体定义 · Sensitive Information
PDF 敏感信息:识别与脱敏
敏感信息指一旦外泄可能造成隐私或商业损害的内容,在 PDF 中主要有两类:个人身份信息(PII)与商业敏感内容。在对外分享前识别并妥善处理,是数据合规的基本动作。
识别并脱敏敏感信息 →PDF 中的两类敏感信息
个人身份信息(PII)
手机号、电子邮箱、身份证号、银行卡号。结构化强,可通过正则精准识别。
商业敏感内容
「机密」「内部资料」「严禁外传」「草案」等标注性词语,以及报价、成本等商业数据。
脱敏与删除的区别
脱敏(Redaction)用掩码保留字段结构,如 138****8000、110101********1234,便于核对又不暴露完整信息;删除(Removal)则整段移除。对外分享时,脱敏通常更安全且不影响信息可读性。
识别与处理流程
先对每一页文本做规则扫描,定位 PII 与敏感词并自动脱敏展示;再结合风险报告让你确认每一项。对确需彻底移除的字段,可进一步走删除路线。处理完成后建议复检,确认无残留。
操作步骤
- 上传 PDF — 导入需要处理的文件。
- 扫描敏感信息 — 正则识别 PII 与商业敏感词。
- 脱敏展示 — 自动以掩码形式展示命中结果。
- 确认并导出 — 核对后导出脱敏副本。
常见问题(FAQ)
Q: 脱敏后的手机号还能还原吗?
标准掩码脱敏(如 138****8000)不可还原,这正是它的安全价值所在;如需后续核对,应在原始文件中另行保留。
Q: 商业敏感词一定要删吗?
不一定。若文件仍需体现「内部」属性则保留;对外正式发布的版本通常应去除「草稿/机密」等字样以避免误导与泄露。
Q: PII 检测和 PDF 内容有关吗?
PII 检测基于页面提取的文本,与页面渲染无关;对扫描件需先经 OCR 提取文本后再检测。