输出还没开始比较,数据边界已经失控

一名研究生准备比较几个 AI 对简历和研究材料的摘要效果。最省事的做法,是把原始文件直接放进请求;但文件里不仅有姓名、电话和邮箱,还有学号、内部项目名和不影响摘要判断的身份信息。模型还没有返回结果,测试已经带入了不必要的数据。

这是一则典型隐私安全场景推演,不代表真实用户或事故。问题不是“真实材料一定不能测试”,而是测试是否只保留了完成任务和判断输出所必需的字段。低成本试错不应以扩大个人信息暴露为代价;安全可控也需要具体落到样本、Key、预算和记录。

先做字段盘点:必须、可替代、与判断无关

把输入字段分成三类。第一类是完成任务必须保留的信息,例如确实影响岗位匹配的经历结构;第二类可以用占位符替代,例如姓名、公司名、项目名和具体日期;第三类与判断无关,应直接删除,例如电话、邮箱、家庭地址、身份证号和学号。

原始资料留在受控位置,另存一份测试样本。使用一致的占位符,例如“候选人 A”“公司 B”“项目 C”,保留任务难度和上下文关系,却不恢复真实身份。不要把原始资料、API Key 或完整请求日志写入公开仓库、共享截图和平台交接材料。

固定一份脱敏样本,再写验收标准

每个候选模型都使用同一份脱敏输入、同一输出格式和同一张验收表。简历任务可以检查经历是否保留、时间关系是否一致、是否编造能力、是否再次输出不该出现的敏感字段,以及人工修改量能否控制在预设范围内。

验收标准必须在第一条请求前写下,并把每项标为通过、不通过或需复核。测试中途不断修改输入,会让团队无法判断差异来自模型、提示词还是数据。固定样本让数据边界和输出质量都能被第二个人复核。

项目 Key 与原始资料分开,先做一条小额真实调用

为这次测试创建独立项目 Key 或项目标记,让请求用量、错误和其他任务分开。先查看当前公开渠道状态,再用小额请求和时间预算跑一条最小真实调用。记录实际模型、响应状态、可见用量、重试次数、验收结果和人工修改时间。

模型出现在列表中,只能说明它是候选,不代表当前 Key、endpoint 和任务一定能协同完成。相同错误重复出现、请求越过预算边界或输出违反验收规则时就停止,先保留错误和样本版本,再决定是否调整配置;不要用更多原始数据或无边界重试碰结果。

今天的最小行动:复制一份,再替换身份字段

https://APIToken.Company 可以作为多模型统一入口示例:查看模型广场和公开渠道状态,为测试创建独立 Key,用一份脱敏样本做小额真实调用,并保留用量与验收记录。具体模型、价格、分组和可用性以站内当前页面为准。

本文不承诺脱敏能消除所有隐私风险,也不把一次成功调用等同于可生产启用。最小行动只有一步:复制一份真实材料,把姓名、联系方式和内部名称替换为占位符,写下验收标准后,再决定是否花小额预算做一条可追踪的真实请求。

事实边界与来源

本文没有外部事实案例,全文为明确标注的典型隐私安全场景推演;不代表真实用户、事故、成交或费用结果,也不暗示任何案例使用过 APIToken。

先复制材料并删除身份字段,再用独立 Key、小额调用和用量记录验证一份脱敏样本。