数据回流与训练
问题概述
企业客户问“我们的数据会不会被用于训练 AI 模型”时,通常不是只问训练。他们在问整条数据回流链:
- prompt、附件、工具结果和 output 是否会进入上游模型训练;
- API 供应商是否会保留 prompt/output,保留多久;
- 产品方员工或供应商人员能否人工查看内容;
- 失败样本、用户反馈和人工修正是否会进入 eval 或微调数据集;
- 文件、batch、web search、code execution、prompt cache 等功能是否有不同保留规则;
- 客户删除数据后,向量索引、缓存、日志、备份和评估样本是否同步清理。
只回答“不会训练”是不够的。AI 产品需要把训练用途、保留用途、人工访问、内部改进四件事拆开讲。
四类数据使用
| 问题 | 含义 | 客户最关心什么 | 需要的控制 |
|---|---|---|---|
| 模型训练 | 数据进入通用模型训练、微调或偏好训练 | 商业秘密会不会进入下一代模型 | 合同禁止、默认不训练、明确 opt-in |
| 数据保留 | prompt/output、文件、任务结果是否被保存 | 保存多久、能否删除、谁负责删除 | 保留期、删除流程、备份清理 |
| 人工访问 | 内部员工或供应商人员能否查看内容 | 是否有人能看敏感文档、客户名单、合同 | RBAC、审批、break-glass、访问日志 |
| 内部改进 | 生产轨迹是否用于 eval、debug、产品分析 | 错误样本会不会被复制到另一个数据集 | 脱敏、抽样、授权、数据集隔离 |
这四类要分别承诺。比如“API 输入不用于训练”不等于“没有 30 天滥用监控日志”,也不等于“文件 API 零保留”。
供应商现状:不要只看品牌
以下是截至 2026 年可从官方文档核对到的典型模式。它们不是永久承诺,实际销售材料应以最新合同和供应商控制台配置为准。
| 供应商 / 场景 | 训练用途 | 默认保留 / 功能差异 | 需要向客户说明 |
|---|---|---|---|
| OpenAI API | OpenAI 表示自 2023-03-01 起,API 数据默认不用于训练,除非客户显式 opt in | API 仍可能产生 abuse monitoring logs,默认最长 30 天;部分功能会保存 application state | 区分“训练”与“保留”;列出哪些 endpoint 或功能会保存状态 |
| OpenAI 企业 / ChatGPT 企业类产品 | 企业数据通常不用于训练,具体以产品和合同为准 | 可能有工作区、文件、连接器、审计等产品状态 | API、ChatGPT 企业产品、消费者 ChatGPT 不能混为一谈 |
| Anthropic API 标准保留 | Anthropic 商业政策说明 retained data 未经明确许可不用于训练 | Anthropic API 标准输入输出通常在后端 30 天内删除,法律/安全策略例外 | 标准保留不是 ZDR;需要说明 30 天窗口和例外 |
| Anthropic ZDR | ZDR 下 API response 返回后不在静态存储保留 prompt/response | ZDR 按组织启用,且只覆盖符合条件的功能;batch、Files API、MCP connector、code execution 等可能不符合 ZDR | 必须按功能列 ZDR eligibility,不能笼统说“Claude 零保留” |
| Anthropic HIPAA-ready | 只覆盖符合 HIPAA eligibility 的功能 | 使用不符合 HIPAA 的功能时可能被阻止或不应处理 PHI | 医疗场景要按功能 gate,而不是只签 BAA |
| 云厂商托管模型 | 数据处理者可能是云厂商而不是模型公司 | 保留、区域、日志和合规控制取决于云平台 | Bedrock、Vertex、Azure 等要看云平台自己的条款 |
| 私有部署 / 专属环境 | 通常由客户或产品方控制训练和保留 | 能力、成本、升级和运维责任转移 | 不等于天然合规,仍需日志、访问、删除、模型更新策略 |
这张表的作用是提醒团队:供应商选择不是合规结论,功能级数据控制才是结论。
功能级保留矩阵
企业尽调时,建议维护一张按功能拆分的矩阵:
| 功能 | 是否可能保存客户内容 | 典型保存原因 | 需要承诺什么 |
|---|---|---|---|
| 普通推理请求 | 可能有短期监控日志 | 滥用监控、调试、法律要求 | 是否训练、最长保留期、删除/例外 |
| Prompt caching | 可能保存 cache 表示或 hash,不一定保存明文 | 降低重复前缀成本和延迟 | cache TTL、是否跨租户隔离、是否可禁用 |
| 文件上传 | 是 | 文件解析、后续引用、检索 | 文件保存期、删除 API、索引清理 |
| Batch | 是 | 异步排队、结果下载、失败重试 | 结果保留期、自动清理、失败数据处理 |
| Code execution | 是 | 沙箱输入、输出文件、运行状态 | 沙箱隔离、网络限制、产物清理 |
| Web search / fetch | 可能 | 查询、网页内容、第三方请求日志 | 第三方边界、URL/查询保留、外部内容不可信 |
| MCP / 第三方工具 | 取决于工具 | 工具方执行和日志 | sub-processor、OAuth scope、工具方数据政策 |
| 人工支持 / 质检 | 是 | 排障、质量复核、客户支持 | 访问审批、脱敏、客户授权、访问日志 |
| Eval / fine-tune 数据集 | 是,若采样 | 质量改进、回归测试、后训练 | opt-in、去标识化、删除同步、数据集版本 |
这张表要和产品功能发布流程绑定。每启用一个新工具或新模型能力,都要更新数据保留说明。
合同层
客户合同、供应商合同和 DPA 中至少要覆盖:
- customer data 是否包含 prompt、output、附件、工具返回、memory、日志和反馈;
- 禁止未经授权将 customer data 用于训练、微调或改进通用模型;
- 是否允许为安全、滥用监控、故障排查保留数据,以及保留多久;
- 人工访问的审批、目的、最小权限和审计;
- 删除请求如何传递到供应商、索引、缓存、备份和评估样本;
- sub-processor 变更通知期;
- 跨境传输机制;
- 医疗、金融、政府等场景的附加条款。
不要只把“不训练”写在官网 FAQ 里。客户真正需要的是合同可执行、配置可验证、日志可审计。
配置层
技术配置必须和合同一致:
- 在供应商控制台启用可用的数据保留、训练关闭、区域、ZDR、HIPAA-ready 等设置;
- 将客户级 retention policy 写入租户配置;
- 日志分层:审计日志、调试日志、产品分析、评估样本分开存;
- 对敏感字段做 redaction/tokenization;
- feedback 进入 eval 或训练候选集前要求 opt-in 或合同授权;
- 删除流程同时处理原始任务、附件、向量索引、缓存、派生样本和备份;
- 供应商切换、模型切换、功能启用时重新跑 data-control review。
一个常见失败模式是:销售承诺 ZDR,但产品启用了不在 ZDR 覆盖范围内的文件、batch、code execution 或第三方 connector。合规设计要按 feature gate 控制,而不是靠口头解释。
证据层
企业客户尽调时,最有说服力的是可复核证据:
- 当前供应商政策链接;
- DPA / BAA / 企业合同摘录;
- data-control 控制台截图或配置导出;
- sub-processor 清单;
- 数据流图;
- 数据保留矩阵;
- 访问审批和访问日志样例;
- 删除请求执行记录;
- eval 数据集采样和脱敏流程;
- 内部员工安全培训与权限审查记录。
客户答复模板
问:我们的数据会被用于训练 AI 模型吗?
答:不会超出合同约定用途。我们把“训练”“保留”“人工访问”
和“内部改进”分开控制:
1. 训练:我们与上游模型供应商约定,未经客户授权,客户数据不得用于
训练、微调或改进通用模型。我们也不会把客户生产数据放入自己的训练
或 eval 数据集,除非合同允许或客户 opt in。
2. 保留:不同功能的保留规则不同。普通推理、文件、batch、code execution、
web search、prompt cache 和人工支持都有单独保留表。我们可提供当前版本。
3. 人工访问:员工访问客户内容需要审批,按最小权限执行,并记录访问日志。
break-glass 访问会单独留痕。
4. 删除:客户删除数据后,我们会按流程处理原始任务、附件、索引、缓存、
日志和派生样本;备份清理遵循合同约定周期。
我们可在尽调中提供供应商条款、DPA/BAA(如适用)、sub-processor 清单、
数据流图、保留矩阵和配置证明。
公有 API、专属环境与私有部署
| 方案 | 优点 | 风险 | 适用 |
|---|---|---|---|
| 公有 API + 标准配置 | 上线快、能力最新、成本低 | 标准保留和功能差异需要解释 | 普通企业场景、低敏数据 |
| 公有 API + 企业合同/ZDR/区域控制 | 能力与合规平衡 | 需要按功能确认 coverage | 多数 B2B enterprise |
| 云厂商托管模型 | 区域、IAM、采购路径更熟悉 | 数据处理责任转到云厂商条款 | 已深度使用 AWS/Azure/GCP 的客户 |
| 专属环境 | 更强隔离和自定义控制 | 成本、运维、升级复杂 | 大客户、强隔离要求 |
| 客户侧私有部署 | 数据边界最清晰 | 模型能力、GPU、升级、安全运营压力大 | 政府、金融核心系统、极高敏感数据 |
私有部署不是默认答案。很多客户真正需要的是:数据流清楚、供应商条款明确、功能级保留可验证、删除和审计可执行。
与其他章节的衔接
- 合规入口和 trust packet:overview
- 私有部署对单位经济的影响:metrics/unit-economics
- 合规客户的定价分层:pricing/tier-design
参考资料
这页有帮助吗? 谢谢反馈。