数据回流与训练

问题概述

企业客户问“我们的数据会不会被用于训练 AI 模型”时,通常不是只问训练。他们在问整条数据回流链:

  • prompt、附件、工具结果和 output 是否会进入上游模型训练;
  • API 供应商是否会保留 prompt/output,保留多久;
  • 产品方员工或供应商人员能否人工查看内容;
  • 失败样本、用户反馈和人工修正是否会进入 eval 或微调数据集;
  • 文件、batch、web search、code execution、prompt cache 等功能是否有不同保留规则;
  • 客户删除数据后,向量索引、缓存、日志、备份和评估样本是否同步清理。

只回答“不会训练”是不够的。AI 产品需要把训练用途、保留用途、人工访问、内部改进四件事拆开讲。

四类数据使用

问题含义客户最关心什么需要的控制
模型训练数据进入通用模型训练、微调或偏好训练商业秘密会不会进入下一代模型合同禁止、默认不训练、明确 opt-in
数据保留prompt/output、文件、任务结果是否被保存保存多久、能否删除、谁负责删除保留期、删除流程、备份清理
人工访问内部员工或供应商人员能否查看内容是否有人能看敏感文档、客户名单、合同RBAC、审批、break-glass、访问日志
内部改进生产轨迹是否用于 eval、debug、产品分析错误样本会不会被复制到另一个数据集脱敏、抽样、授权、数据集隔离

这四类要分别承诺。比如“API 输入不用于训练”不等于“没有 30 天滥用监控日志”,也不等于“文件 API 零保留”。

供应商现状:不要只看品牌

以下是截至 2026 年可从官方文档核对到的典型模式。它们不是永久承诺,实际销售材料应以最新合同和供应商控制台配置为准。

供应商 / 场景训练用途默认保留 / 功能差异需要向客户说明
OpenAI APIOpenAI 表示自 2023-03-01 起,API 数据默认不用于训练,除非客户显式 opt inAPI 仍可能产生 abuse monitoring logs,默认最长 30 天;部分功能会保存 application state区分“训练”与“保留”;列出哪些 endpoint 或功能会保存状态
OpenAI 企业 / ChatGPT 企业类产品企业数据通常不用于训练,具体以产品和合同为准可能有工作区、文件、连接器、审计等产品状态API、ChatGPT 企业产品、消费者 ChatGPT 不能混为一谈
Anthropic API 标准保留Anthropic 商业政策说明 retained data 未经明确许可不用于训练Anthropic API 标准输入输出通常在后端 30 天内删除,法律/安全策略例外标准保留不是 ZDR;需要说明 30 天窗口和例外
Anthropic ZDRZDR 下 API response 返回后不在静态存储保留 prompt/responseZDR 按组织启用,且只覆盖符合条件的功能;batch、Files API、MCP connector、code execution 等可能不符合 ZDR必须按功能列 ZDR eligibility,不能笼统说“Claude 零保留”
Anthropic HIPAA-ready只覆盖符合 HIPAA eligibility 的功能使用不符合 HIPAA 的功能时可能被阻止或不应处理 PHI医疗场景要按功能 gate,而不是只签 BAA
云厂商托管模型数据处理者可能是云厂商而不是模型公司保留、区域、日志和合规控制取决于云平台Bedrock、Vertex、Azure 等要看云平台自己的条款
私有部署 / 专属环境通常由客户或产品方控制训练和保留能力、成本、升级和运维责任转移不等于天然合规,仍需日志、访问、删除、模型更新策略

这张表的作用是提醒团队:供应商选择不是合规结论,功能级数据控制才是结论。

功能级保留矩阵

企业尽调时,建议维护一张按功能拆分的矩阵:

功能是否可能保存客户内容典型保存原因需要承诺什么
普通推理请求可能有短期监控日志滥用监控、调试、法律要求是否训练、最长保留期、删除/例外
Prompt caching可能保存 cache 表示或 hash,不一定保存明文降低重复前缀成本和延迟cache TTL、是否跨租户隔离、是否可禁用
文件上传是文件解析、后续引用、检索文件保存期、删除 API、索引清理
Batch是异步排队、结果下载、失败重试结果保留期、自动清理、失败数据处理
Code execution是沙箱输入、输出文件、运行状态沙箱隔离、网络限制、产物清理
Web search / fetch可能查询、网页内容、第三方请求日志第三方边界、URL/查询保留、外部内容不可信
MCP / 第三方工具取决于工具工具方执行和日志sub-processor、OAuth scope、工具方数据政策
人工支持 / 质检是排障、质量复核、客户支持访问审批、脱敏、客户授权、访问日志
Eval / fine-tune 数据集是,若采样质量改进、回归测试、后训练opt-in、去标识化、删除同步、数据集版本

这张表要和产品功能发布流程绑定。每启用一个新工具或新模型能力,都要更新数据保留说明。

合同层

客户合同、供应商合同和 DPA 中至少要覆盖:

  • customer data 是否包含 prompt、output、附件、工具返回、memory、日志和反馈;
  • 禁止未经授权将 customer data 用于训练、微调或改进通用模型;
  • 是否允许为安全、滥用监控、故障排查保留数据,以及保留多久;
  • 人工访问的审批、目的、最小权限和审计;
  • 删除请求如何传递到供应商、索引、缓存、备份和评估样本;
  • sub-processor 变更通知期;
  • 跨境传输机制;
  • 医疗、金融、政府等场景的附加条款。

不要只把“不训练”写在官网 FAQ 里。客户真正需要的是合同可执行、配置可验证、日志可审计。

配置层

技术配置必须和合同一致:

  • 在供应商控制台启用可用的数据保留、训练关闭、区域、ZDR、HIPAA-ready 等设置;
  • 将客户级 retention policy 写入租户配置;
  • 日志分层:审计日志、调试日志、产品分析、评估样本分开存;
  • 对敏感字段做 redaction/tokenization;
  • feedback 进入 eval 或训练候选集前要求 opt-in 或合同授权;
  • 删除流程同时处理原始任务、附件、向量索引、缓存、派生样本和备份;
  • 供应商切换、模型切换、功能启用时重新跑 data-control review。

一个常见失败模式是:销售承诺 ZDR,但产品启用了不在 ZDR 覆盖范围内的文件、batch、code execution 或第三方 connector。合规设计要按 feature gate 控制,而不是靠口头解释。

证据层

企业客户尽调时,最有说服力的是可复核证据:

  • 当前供应商政策链接;
  • DPA / BAA / 企业合同摘录;
  • data-control 控制台截图或配置导出;
  • sub-processor 清单;
  • 数据流图;
  • 数据保留矩阵;
  • 访问审批和访问日志样例;
  • 删除请求执行记录;
  • eval 数据集采样和脱敏流程;
  • 内部员工安全培训与权限审查记录。

客户答复模板

问:我们的数据会被用于训练 AI 模型吗?

答:不会超出合同约定用途。我们把“训练”“保留”“人工访问”
和“内部改进”分开控制:

1. 训练:我们与上游模型供应商约定,未经客户授权,客户数据不得用于
   训练、微调或改进通用模型。我们也不会把客户生产数据放入自己的训练
   或 eval 数据集,除非合同允许或客户 opt in。

2. 保留:不同功能的保留规则不同。普通推理、文件、batch、code execution、
   web search、prompt cache 和人工支持都有单独保留表。我们可提供当前版本。

3. 人工访问:员工访问客户内容需要审批,按最小权限执行,并记录访问日志。
   break-glass 访问会单独留痕。

4. 删除:客户删除数据后,我们会按流程处理原始任务、附件、索引、缓存、
   日志和派生样本;备份清理遵循合同约定周期。

我们可在尽调中提供供应商条款、DPA/BAA(如适用)、sub-processor 清单、
数据流图、保留矩阵和配置证明。

公有 API、专属环境与私有部署

方案优点风险适用
公有 API + 标准配置上线快、能力最新、成本低标准保留和功能差异需要解释普通企业场景、低敏数据
公有 API + 企业合同/ZDR/区域控制能力与合规平衡需要按功能确认 coverage多数 B2B enterprise
云厂商托管模型区域、IAM、采购路径更熟悉数据处理责任转到云厂商条款已深度使用 AWS/Azure/GCP 的客户
专属环境更强隔离和自定义控制成本、运维、升级复杂大客户、强隔离要求
客户侧私有部署数据边界最清晰模型能力、GPU、升级、安全运营压力大政府、金融核心系统、极高敏感数据

私有部署不是默认答案。很多客户真正需要的是:数据流清楚、供应商条款明确、功能级保留可验证、删除和审计可执行。

与其他章节的衔接

参考资料

这页有帮助吗?