指标体系
Agent 产品的指标体系要从“有没有使用”转向“有没有完成工作”。用户打开应用、发起任务、消耗 token,并不等于产品创造了价值。真正需要度量的是:Agent 做了多少任务,成功了多少,质量如何,最后是否产生了可解释的业务结果。
为什么传统使用指标不够
MAU、DAU、session 时长、消息数仍然有用,但它们只能说明用户在接触产品,不能说明 Agent 是否交付了工作。
一个用户每天发起 5 次任务但全部失败,表面上很活跃,实际上可能正在消耗成本、制造挫败和增加流失风险。另一个用户每周只用 1 次,但每次都完成关键流程,商业价值反而更高。
因此,Agent 指标的基本单位应该是任务,而不是消息、会话或打开次数。
三层指标
工作量
工作量说明 Agent 被要求做多少事。
| 指标 | 含义 |
|---|---|
| 任务发起数 | 用户向 Agent 提交了多少可执行请求 |
| 任务完成数 | Agent 完成了多少任务 |
| 每用户任务数 | 衡量需求渗透和使用深度 |
| 任务类型分布 | 哪些工作流最常被委托给 Agent |
工作量是基础,但不能单独作为成功信号。任务发起数上涨可能是需求增加,也可能是用户反复重试。
质量
质量说明 Agent 做得是否可靠。
| 指标 | 含义 |
|---|---|
| 成功率 | 发起任务中,最终达成目标的比例 |
| 首次成功率 | 不靠重试、不靠人工兜底就成功的比例 |
| HITL 介入率 | 需要人工确认、审核或接管的比例 |
| 恢复率 | 失败后通过重试、fallback 或人工接管救回的比例 |
| 返工率 | 用户或人工需要修改 Agent 输出的比例 |
质量指标必须和任务类型绑定。邮件分类、代码修改、客户退款、数据分析的“成功”标准不同,不能用一个全局成功率解释所有问题。
价值
价值说明 Agent 是否值得运行。
| 指标 | 含义 |
|---|---|
| 每个成功任务成本 | 成本除以成功任务数,而不是除以全部发起任务 |
| 节省人时 | Agent 替代或缩短的人工时间 |
| 每任务净价值 | 人工基线价值 − Agent 成本 − 审核成本 − 失败修正 |
| 客户可见 ROI | 客户能理解和复核的收益口径 |
| 毛利贡献 | 收入扣除推理、工具、运行时和人工成本后的贡献 |
价值层依赖 Agent 经济学:成本不只是 token,还包括工具、运行时、重试和人工审核。
指标之间的关系
这三层不能互相替代:
- 只看工作量,会鼓励团队推高任务数,哪怕任务失败。
- 只看质量,可能让团队过度保守,减少可自动化范围。
- 只看价值,容易忽略早期产品的学习信号和用户行为变化。
更实用的看板通常长这样:
任务量 → 成功率 → 每成功任务成本 → 单任务净价值 → 留存 / 扩张
也就是说,先确认需求存在,再确认能稳定完成,再确认每个成功结果的成本可控,最后才看能否带来长期收入。
章节导读
| 章节 | 主要问题 |
|---|---|
| 北极星指标 | 不同商业模式下,应该选哪个指标作为团队主目标? |
| 单位经济 | 每个用户、任务或合同是否真的赚钱?重度用户会不会吃掉毛利? |
与其他章节的边界
- economics 负责成本模型和 ROI 公式。
- metrics 负责把成本、质量和业务结果变成可运营的指标。
- operations 负责把这些指标落到监控、告警和运行面板。
这页有帮助吗? 谢谢反馈。