博客
研究 2026年8月11日 12 分钟阅读 原创

想法不稀缺,难的是验证信号并沉淀为系统

AI 时代,很多方向会变得越来越显而易见。真正拉开差距的,不是谁先说出了 idea,而是谁能定义问题、过滤噪音、建立可验证的执行系统,并在 long-horizon 任务里持续把事做成。

J

Jonathan

创始人

有一句话听起来很刺耳,但在 AI 时代会越来越真实:

想法不稀缺。

想法的稀缺性正在下降,不是因为想法不重要,而是因为很多方向会变得越来越显而易见。该做大模型,该做 Agent,该做记忆,该做上下文工程,该让 AI 进入真实工作流。只要站在这条浪潮里,很多人都会看到相似的机会。

难的不是把方向说出来,而是把方向定义清楚,并把它变成可验证的系统。更难的是,在模型公司、竞品、组织惯性和技术不确定性同时逼近时,仍然保持推进能力。

AI 时代仍然需要想象力,但执行力会更快拉开差距。因为当所有人都能更快地产生方案、写代码、搭 demo、做原型时,差距会从“谁有 idea”转移到“谁能把同一个显而易见的方向做成可运行的系统”。

问题定义要清晰到可以被反驳

我们常常太急着解问题,却很少停下来问:这个问题被定义清楚了吗?

做 Agent 尤其如此。很多失败看起来像模型不够强,实际是问题没有被定义清楚。“让 Agent 帮用户完成工作”不是一个足够好的定义。它至少需要明确目标、输入、成功标准、权限边界、上下文不足时的处理策略,以及工具返回冲突信息时的取舍规则。

这些维度没有定义清楚,后面的工程投入都会缺少稳定坐标。

定义问题,不是把一句话写得更好听,而是把它写到可以被检验、可以被反驳、可以被拆解、可以分配责任。一个好的定义应该让团队知道:

  • 什么算成功
  • 什么算失败
  • 哪些输入是必须的
  • 哪些边界不能越过
  • 哪些指标能说明正在变好
  • 哪些情况出现时要停止或回滚

模糊定义很危险,因为它不可证伪。尤其不负责任的是那种正反两面都沾一点、关键判断永远不落地的表述:结果好了,可以说“这就是我当时的判断”;结果不理想,也可以把问题归因于团队没有领会真实意图。它表面上像是在保留弹性,实际上是在保留事后解释权。无论结果如何,这套说法都能自圆其说,也就不必接受验证,更不用承担判断失误的责任。

有些 leader 尤其喜欢用这种模糊叙述来保留解释空间,也习惯用“感觉不对”来否定方案,却不给出什么才是对的定义。直觉可以是判断的起点,但如果不能转化为标准、例子、约束或取舍依据,它就只是把定义问题的成本转嫁给团队。这不是成熟判断,而是责任规避。因为目标、边界、成功标准和判断依据都没有被清楚写下来,团队就无法判断执行是否偏离,也无法指出“这里错了”。真正可交付的工作必须暴露风险,接受验证,并把责任放在可以被讨论的位置上。

AI 让执行变快以后,模糊定义的代价会变得更高。过去你定义错了,团队也许只是慢慢偏航。现在你定义错了,Agent 会在错误方向上连续行动,把错误写进状态、工具调用和后续决策里,最后带来更高的回滚成本。模型越强,问题定义越重要。

过滤噪音比堆更多上下文更重要

AI 系统里一个常见误区,是以为更多上下文一定更好。

上下文窗口变大了,就把更多文档放进上下文。工具接入后,就把更多数据源暴露给模型。团队开始用 Agent 了,就期待它读完所有 Slack、工单、代码、会议纪要和客户记录。

这种做法看似自然,但风险很高。

上下文不是仓库,而是工作记忆。进入窗口的每一段信息,都会和关键信号竞争注意力。过期文档、重复日志、历史争论、无关数据、错误假设,不只是浪费 token,也会污染判断。

所以数据筛选比堆数据更重要。效果常常不取决于输入规模,而取决于信号密度。

对 Agent 系统来说,过滤噪音不是单纯的数据清洗,而是三层收敛:目标、上下文和工具。

第一,收敛目标。团队不应该让 Agent 什么都做。目标越泛,搜索空间越大,评估越困难,也越容易被无关信息牵引。更值得做的,往往是小而深、数据和工作流都具体的场景。

第二,筛选上下文。每一轮模型调用前,都要判断这次决策最需要哪一小块高信号状态。有些信息应该保留原文,有些应该压缩,有些只需要留路径或 ID,有些应该放在外部记忆里按需检索。

第三,限制工具。不是所有 API 都应该暴露给 Agent。工具越多,搜索空间越大,误用概率越高。好的工具接口应该让正确动作更容易,让危险动作更难,并在边界上直接挡住非法参数。

AI 时代最稀缺的不是信息,而是判断:识别哪些信息属于信号,哪些只是噪音或短期波动。

应用层壁垒来自持续学习循环

要诚实面对一个事实:很多 AI 应用的壁垒暂时很薄。

长久生存需要壁垒,而现在很多壁垒仍然在模型侧。模型公司不断变强,今天一家创业公司的产品能力,明天可能就会变成基础模型、SDK、IDE 或操作系统里的一项默认能力。

这不是悲观,而是要看清自己站在哪里。

在这样的世界里,应用层要活下去,不能只靠“比模型公司早做了某个功能”。功能会被追平,单点体验会被吸收,prompt 技巧会被商品化。最后能留下来的,是你是否在一个具体场景里建立了自己的学习循环。

这和 没有生态系统的前沿是不稳定的 里讲的是同一件事:如果所有能力都寄存在 frontier model 里,应用层只是临时外壳;如果你能把用户工作流、领域数据、反馈、评估和组织判断沉淀下来,就开始拥有自己的 token capital,也就是可被 AI 系统复用和放大的组织能力。底层模型可以替换,但你的工作系统、私有 eval、客户语境和机构记忆仍然留在自己手里。

所以应用层的生存路线,不只是“逃得快”或“市场小”,而是三件事叠在一起:选对战场,持续学习,把判断系统化。

第一,选一个足够具体的战场。

不要一开始就碰最通用的场景。通用意味着大,也意味着你正站在所有巨头的路径上。更好的切口通常是小而深:用户痛感强,工作流具体,数据和权限复杂,输出需要信任,结果可以被验证。

小市场不是没有想象力。好的小市场是切口小,但能扩展;初始用户少,但痛感深;工作流具体,但背后有可复制的机制。模型公司也许会做通用能力,但很难替你理解每个行业、每条流程、每类客户里的隐性规则。

第二,把每一次交付变成下一次的上下文。

一次客户交付之后,你得到的不应该只有收入,也应该有新的上下文:哪些输入决定了结果,哪些判断来自人,哪些步骤可以自动化,哪些失败应该进入 eval,哪些工具描述需要改,哪些领域术语应该进入记忆。

如果每一次执行都只是临时项目,你没有复利。如果每一次执行都能改进模板、数据结构、Agent Skill、workflow、权限边界和评估集,你才开始建立自己的生态位。

第三,把人的模式识别沉淀成系统。

这和 AI 时代,真正稀缺的是看出模式 是同一条线。AI 会让候选方案越来越多,也会让噪音越来越多。应用层稀缺的,是更早看出用户行为、产品机会、模型失败、工作流瓶颈和商业路径里的模式。

但模式不能只停留在创始人或少数高手脑子里。能写成判断标准的,写成标准;能变成检查项的,变成 checklist;能被反复验证的,做成 eval;能被 Agent 复用的,沉淀成 Skill 或 playbook。

这才是应用层的壁垒:不是某个 idea,而是一个越跑越懂用户、越跑越会判断、越跑越能交付结果的系统。

判断 AI 产品机会时,也要看替换关系,而不只是看技术名词。Chatbot 之所以能成为入口,一个重要原因是它替换了传统 search 的一部分需求。

传统 search 提供链接,要求你自己打开、筛选、比较、总结。Chatbot 提供交互:你可以持续追问,让它压缩信息、解释差异、生成结论,帮你把问题推进到下一步。

这不是“搜索框换成聊天框”那么简单,而是改变了用户完成任务的路径。应用层要寻找的,也是这种不可替代的工作流变化。

因此,AI 产品需要持续追问:

  • 你替换的是哪一种旧行为?
  • 你让用户少做了哪一段认知劳动?
  • 你新增的交互能力是不是旧工具给不了?
  • 用户为什么会在这里形成新习惯?
  • 这个习惯会不会随着模型原生能力增强而消失?

很多 AI 产品借用了趋势语言,但本质仍是功能点。功能可以被吸收,行为改变才可能沉淀成壁垒。

最终要判断的不是“这个 idea 是否有人想到”,而是当模型能力继续上升、平台能力继续下沉时,你是否仍然拥有自己的学习循环,判断是否还在复利,产品是否已经从功能变成工作系统。

组织能力决定 idea 能不能落地

方向讲到最后,都会回到人和组织。

首先,是基础能力。这没有捷径。AI 可以放大能力,也会更快暴露基础能力不足。你不理解系统,不理解代码,不理解指标,不理解用户,AI 生成的候选项越多,筛选和纠错成本就越高。

第二,是理解自己的工作如何嵌进组织。

很多人在单点上做出了一件看起来正确的事,提升了一个局部指标,但放进组织协作里,整体反而变差。原因可能是引入了复杂性,增加了维护成本,打断了别人的节奏,或者把风险转移到了基础设施。

好的工程师和研究员,不只是把自己这一块做对,还要理解边界在哪里。你要知道自己的改动影响谁,依赖什么,如何被验证,什么时候会给 infra 带来长期成本。做不到全局考虑,就还不是一个可靠的 builder。

第三,是规划能力。

规划不是写一个很长的 roadmap。规划是把一件大事拆成可以并行、可以验证、可以恢复的小事。你要知道哪些问题必须串行,哪些可以并行;哪些是关键路径,哪些只是优化;哪些地方需要先做 eval,哪些地方可以先跑 demo;哪些失败可以接受,哪些失败要提前设检查点。

这和 Agent 的规划问题是同一件事,只是对象从模型换成了团队。

把简单的事做扎实,是贯穿始终的能力。引入复杂性之前,要先判断它是否真的必要,收益是否覆盖长期维护成本,以及它会不会降低 infra 的韧性。

很多问题从来不是单点问题,而是系统问题。成熟的工程判断,需要在 tradeoff 中找到能长期运行的平衡点。

对 Leader 来说,最重要的是两种能力:处理关键问题,以及理解团队成员的具体工作。

处理关键问题,不是团队遇到问题时给出鼓励,而是有能力介入复杂局面。线上事故、项目阻塞、方向偏移、关键客户问题、团队陷入局部争论时,Leader 不一定每次亲手解决,但必须有足够判断力和行动力,帮助团队重新回到可控状态。

理解团队成员的具体工作,不等于每个细节都比专家强,而是能看见具体的人、现实约束和关键取舍。只有理解这些,Leader 才能做出有分寸的介入。

尤其在 AI 时代,工作会越来越跨边界:模型、产品、工程、数据、安全、评估、分发、组织流程会高度耦合。Leader 如果只看汇报里的正向结论,却看不到团队成员实际面对的限制因素,就很容易误判贡献,并把团队导向局部最优。

AI 会让很多执行变快,但关键判断仍然需要由人来承担。

long horizon 是 Agent 能力的关键分水岭

随着模型能力持续提升,Agent 的价值不再只取决于单次回答质量,而取决于它能不能稳定完成更长、更复杂的任务链路。

这里的关键能力,就是 long horizon。

它衡量的不是 Agent 能不能完成一步动作,而是能不能跨越较长时间和多个步骤,把开放任务稳定推进到结果。

OpenAI 在 2026 年关于 Agents SDK 和 long-horizon models 的材料里,重点已经不只是“模型会调用工具”,而是 long-running、sandbox、durable execution、trajectory-level monitoring、pause / rollback 和 human-in-the-loop。Anthropic 关于 long-running agents 和 harness design 的文章,也反复强调跨 context window 的状态交接、增量推进、artifact、评估和工作外壳。

这说明趋势已经从“模型能不能回答”转向“系统能不能持续行动”。

围绕 long horizon 的工程问题,可以按执行链路拆成五类能力。

  • 规划拆解:一个长目标如果不能拆成可并行、可验证的子任务,就很难稳定完成。这和前面讲的定义问题是同一件事,只是搬到了执行层。
  • 状态管理:链路一长,上下文必然膨胀。系统必须决定什么保留原文,什么压缩,什么写进外部状态,什么按需加载。没有上下文生命周期管理,任务状态会逐渐漂移,后续决策也会失去依据。
  • 误差控制:长链路最致命的不是某一步做错,而是误差会被放大。单步 99% 的正确率,跑一百步也会变得很脆。所以工程上必须有可恢复、可回滚、可校验的机制,让 Agent 能发现错误、退回检查点并修正方向。
  • 过程评估:短任务好评,长任务难评。只看最后答案不够,还要看中间轨迹、工具调用、检查点、恢复能力、成本、人工介入次数,以及是否遵守边界。能不能做出好的 long-horizon eval,本身就是壁垒。
  • 瓶颈判断:当上下文越来越长、工具越来越多、可能性越来越多时,谁能看清当下的核心瓶颈,谁就更有机会胜出。瓶颈可能来自模型能力、工具接口、数据质量、权限边界或 eval 设计,也可能来自一开始就不够清晰的任务定义。

被热点牵引的能力建设,往往低效且危险。真正重要的是看清限制因素,并把资源投入到最关键的瓶颈上。

理解 AI 才能形成判断力

AI 时代,很多原本很难的事会变简单。你可以在很短时间里搭出一套强化学习 demo,写出一个 Agent workflow,生成一个内部工具,整理一份市场研究,甚至让模型帮你改一整片代码。

但前提是你真的理解 AI 做了什么。

使用 AI,和理解 AI,是两件事。

只会使用 AI 的人,能把任务交给模型。真正理解 AI 的人,知道该怎么定义任务、提供上下文、设置边界、检查输出、识别幻觉、安排回滚、沉淀反馈,也知道什么时候不该让 AI 继续做。

前者会越来越普遍。后者会越来越稀缺。

这也是为什么个人和组织都不能把学习外包给 AI。模型可以帮你执行,可以帮你解释,可以帮你生成候选方案,但它不能替你形成判断力。判断力来自真实反馈:做错、验证、复盘、修正,再把经验沉淀成下一次更好的系统。

AI 原生团队的护城河,不在一个人人都能想到的 idea 里,而在这些更慢、更扎实的东西里:

  • 定义问题的清晰度
  • 过滤噪音的判断力
  • 把任务拆开并行推进的规划能力
  • 把工具、权限、上下文和 eval 做成系统的工程能力
  • 每次运行后都能沉淀下一次优势的组织能力

执行力来自验证信号,并沉淀为系统

最后回到开头那句话。

想法不稀缺,落地才是高成本环节。

AI 会继续降低“想到一个方案”和“做出一个 demo”的成本。这意味着想法的溢价会下降,包装的溢价会下降,空泛战略的溢价也会下降。

更有价值的能力会变得更清楚:把问题定义到可以被反驳,在噪音里识别信号,选择足够窄、足够深、也足够有想象空间的市场,在模型能力不断逼近时持续演化,并让团队和 Agent 一起跑完越来越长的链路。

捕捉到信号之后,关键不是停留在判断本身,而是尽快把它转化为可验证的假设。

这里的行动不是盲目加速,而是定义清楚问题,过滤噪音,搭出最小可验证系统,跑出真实反馈,再用反馈改进下一轮。

AI 时代的执行力,不是更快地产生想法,而是更快地验证信号,并把有效经验沉淀为可复用、可持续改进的系统。

参考来源

相关阅读

ai-native agents execution long-horizon strategy