博客

打造靠得住的 AI 智能体

在公开构建 aibuddy 过程中的实践记录 —— 运行时、上下文工程,以及更大的模型替你解决不了的协同问题。

主题
来源
公司
2026年9月4日 15 分钟阅读 张小珺

模型不是终点:从产业三阶段看 Agent 与组织变革

Agent 生态尚未出现能像早期互联网浏览器那样显著降低门槛的关键入口。模型会吞掉简单脚手架,但不会吞掉复杂场景;下一轮竞争属于能建立任务闭环和智能飞轮的团队。

研究
2026年8月31日 10 分钟阅读 原创

生产级 Agent 的评估与监控

Agent Evaluation 评估的不是一次模型回答,而是模型与 Harness 共同构成的 Agent 系统能否可靠完成任务。生产级评估需要验证最终结果、关键边界与执行过程,并将线上失败持续转化为可重复的 Eval 案例。

工程
2026年8月30日 9 分钟阅读 原创

智能体需要 Harness,不只是更强的模型

更强的模型会抬高上限,但可靠的智能体来自模型外面的系统:上下文、工具、约束、验证、纠正,以及可观察的执行循环。

公司
2026年8月29日 10 分钟阅读 原创

企业 Context 重构:AI 原生转型的基础工程

AI 原生不只是给旧流程增加 AI,而是重构企业信息流,让 Agent 在每一次决策前获得正确的 Context,并把行动结果带回下一轮判断。

研究
2026年8月28日 12 分钟阅读 OpenAI

AI 就业转型(一):AI 能做,不等于它会取代

AI 能接手多少任务,只能说明哪些工作更容易受到影响,却无法判断影响会表现为岗位减少、工作重组,还是就业需求增加。我们需要的不是另一份“职业替代榜”,而是一套理解就业转型的框架。

研究
2026年8月28日 8 分钟阅读 OpenAI

AI 就业转型(二):哪些工作仍然离不开人

一个职业即使高度暴露于 AI,也可能因为责任、信任或现实操作而离不开人。这能阻止职业被完全自动化,却不能保证岗位数量不变。

研究
2026年8月28日 8 分钟阅读 OpenAI

AI 就业转型(三):工作变便宜,岗位不一定减少

AI 会减少每单位产出所需的人力,但降本也可能带来新客户和新需求。最终增加还是减少岗位,取决于哪一种力量更强。

研究
2026年8月28日 8 分钟阅读 OpenAI

AI 就业转型(四):模型会做,企业为何还没用起来

模型能够影响的工作,远多于企业真正交给它完成的工作。缩小这道差距,需要上下文、权限、评估和工作流重构,而不是更多 prompt 技巧。

研究
2026年8月28日 8 分钟阅读 OpenAI

AI 就业转型(五):四条路径,不是一个结局

劳动力市场不会走向唯一的 AI 结局。自动化、工作重组、需求扩张和短期变化有限,需要完全不同的企业决策与个人策略。

研究
2026年8月28日 9 分钟阅读 OpenAI

AI 就业转型(六):把框架变成公司的行动计划

AI 劳动力研究真正有用的产物不是预测,而是一套可重复的决策方法:什么应该自动化,什么需要重组,哪里值得扩张,哪些变化必须持续监测。

研究
2026年8月28日 15 分钟阅读 原创

为什么笃定 AI:企业真正需要的是什么

企业的大量工作依赖语言理解、非结构化信息处理和专业判断,传统软件很难以固定规则经济地覆盖。大模型让这类任务出现了通用、可扩展的软件实现路径,这正是企业需要 AI、也值得长期投入 AI 的根本原因。

工程
2026年8月24日 7 分钟阅读 OpenAI

Harness Engineering(一):当工程师开始设计 Agent 的工作环境

当代码生成不再稀缺,工程工作的重心就会从逐行实现,转向为 Agent 设计环境、明确目标并建立反馈循环。

工程
2026年8月24日 8 分钟阅读 OpenAI

Harness Engineering(二):给 Agent 一张代码库地图

把所有规则塞进一份巨型 AGENTS.md,并不能解决上下文问题。Agent 真正需要的是清晰入口、分层知识,以及一套始终与代码同步的知识体系。

工程
2026年8月24日 8 分钟阅读 OpenAI

Harness Engineering(三):让软件运行状态对 Agent 可读

Agent 能修改代码,不等于它能验证软件。要让它独立完成工程闭环,应用状态、浏览器、日志、指标和验收标准都必须可供它直接检查。

工程
2026年8月24日 6 分钟阅读 OpenAI

Harness Engineering(四):把工程规则变成可执行约束

Agent 不会因为读过一次规范,就在此后始终遵守。可靠的 Harness 会把关键架构边界、质量要求和工程原则变成系统能够自动检查并强制执行的规则。

工程
2026年8月24日 7 分钟阅读 OpenAI

Harness Engineering(五):当 Agent 的产出超过人的注意力

当 Agent 大幅提高代码产出速度,逐项人工审查就会成为新的瓶颈。团队需要根据风险安排检查、审查、合并与故障恢复,把人的注意力留给真正需要判断的地方。

工程
2026年8月24日 7 分钟阅读 OpenAI

Harness Engineering(六):Agent 也会复制技术债务

Agent 会沿用代码库中已有的模式,包括重复实现、架构偏移和临时补丁。代码生成得越快,团队就越需要持续发现并清理技术债务。

产品
2026年8月14日 8 分钟阅读 原创

BUA 的取舍:把浏览器能力交回 Desktop

Browser Use Agent 不是一个孤立功能,而是一条让 Agent 进入真实浏览器工作流的产品路线。我们曾经在 Web 端维护自己的 BUA 组件,但从产品定位看,把主路径收回 Desktop,并复用 Chrome DevTools MCP,是更合理的取舍。

社区
2026年8月12日 7 分钟阅读 原创

AI Builders:从会用 AI 到交付系统

AI builders 不只会使用工具,还能把 AI 放进真实场景,做成可交付、可验证、可持续改进的系统。

研究
2026年8月11日 12 分钟阅读 原创

想法不稀缺,难的是验证信号并沉淀为系统

AI 时代,很多方向会变得越来越显而易见。真正拉开差距的,不是谁先说出了 idea,而是谁能定义问题、过滤噪音、建立可验证的执行系统,并在 long-horizon 任务里持续把事做成。

公司
2026年8月10日 8 分钟阅读 Anthropic

AI Native 创业(一):到底重启了什么

AI 压缩的不是创业本身,而是从想法、验证、构建到反馈之间的循环时间。

公司
2026年8月10日 10 分钟阅读 Anthropic

AI Native 创业(二):公司已有数据,才是第一性资产

AI 原生公司最先要整理的不是代码,而是客户、产品、销售和运营留下的真实上下文。

公司
2026年8月10日 8 分钟阅读 Anthropic

AI Native 创业(三):创始人从执行者变成编排者

AI 没有让创始人变轻松,它只是把创始人的工作从亲自执行,推向设计系统、分配判断和编排智能体。

公司
2026年8月10日 9 分钟阅读 Anthropic

AI Native 创业(四):Idea 阶段,不要把能做出来误认为值得做

AI 让构建变得太容易,所以创业者更需要先证明问题真实、具体、频繁,并且值得被解决。

公司
2026年8月10日 9 分钟阅读 Anthropic

AI Native 创业(五):MVP 阶段,产品边界比写代码更重要

AI-native MVP 的第一份产物不该是代码,而应该是范围、架构、指标和上下文约束。

公司
2026年8月10日 9 分钟阅读 Anthropic

AI Native 创业(六):Launch 阶段,从产品成立到公司成立

Launch 不是把产品发布出去,而是把早期创始人的临场发挥变成可重复的公司系统。

公司
2026年8月10日 9 分钟阅读 Anthropic

AI Native 创业(七):Scale 阶段,AI 产品真正的护城河

AI 产品的护城河不是模型,而是行业知识、用户行为数据、工作流嵌入和组织执行闭环。

公司
2026年8月10日 7 分钟阅读 Anthropic

AI Native 创业(八):创始人的工作没变,但规则变了

AI 没有替代创始人的判断,它只是让判断、上下文和学习速度成为更核心的创业能力。

研究
2026年8月10日 13 分钟阅读 Addy Osmani

不要把学习外包给 AI

AI 能帮你写代码、解释代码、生成方案,但人的判断力仍然要靠真实反馈训练。关键不是少用 AI,而是用它加快人的学习,而不是绕过学习本身。

研究
2026年8月10日 8 分钟阅读 X

没有生态系统的前沿是不稳定的

Satya Nadella 认为,AI 时代真正重要的不是单个最强模型,而是让每家公司都能拥有自己的学习循环,把人的判断、组织知识和 AI 能力一起复利。

研究
2026年8月10日 10 分钟阅读 X

AI 时代,真正稀缺的是看出模式

AI 会放大产出,也会制造更多看起来合理的选项。真正拉开差距的,是能不能用真实反馈校准判断力,把反复有效的模式沉淀下来。

工程
2026年8月8日 17 分钟阅读 原创

从个人提效,到 AI 原生团队

AI 原生团队的分水岭,不在于多少人把 AI 当成个人提效工具,而在于团队能不能把真实工作安全地委派给 Agent,并让每一次执行反过来改进系统。

公司
2026年8月7日 12 分钟阅读 YC

AI 原生公司:从组织图到智能层

AI 不只是提效工具。真正的 AI 原生公司,会把工作流、决策和组织方式都建在一层持续学习的智能系统之上。

公司
2026年8月6日 13 分钟阅读 YC

如何构建一家 AI 原生服务公司

下一个十年,一批大公司可能不再卖软件,而是用 AI 重做律所、保险公司和税务事务所,直接替客户交付结果。

公司
2026年8月5日 11 分钟阅读 YC

如何挑一个创业点子

创业点子不是在脑子里想完美的。先选一个方向,关掉其它选项,钻进客户的真实世界里,再用反馈把它磨出来。

公司
2026年8月4日 12 分钟阅读 YC

如何拿下你的头十个客户

头十个客户很少来自工具。它们通常来自熟人和引荐、亲自到场,以及那些暂时无法规模化却最能建立信任的动作。

研究
2026年1月14日 10 分钟阅读 原创

Agent 长任务的瓶颈,是上下文工程

长任务跑不稳,往往不是模型不会推理,而是它每一轮看到的状态不对。真正难的是把上下文当成工作记忆来管理:该放什么、压缩什么、记住什么、缓存什么。