Q's Notes
AI · Software · Essay 成长

廉价智能体会制造协同债

AI智能体先让个人产出变便宜,但不会自动让组织更擅长判断什么东西应该存在。

6 分钟 2,268 字
aisoftwaremanagementbusiness
定义术语
协同债 / 名词
当行动变得比对齐更便宜时,未解决决策堆积出来的债。

企业采用AI智能体后的第一场危机,可能看起来并不像失败。它可能看起来像每个人都产出了比组织能吸收的更多工作。

这就是当前智能体采用故事里最不舒服的部分。开发者、分析师、招聘、法务、运营,现在都可以制造更多东西:代码、脚本、报告、数据看板、原型、迁移计划、市场地图。其中一些东西有用。有些甚至真的很出色。

但一个组织不会因为有更多东西存在而变好。它会在正确的东西存在、彼此连接、有人负责、经得起审核,并且真正改变业务行为时变好。

智能体降低了行动成本。它们不会自动降低协同成本。两者之间的差距,就是协同债产生的地方。

产出正在变便宜

OpenAI在6月25日发布的Codex报告,是目前最清晰的信号:智能体正在从聊天工具走向被委托的工作。报告称,到2026年5月,80.6%的抽样个人Codex用户至少提交过一次请求,其工作量被估计为超过一位有经验人类的30分钟。70.2%提交过一次超过一小时的请求。25.6%提交过一次超过八小时的请求。

这些数字不应被过度精确地解读。OpenAI说明,人类时间阈值是模型估计的,而且基于允许查询用于研究的用户中0.1%的随机样本。但方向很重要。

人们不只是让智能体回答问题。他们正在委托工作。

同一份报告还说,在个人用户、组织用户和OpenAI内部用户中,非开发者Codex用户的增长速度都快于开发者。在OpenAI内部,法务、财务和招聘大约在2026年4月转向以Codex为主要AI工具。在商业职能中,超过四分之一的Codex输出token用于工程或编码工作。

这是一个真实变化。它意味着技术执行正在从工程组织里流出来。产品营销可以做一个工具。律师可以转换数据。运营可以自动化一个工作流。创始人可以在午饭前让五个智能体原型化同一个想法的五个版本。

这不是一个小的效率功能。它改变了谁可以创造过去需要交接才能产生的工作。

组织仍然要做决定

这个故事的懒惰版本是:这全是好事。更多人可以构建,所以公司会更快。

有时确实如此。但更难的问题不是一个人能不能产出更多,而是组织是否已经改变到足以吸收这些额外产出。

公司仍然要决定什么应该进入产品、哪个原型应该变成真正的系统、哪个实验应该被杀掉、哪个团队拥有新的工作流、哪个安全边界适用、哪个客户承诺发生了变化,以及哪个重复工具应该被删除。

智能体不会消除这些问题。它们会增加那些本该提出这些问题的时刻。

我把这称为协同债:当行动变得比对齐更便宜时,未解决决策堆积出来的债。它不同于技术债,虽然常常表现为代码。技术债说的是:“我们做了一个工程捷径。“协同债说的是:“在组织还没同意它应该放在哪里之前,我们就创造了一个东西。”

我反复想到一个更直白的版本:个体开发者现在能更快做出高价值的概念验证,但组织形态没有演化。一个月到两个月内,一些公司有了更多代码、更多孤岛、special engineering团队和业务其他部分之间更多冲突,而高管反而看不到更多实际进展。

这恰恰是问题本身。每个人都可以局部高效,同时公司整体变得更难理解。

廉价行动需要昂贵审核

智能体安全证据从另一个角度指向同一个方向。

Google DeepMind在6月18日写道,他们在构建内部监控系统时,分析了一百万个编程智能体任务。被标记事件的大多数,并不是来自对抗性意图。它们往往来自智能体为了完成用户目标而产生的误解或过度积极。

企业里的问题很少是”智能体想伤害我们”。更常见的是:“智能体做了一件看起来合理、速度很快、但对周围系统略微错误的事。”

产品之外的研究也显示了类似限制。2026年4月提交的MarketBench发现,在市场式任务分配场景中,大语言模型智能体对自己的成功概率和token使用量都存在校准问题。说白了,智能体劳动力还不能可靠地给自己定价。

一篇6月关于编程智能体复现社会科学研究的论文更乐观,但也带着警告。它发现Claude Code和Codex可以复现许多计算工作流,但也发现细微的prompt表述可以把智能体推向确认式规格搜索。这种失败正是从任务内部看很高效、从组织层面看很危险的类型。

智能体完成了工作。这项工作甚至可能是称职的。问题是,这项工作是否应该以这种形式存在。

瓶颈向上移动

这仍然是企业AI里的协同瓶颈,只是边缘更锋利了。

在聊天机器人时代,失败模式往往是浪费时间或给出坏建议。在智能体时代,失败模式是状态变化。文件被改了。工单被改了。内部工具出现了。数据被转换了。工作流被打了补丁。概念验证因为足够有用,被人开始依赖,于是变成非正式系统。

这意味着稀缺能力向上移动了。

有价值的人,不只是能让智能体产出代码的人。而是能判断这段代码应该成为产品、临时脚本、被删除的实验,还是更大架构的一个输入的人。是那个经理能说:“这看起来有用,但它制造了第二个事实来源。“是那个工程师能说:“这应该是一个配置改动,而不是一个新服务。“是那个运营能说:“这个自动化节省了一小时,但制造了三个隐藏例外。”

智能体工作让判断力更重要,因为它让行动不再稀缺。

反方观点成立

有一个很强的反方观点:更好的平台也许能解决许多问题。智能体可以被路由到工单、pull request、权限策略、评估、架构评审和所有权规则里。如果每个智能体任务都有工单、分支、审核者和负责的人,也许廉价行动就不会变成债。

这部分是对的。从智能体中受益最多的组织,不会是工具最宽松的组织,而会是入口、审核、所有权和删除仪式最清晰的组织。

但这并没有削弱本文的主张。它反而确认了它。缺失的能力不只是模型智能,而是组织消化能力。

智能体平台可以帮忙。它可以强制范围化权限,把工作绑定到负责人,要求审核,保留日志,让删除变容易。但仍然必须有人决定什么叫”完成”,什么应该被标准化,什么根本不该被构建。

有用指标不是产出量

如果一家公司想知道智能体是否真的有帮助,生成代码量或智能体工作时长不应该是第一个指标。

应该统计有多少工作通过审核并被保留下来。统计有多少原型在两周内被删除。统计两个团队重复构建同一个内部工具的频率。统计智能体创建的工作流在三十天后是否有清晰负责人。统计流程层面的周期时间是否改善,而不是某个人是否产出了更多东西。

值得追踪的预测很简单:到2027年底,严肃的企业智能体项目会更少用个人生产力故事来证明自己,而更多用吸收指标来判断。多少智能体工作变成了被维护的工作?多少被干净地杀掉?多少减少了协同负担,而不是增加它?

如果这些指标没有出现,智能体热潮仍然会创造真实价值。它也会创造大量昂贵的杂物。

瓶颈从来不只是让软件或分析变便宜。瓶颈是决定什么东西应该存在。智能体让这个瓶颈无法再被忽视。

预测 · 追踪中 进行中

到 2027 年底,严肃的企业智能体项目会用吸收指标来判断——多少智能体工作经得起审核——而不是个人产出量。

置信度
证伪条件: 如果到 2028 年,严肃项目里始终没有出现这些吸收指标。
来源
1openai.com — 智能体如何改变工作
2deepmind.google — 为 AI 智能体的未来护航
3arXiv:2604.23897 — MarketBench