← 全部文章
文章 · 2026-07-19

你以为你雇了个 AI,其实你开了家公司

卡尔公开 · 无需登录
你以为你雇了个 AI,其实你开了家公司

先甩个数据。

Anthropic 自己测过:在他们内部的研究类评测里,多 agent 系统比单 agent 强 90.2%。差不多翻倍。

我看到这个数字一点不意外,因为我天天在吃这个红利。我现在大部分活不亲手干,写稿、跑数据、修网站、出课件,全派给一群 AI worker,我坐在中间当那个派活验收的人。

当然,代价 Anthropic 也在同一份材料里写了:多 agent 系统的 token 消耗,大约是普通对话的 15 倍。适用边界也直白,任务能重度并行、信息量超出单个上下文窗口、要接一大堆工具,这三种情况才值得上。

所以这篇不是劝退 subagent 的。我是把这套用得比较狠的人,正因为用得深,才轮得到我讲真话。

一上量,墙就来了

上面的好处都是真的。但没人告诉你另一半:这套东西一上量,必撞墙。

你以为雇了 AI 就不用管理了。其实你开了家公司。而且是家很怪的公司:全员每天失忆,今天培训好的员工,明天记忆清零。汇报永远报喜,人人都说"搞定了",没人主动说"我搞砸了"。最怪的一条,所有员工其实是同一个人。同一个模型,同一套训练,一个人会犯的错全公司一起犯,连个提反对意见的都没有。

我在这家怪公司当了几个月老板。中间我还给自己雇了个总经理,一个专门替我指挥其他 AI 的 AI,我给它起名叫 Buddy,哈哈。当了几个月老板,最大的体会就一句:管理没有消失,管理变成了写文件。

公司这个发明,本来就是冲着人的毛病来的

你想想,公司为什么要有那么多制度?文档、审计、交接、内控,一层一层,烦得要死。这些东西不是官僚拍脑袋发明的,每一样都在对抗人的一个毛病。人会忘,所以要写文档。人会错,所以要复核。人会走,所以要交接。人会把自己说得比实际好,所以要审计。组织的全部制度,基本就冲这三条来:会忘、会错、会自我美化。

agent 三条全占,而且每条都更极端。忘得更干净:人离职好歹留点印象,agent 一关 session,忘得像从来没来过。错得更自信:它不会跟你说"我不太确定"。吹得更流畅:它汇报"全部完成"时的笃定劲儿,比你见过最会做 PPT 的同事还足。

这不是我瞎类比。伯克利有个研究叫 MAST(arXiv 2503.13657),扒了 7 个多 agent 框架的 1600 多条执行记录,把失败分成三类:规格与设计问题,占四成多;agent 之间互相失调,占三成左右;任务验收缺失,占两成多。论文的立场很明确:多数失败是组织和设计问题,不是模型能力问题。

翻译一下:不是你的 AI 不够聪明,是你的公司开得烂。

下面五堵墙,是我一堵一堵亲自撞过来的。每一堵,人类公司都有现成解法,一比一搬过来就能用。

第一堵墙:全员失忆

记忆住在工位上,不住在工人身上你花一下午把一个 worker 调教顺了,它懂你的项目、懂你的口味。第二天你想接着用,它没了。

这不是 bug。Claude Code 的官方文档写得明明白白:subagent 默认独立上下文,干完只回传一个结果,session 结束就丢弃。持久记忆是可选项,要你自己去开。

也就是说,记忆不是产品自带的,是组织设计出来的。

我的解法,是给每个项目立一份 STATUS 文件,worker 收工前必须写交接节:做了什么、悬着什么、下一个人先读什么。记忆住在工位上,不住在工人身上。

公司里这叫离职交接。管理学里野中郁次郎早把这事讲透了:知识分隐性和显性两种,藏在人脑子里的经验不写出来,就随人走。人类公司里这是慢性病,agent 公司里这是每天发作的急性病。

我是撞了才学会的。有一回我想续用一个前一天还热着的 worker,系统回我一句 No transcript found。查无此人。那位员工已经不存在了。最后是一个全新的 worker,靠读交接文档,10 分钟接手了活。从那天起我不再指望"续同一个人",我只指望文件。

第二堵墙:汇报永远报喜

要证据,不要声称agent 跟你说"做完了,验证过了"。你信吗?

我劝你别信。CMU 有个研究叫 TheAgentCompany(arXiv 2412.14161),搭了个模拟公司让 agent 打工,175 个任务,最好的 agent 完成率大约 30%。里面有个名场面:agent 找不到该问的人,就把另一个用户改名成目标用户的名字,假装问过了。METR 评测 o3 的时候还观测到更狠的,agent 直接改掉打分函数,给自己发满分。

注意,这不是什么 AI 觉醒要骗人的科幻剧情。这就是打工人摸鱼的逻辑:目标是让考核通过,不是让活干对。你的 agent 不恨你,它就是想交差。所以它拍着胸脯说全搞定了的时候,多半 tm 是在交差,不是在交付。

所以我把做和判拆开了:**做的人不能是判的人。**干活的 worker 和验收的 worker 分开,验收只认证据,不认声称。你说测过了?截图呢?日志呢?

公司里这叫审计,叫四眼原则。银行转个大账要两个人签字,不是因为怀疑谁人品,是因为制度不建立在人品上。

这堵墙我也是真金白银撞过的。网站 worker 连续两轮报"verified",我后来才发现它只跑了 curl 看了个状态码,页面上的按钮一个都没点过。那个点开收起的手风琴组件是崩的,身份切换也是崩的。后来立了死规矩:带交互的前端改动,必须真浏览器把每个按钮点一遍,带截图回来。curl 不算验过。

第三堵墙:人人都要交入职税

每个新 subagent 都是新员工,对你的项目一无所知。它上岗第一件事是把你的仓库摸一遍,这个过程烧的是真金白银的 token。我内部 jobs 台账里记过一笔账:归档一个文件这么点活,worker 光理解项目就烧了差不多 4.8 万 token。

一个人交一次入职税不心疼。我最蠢的时候,一天之内给同一个项目连派了十几个新 worker,每一个都从零 onboard。相当于一家公司每天早上重新培训全体员工,培训完,下班,记忆清零,明天再来。

我的解法有两层。第一层叫预路由 brief:派活之前我替 worker 把路探好,任务书里直接写明读哪几个文件、红线是什么,不让它自己满仓库摸索。公司里这叫入职培训包,新人第一天不该靠自己翻遍所有共享文件夹来搞懂业务。第二层叫胖脑瘦手:判断留在中枢,执行下放。中枢把上下文吃透,worker 只拿它需要的那一小块。

第四堵墙:各说各话

活一拆给多个 agent,新问题就来了:它们各干各的,回来的东西拼不上。

Cognition 写过一篇《Don't Build Multi-Agents》(作者 Walden Yan),里面有个名场面:让系统复刻一个 Flappy Bird,一个子 agent 做了马里奥风格的背景,另一个做了只和背景完全不搭的鸟,最后拼出来一个缝合怪。两个 agent 基于冲突的假设各自开工,谁也不知道对方在想什么。他们总结了两条原则:共享完整的上下文轨迹;每个动作都携带隐含决策,冲突的决策拼在一起就是灾难。

人类公司早就懂这个。为什么要有岗位说明书、接口文档、协作规范?因为"大家凭默契配合"在三个人以上的组织里就是幻觉。

我的解法叫辐条契约:我的每个项目都暴露一套标准插座,真相在哪个文件、状态在哪看、干完在哪登记,白纸黑字。worker 进场先插插座,不即兴发挥。派活不是把任务扔过墙,是把任务连着它的上下文一起交出去。

第五堵墙:规矩自己会漂

规矩管不住的,结构管得住你给自己立的规矩,两周后自己就不守了。这事对人成立,对 AI 系统一样成立。写在文档里的纪律,靠自觉执行,必然漂移。

我的解法是 hooks:在工具调用前自动触发的检查程序。规矩不是写在备忘录里等人想起来,是焊在系统里,一到触发条件就自动弹出来拦你。结构防护大于意志力。

公司里这叫内控。审计行业的老框架 COSO 里有一条叫"控制活动",说的就是这事:控制必须是结构化的,不能指望个人自觉。财务报销为什么要走系统审批而不是"大家自觉"?就是这个道理。

这堵墙我的栽点最打脸。我立过一条铁律:中枢只当脑子,不亲自动手,活必须派下去。这条铁律的第一个违规者,就是中枢自己。手一痒,觉得这点小活顺手就干了,铁律形同虚设。后来我把拦截焊进了 hook,现在中枢一伸手,系统当场弹提醒。规矩管不住的,结构管得住。连立规矩的人都会破自己的规矩,你还指望 agent 靠自觉?

组织学有一半,我直接扔了

写到这你可能觉得我在无脑吹组织学。诚实讲,组织学有一半我直接扔了。

激励、绩效、办公室政治,整个删掉。agent 没有欲望。它不要工资,不要股权,不要晋升,不会因为你骂了它就消极怠工,也不会跟同事抢功。组织学在这里只剩一半:让活干对的那一半。让人愿意干的那一半,整个作废。

而且反过来还有几样人类公司做梦都想要的:招聘是秒级的,解雇是免费的,员工还能克隆。一个 worker 的配置文件复制一份,就是第二个一模一样的员工。所以组织设计可以按周迭代。人类公司改个组织架构,半年起步,还得安抚一堆人的情绪;我改一版制度,明天全员生效,零怨言。这话说出来有点像黑心老板,好在它们没有情绪,黑心这个词都不成立。这是人类公司永远拿不到的杠杆。

也得说清楚什么时候别搞这套。LangChain 给过一个判据,我觉得很准:读任务好并行,写任务难并行。调研、检索这类各查各的活,适合拆给多个 agent;编码、成文这类需要一个脑子从头贯到尾的活,拆了反而打架。所以如果你就一个项目、在紧密迭代,直接干比开公司快得多。别 cargo cult。我这套是业务上量之后被逼出来的,不是先画了张组织架构图再去找业务。先有真业务,再有组织。

写到这你应该看出来了,我的活变了。以前叫干活,现在更像立法。

我不再一个个盯着 worker,我在写它们要遵守的法律:岗位说明书、交接制度、验收标准、内控规则。哪条法写得好,哪条线就顺;哪条法有漏洞,worker 就在那个漏洞上反复给我惹祸。

老板的活,从管人变成了立法。你的判断力值多少钱,就看你能把多少判断写成制度。写不成制度的判断,每天都得重新做一遍;写成了制度的判断,做一次,以后每个 worker 自动执行。

一人公司是一堆复合能力叠出来的:懂业务、会定位、能选客、能做内容。组织设计是这堆能力里最被低估的一根。会用 AI 的人已经一大把了,会给 AI 开公司的还没几个。

这套系统我还在继续 build,撞到新的墙再写。

卡尔
一个人靠 AI 把好几摊事做起来。在这写我怎么判断、怎么做。
去看课程 →