终于用国产模型体会到了 Agent team 的快乐

先说今早干了什么

今天早上 9 点到 11 点,两个小时,我同时完成了四件事:

  1. 个人网站新版构建——从零搭建,包括页面结构、样式、部署配置
  2. 两篇公众号文章——就是前两天那两篇 Harness 的文章,从思路到完稿
  3. Open Claw 升级——一个我维护的开源工具,迭代新版本
  4. 中间还穿插了一些零碎的代码修改——改 bug、加功能、调样式

两个小时,四件事,全部完成。没有熬夜,没有赶工,没有"等这个跑完才能干那个"。

怎么做到的?

我同时开了四个终端窗口,每个窗口里跑了一个 AI Agent,背后是不同的国产大模型。

  • 窗口一:千问 3.8,负责网站构建
  • 窗口二:GLM 5.2,负责一篇文章
  • 窗口三:K3,负责另一篇文章
  • 窗口四:K3 另一个实例,负责 Open Claw 升级和零碎修改

四个 Agent 并行推进。我像产品经理一样,在这个窗口说两句,切到那个窗口看一眼,发现问题说一嘴,然后让它继续跑。两小时后,全部收工。

这种体验,以前只有带一个团队才能有。现在一个人,就有了。

网站那摊事

个人网站新版,千问 3.8 从头开始搭。

我说:"帮我搭一个个人网站,简洁风格,有首页、项目列表、文章列表、关于我四个页面。用 Next.js。"

它开始建项目、写组件、配路由。我在另一个窗口忙着写文章,隔几分钟切过来看一眼。

"导航栏的颜色太深了,浅一点。" "文章列表加个日期。" "首页的自我介绍改短一点,现在太啰嗦了。"

每次都是一句话的事。说完了切走,让它改。改好了我回来看一眼——嗯,可以——切走继续干别的。

中间有一段,它自己在配 Tailwind 的响应式断点,我完全没管。直到它说"做完了,要不要预览一下",我才发现它甚至把移动端的适配都做好了。

换成以前,我自己写这些,光是搭脚手架就要半小时。如果外包给其他开发者,沟通成本可能比开发时间还长。现在——跟我说话的这个人(不对,这个 Agent),沟通成本几乎为零。

文章那摊事

文章更典型。

那两篇 Harness 的文章,核心想法是我出的——"Harness 就是旧地图套新大陆"。但这个想法本身,如果让我自己写,从构思到成文,一篇至少需要半天。不是打字慢,是思考慢——找素材、组织逻辑、推敲表达、反复修改,每一步都消耗大量心力。

但这次不一样。我把核心想法喂给 Agent,它帮我展开、找论据、搭结构、写初稿。我只需要做"判断"——这段能留、那段要改、这个例子换成那个类比更贴切。

我从"创作者"变成了"编辑"。 这个角色切换,节省的心力不是一点半点。创作最累人的是面对空白文档的第一稿,而 AI 帮我越过了这一步。我要做的只是把已经成型的东西调好,而不是从零捏一个出来。

两篇文章,两个不同的 Agent 同时写。我在两个窗口之间来回切——这边改一段,那边改一段。两小时,两篇完稿。

升级那摊事

Open Claw 的升级是技术活,更考验 Agent 的能力。

有一个功能改动涉及三个文件的联动修改,还有一些依赖版本的冲突要处理。K3 先看了现有代码,理解了整体结构,然后给出了改动方案。我确认了一下方向没问题,它就开干。

中间碰到一个测试跑不过。它自己看了报错,定位到问题,改完,再跑——过了。

全程我就在旁边看着。严格来说,不是"我升级了 Open Claw",是"我看着 K3 升级了 Open Claw"。

为什么能做到?国产大模型真的上来了

坦率地说,如果这些 Agent 背后是能力不够的模型,你不敢同时开四个——因为每个都需要你频繁纠错、重试、救火,多窗口只会变成多线崩溃。

但今早这四个窗口,几乎没有"救火"时刻。

千问 3.8、GLM 5.2、K3——这三个模型在各自的任务上表现都很稳。不是说完全没有小毛病(偶尔也会偏一下方向),但整体上,你需要介入的频率已经降到了"管理"的量级,而不是"手把手教"的量级。

这是一个质的拐点。

以前用 AI 编程助手,体验是"我有一个很聪明但不太靠谱的实习生"。他确实能干活,但你要一直盯着,怕他搞砸。你敢派给他的,都是一些边角料任务。

现在的体验是——"我有四个能独当一面的 junior engineer"。你交代清楚需求,他们就自己推进。你只需要在关键节点看一眼,确认方向没偏。你可以放心地把不同的任务分给不同的人,然后你的角色变成调度者,而不是执行者

能力越稳,信任越高。信任越高,并行度越高。并行度越高,产出越可怕。

"一个人就是一个团队"不是比喻

以前这句话是鸡汤。现在它是事实。

想象一个场景:以前你要做四件事,只能串行。A 做完了做 B,B 做完了做 C,中间还有切换成本。两小时,能把 A 做得不错就不错了。

现在呢?四件事并行推进,你在中间做"胶水"——定义方向、做决策、做集成。两个小时,四件事都做完。

这不是生产力提升 30%、50%——这是数量级的提升。

而且最妙的是认知负担的转移。以前你脑子里要同时装四件事的所有细节。现在每件事的细节在各自的 Agent 上下文里装着,你只需要在脑子里装"四件事的当前状态"——类似"网站那边在调样式""文章那边需要我审一下第三段""升级那边跑测试中"。一个轻量级的 dashboard,而不是四个沉重的代码库。

你的脑子从"存储器"变成了"调度器"。这是完全不同的工作方式。

国产大模型,值得重新认识

最后说一句国产大模型。

过去提到国产模型,总有一种"能用但不如国外顶级的"印象。千问、GLM 这些,很长一段时间里给人感觉是"第二梯队"。

但今早的体验让我重新想了一下这件事。

是,单看某些 benchmark,它们可能还不是第一名。但当你需要并行处理多件事的时候,模型的"靠谱程度"比"最强程度"更重要。

一个能稳定跟住你的思路、少犯低级错误、出错了能自己修的模型,比一个偶尔输出惊艳但经常跑偏的模型,更适合做你的 Agent。

千问 3.8 和 GLM 5.2,在这方面的表现远超我的预期。不是"能用",是"好用"。

国产大模型已经到了一个阶段:你不再需要因为"它是国产"而降低期待。它自己就能满足期待。


两个小时内,四个窗口,四件事,全部完成。

我坐在电脑前,看着四个终端窗口里的 Agent 各自忙碌,突然有一种奇怪的满足感——不是你"做完了一件事"的满足感,而是你"指挥了一个团队打完了一场仗"的满足感。

这种感觉,希望你也能体验一下。


如果觉得有用,点个在看,转发给还在犹豫要不要试试国产大模型的朋友。有什么想法欢迎在评论区聊聊——你用过哪些国产大模型做 Agent?体验怎么样?哪个最稳?

END