Anthropic 领先行业 6 个月——但只有前两层算数

Anthropic Leads by Six Months — but Only in the First Two Layers

发完 从 Cowork 到 Tag:AI 的竞争单位,正在从个人变成组织 第二天,那个年轻人又发来一条消息。这次他没提问,而是直接甩了一个判断:

「对 AI 创业者来说:Anthropic 领先行业 6 个月。」

他还给了自己的三层拆解:

层次Anthropic 的领先点领先幅度
Foundation ModelClaude 系列整体非常强0-6 个月,且会快速收敛
Agent HarnessClaude Code / Cowork / Tag 形成完整 Agent 工作范式~6 个月
Agent-native Organization从「人使用 AI」走向「Agent 成为组织成员」~6-12 个月

他的结论是:模型层的领先会快速收敛,真正值得关注的是后两层。而且第三层,恰好是钉钉「数字员工」可以承接的位置。

前两层,我认同。第三层,我认为 写反了

在 Agent-native Organization 这一层,Anthropic 不是领先者,是刚入场的人。

Anthropic Leads by Six Months — but Only in the First Two Layers

[Read More]

从 Cowork 到 Tag:AI 的竞争单位,正在从个人变成组织

Cowork Is AI Times a Person, Tag Is AI Times a Team, and the Organization Comes Next

发完 Grok Bot 的跟班学习,会先干掉 RPA 市场 第二天,那个年轻人又发来一张截图:Anthropic 内部的 Slack 频道里,有人 @Claude 派了个活,Claude 接过去干,下一个人直接在它停下的地方接着做。

他问我一个问题:「这不就是多人版的 Cowork 吗?」

我的第一反应也是——Cowork 一月发,Tag 六月发,都是 Anthropic 家的,一个跑在你自己的电脑上,一个住在 Slack 里,看起来只是场景不同。

但想了两天,我的答案变了:Tag 和 Cowork 的区别不是「几个人能用」,而是 Agent 的身份变了——从「我的 AI」,变成「团队的 AI」。

把这两个产品连起来看,你会发现 Anthropic 其实画出路线图来了:AI × 人 → AI × 团队 → AI × 组织。前两段他们已经画完。而第三段,恰好是模型层的盲区。

这条路上还藏着一个更隐蔽的变化:贡献第一次变得可观测了——组织度量贡献的方式,即将跟着变。

Cowork Is AI Times a Person, Tag Is AI Times a Team, and the Organization Comes Next

[Read More]

Grok Bot 的跟班学习,会先干掉 RPA 市场

RPA Is Low-Code Programming, and Demonstration Is Its Final Compiler

今年 2 月,我写过一篇工程文章 通过桌面录屏实现自动化 RPA 的最佳实践:用录屏捕获屏幕画面和鼠标键盘事件,让多模态大模型理解操作序列,再自动复现。为了验证可行性,我自己写了实现——光录制模块和关键帧提取就是几百行代码,文末我还特意提醒:这条路离可用产品有距离。

六个月后,8 月 11 日,SpaceXAI 把这个机制直接做成了正式产品 Grok Bot。每个 Bot 拥有一台独立的云端 Linux 虚拟机,学会一个流程不需要任何配置:你像平常一样操作一遍,Bot 在旁边看着、记下来,下次它自己干。想用,先买 $200/月的 SuperGrok Heavy 订阅,或者 $120/人/月的团队版。

媒体标题都在喊「马斯克终极大招」「数字同事上岗」「硅谷炸锅」。但我想聊一个被忽略的部分:Grok Bot 最狠的不是「能干活」——能干活这件事,Claude Cowork 能做,OpenAI 也能做。真正狠的是 跟班学习 这四个字。它第一个会干掉的市场,不是聊天框,不是 Office,而是 RPA 行业。

RPA Is Low-Code Programming, and Demonstration Is Its Final Compiler

[Read More]

别再用技能衡量自己:AI 时代的成长单位是闭环

The Loop, Not the Skill, Is the Unit of Career Growth

前几天,那个年轻人又给我发消息了。

月初我在 从用好 AI 到管理 AI 里记录过他的困惑:每天都在用 AI,prompt 也调得不错,但总觉得还是在「自己干活」。我当时的回答是,他卡在「用好 AI」这一级,要往「带 AI」「管理 AI」走。

他回去照做了。这次他告诉我:又订了三个工具,整理了 30 条常用 prompt,还刷完了两门 AI 课程。然后他问了一个新问题:

「我的工具更多了,效率也确实高了。但为什么反而更焦虑了?如果明天出一个更好的工具,把这些全做了,我还剩下什么?」

我当时没有马上回答。不是问题难,而是他问的已经不是「怎么用好 AI」,而是一个更根本的问题:AI 时代,衡量一个人成长的单位,到底是什么?

几天后,吴恩达在 The Batch 上发了他的新来信,标题是「AI 奖励能构建新技能的通才」。这封信把这个问题往前推了一步——但我觉得,还可以再推一步。

The Loop, Not the Skill, Is the Unit of Career Growth

[Read More]

Eval 是品位

Evals Are Taste

上周发完 一切皆插件:DeepSeek Harness 的野心与收敛鸿沟,一位带研发团队的读者给我发消息:「十次修改能不能收敛,你说取决于 eval。那我们让团队多写点测试用例,是不是就能收敛了?」

「多写点测试」是标准答案,也是错误答案。

它错在把 eval 当成一个纯的工程问题——好像数量上去了,收敛自然就来。但真正决定收敛的,不是 eval 有多少,而是 eval 集长什么样。而 eval 集长什么样,取决于一个更不好量化的东西。

品位。

Evals Are Taste

[Read More]

一切皆插件:DeepSeek Harness 真正硬核的是三个细节

Everything Is a Plugin: Three Details That Make DeepSeek Harness Real

前天写 一切皆插件:DeepSeek Harness 的野心与收敛鸿沟 时,我说 DeepSeek 开源的不是工具,是运行时。当时主要看的是官方页面和仓库门面。这两天陆续有人把整个仓库拉下来逐包分析,翻出来的东西比我想的更硬。

其中有一份源码深扒(作者 @Ai 学习的老章,文末有出处)把 200 多个包从启动配置翻到 Agent Loop、事件管线、上下文压缩,再加上我自己读了一遍官方架构文档,发现「一切皆插件」这句话真正站得住,靠的不是插件数量,而是三个很容易被忽略的细节。

这三个细节,恰好是「运行时」和「工具」的分界线。

Everything Is a Plugin: Three Details That Make DeepSeek Harness Real

[Read More]

一切皆插件的时代,唯一不可插件化的是信任

In an Age of Pluggable Everything, Trust Is the One Thing You Can't Plugin

前两天,一个问题把我问住了。

有人问我:DeepSeek 说「一切皆插件」,一切核心都可以替换——模型可换、循环可换、连会话日志都是插件。那么,什么东西是不可替换的? 是不是只有人和人的协作?再往深一层,是不是「信任」不可替换?

我盯着这个问题想了很久,因为它恰好戳中了我这两天写 一切皆插件:DeepSeek Harness 真正硬核的是三个细节 时一直绕不开的东西。

一切皆插件——注册即副作用,卸载即回滚。整个系统的设计哲学只有一句话:没有什么是不能拿掉的。

但真的什么都可以拿掉吗?

答案是否定的。有一样东西,不管架构怎么解耦、日志怎么追加、插件怎么热插拔,它既不能被替换,也不能被快速恢复。

那就是信任。

In an Age of Pluggable Everything, Trust Is the One Thing You Can’t Plugin

[Read More]

AI 重构行业的速度,是可以算出来的

The Speed of AI Disruption Is Computable

上周有两个消息放在一起看,特别有意思。

一条是:AI 客服已经能独立处理大部分标准咨询,有的团队把人工坐席砍了一半以上。另一条是:AI 医生还在辅助写病历的阶段,离独立诊断隔着十万八千里。

同一种技术,同一个十年,为什么差出这么多?很多人的答案是「医疗数据难搞」「监管严」——都对,但都只是现象。现象背后有一个可以算的东西: AI 重构一个行业的速度,是有公式的。 这个公式不仅能解释客服和医疗的差距,还能告诉你自己的行业排在队里的第几个。

The Speed of AI Disruption Is Computable

[Read More]

一切皆插件:DeepSeek Harness 的野心与收敛鸿沟

Everything Is a Plugin: DeepSeek Harness and the Convergence Gap

昨晚刷到一篇实测文,作者用 DeepSeek Harness 做了一个叫 MacDynamicIsland 的原生 macOS 应用——刘海、菜单栏、悬浮胶囊三个入口,快捷笔记、剪贴板、截图置顶全都有。时间线是这样的:

  • 2 小时:从零到大部分功能可运行
  • 1 小时:改一个文本框的交互和字体颜色,反复修改,始终没有收敛——修好一处,另一处又坏了
  • 30 分钟:把同一份代码交给 Codex,文本框、字体颜色、交互优化基本收敛到可接受状态

作者很克制,特意声明这不是一次公平对比——Codex 接手时已经有了完整的项目基础,问题边界也被前面的试错磨清楚了。我认同这个声明。但这条时间线里藏着一个比「谁更强」重要得多的信号:从 0 到 1 只花了 2 小时,从 1 到 1.1 却花了 1 小时还没做完。

而 DeepSeek 对这件事的态度,就写在它刚开源的 Harness 里。

Everything Is a Plugin: DeepSeek Harness and the Convergence Gap

[Read More]

一场 AI native 的战略会:开完之后,组织比开之前更聪明

A Closed-Loop Strategy Meeting That Makes the Organization Smarter

这周二,我开了一场 AI 钉钉的战略沟通会。

会开完了,按惯例,事情应该到此为止——大家听完、散场、各自回去干活。但这一次我盯着会后那张评估问卷的回收数据,突然意识到一件事:这场会从头到尾,没有一个环节是「用完就扔」的。

HR 在会前一周就用 AI 表格收集了同学们的问题,其中大家最关心的是千问办公和钉钉的关系;我基于这些真实问题,用千问办公读我的个人 wiki,生成了一份沟通会叙述稿,自己调整之后做成 PPT;会后,HR 又用千问办公加 AI 表格技能,基于沟通内容生成了一张调研问卷,回收数据,再用千问办公对整场会的效果做了评估。

一场内部沟通会的完整生命周期——从「同学们关心什么」到「这场会到底有没有效」——全部跑在 AI 工具上,而且每一环的输出都是下一环的输入。

我觉得这很 AI native。但真正让我停下来想的,不是用了多少工具,而是另一个问题: 一场会开完,它留下的东西,到底是资产还是损耗?

A Closed-Loop Strategy Meeting That Makes the Organization Smarter

[Read More]