Agent 操作浏览器的九条路线:从 Playwright 到 Computer Use

Nine Tiers of Browser Automation for AI Agents — and the Layered Architecture That Actually Works

上个月一个团队来找我,说他们要做企业内部的 AI Agent,需要操作浏览器。

第一个问题就是:「用 Playwright 还是 Browser Use?」

我说这个问题本身就问错了。就像你问「盖楼用钢筋还是混凝土」——答案是都用,但用在不同的层。

Browser Automation 在 AI Agent 语境下,已经不是一道单选题。它是一张技术地图,九个梯队,各有适用场景。而真正在生产环境里跑通的企业 Agent,几乎都是 分层架构——API 优先,结构化浏览器控制居中,Vision 兜底。

Agent 浏览器自动化八梯队

[Read More]

Agent 进入企业,还差一个工位

What Agents Need Is Not More Intelligence, But an Onboarding Process

七月的 WAIC 展馆,人声鼎沸。

大模型展台前挤满了人,Demo 屏幕上的 Agent 行云流水——自动写代码、自动做报表、自动回客户邮件。观众鼓掌,媒体拍照,投资人交换名片。

然后你回到公司,打开内部系统,发现你的 Agent 连个工号都没有。

它没有账号登录 CRM,没有权限查数据库,没有工位接收任务,出了错不知道找谁。它站在企业大门外,能力满分,但进不来。

阿里巴巴资深技术专家谢吉宝在 WAIC 2026「从大模型到智能体:迈向自主智能新纪元」论坛上说了一句大实话: 绝大多数 Agent 还站在企业门外,瓶颈已从模型能力转向组织兼容性。

他的解法是:给 Agent 一个工位。

Agent 工位五层模型

[Read More]

模型正在吞噬 Agent 框架

Models Are Eating Agent Frameworks — Thin the Layer or Pay the Debt

昨晚十一点半,我盯着自己那个钉钉数字员工项目里的一段代码发呆。

那是 core 模块里的轮询逻辑——每隔 3 秒去 serve 端拉一次会话状态,判断任务是否完成、是否超时、是否需要 abort。旁边是 session 管理:维护一个内存里的 Map,记录每个会话的生命周期、重试计数、上下文快照。再往下是 abort 清理:当用户取消任务时,要优雅地终止正在执行的工具调用、回收资源、把中间状态写回。

加起来大概 200 行。写得挺漂亮,有状态机、有超时退避、有异常兜底。我三个月前写它的时候,serve 端还没有原生的会话生命周期管理,没有 SSE 事件流推送,没有内置的 abort 语义。这 200 行是当时唯一的选择。

但昨晚我突然意识到: 这些代码的保质期,可能只剩一年。

不是因为它们写错了,而是因为它们正在被模型和运行时从两端同时吞噬。

[Read More]

招 Agent 工程师,我第一个看的不是技术

The AI-Native Litmus Test — Leveling Agent Engineers Beyond Code

上周面试一个候选人。简历很漂亮——三年 LLM 应用开发,做过 RAG、做过 Function Calling、做过多轮对话系统。

我问他:「你平时自己写代码用什么工具?」

他说:「IntelliJ,偶尔用 Copilot 补全。」

我又问:「你上周的工作流是什么样的?从接到需求到交付。」

他想了想:「看需求文档,设计方案,写代码,联调,测试,上线。」

我说:「这个流程里,AI 在哪个环节?」

他愣了一下:「……写代码的时候用 Copilot。」

技术没问题。但他自己的工作流和五年前一模一样。

那一刻我就知道,他做不出好的 Agent 系统。 一个自己都不是 AI 驱动工作方式的人,设计不出 AI 驱动的产品。

Agent 工程师分级:从会用 AI 到 AI 原生

[Read More]

拟人化的数字员工:不是会聊天的机器人,是能胜任岗位的数字同事

Anthropomorphic Digital Employees — Competent Colleagues, Not Chatbots

我的树莓派群里有一个播报机器人,叫 pi9-bookworm。它每天定时推送 AI 新闻 Top 10,格式固定,雷打不动。

上周有人在群里丢了一条字节跳动 AI 视频的链接。pi9 没有任何反应——它的程序里没有「看到链接该做什么」这个概念。

然后 opencode 出现了。它是群里的数字员工。没人 @ 它,它自己冒出来:先把当天的 AI 新闻按「大模型 / 应用 / 硬件」分了三类,然后说「这条视频值得展开分析」。有人 @ 它说「分析一下」,30 秒后它给出了完整解读——技术路线、产品影响、对钉钉的竞争威胁。

pi9 和 opencode 在同一个群里。但一个是工具,一个是同事。

拟人化的数字员工:从聊天机器人到数字同事

[Read More]

Agent 应用工程师——AI 时代增长最快的新岗位

Why the Fastest-Growing Role in AI Is Not the Algorithm Engineer

上个月帮一个制造业客户做 Agent 落地。他们的 IT 总监带了一个五人团队来接项目,清一色的 Java 后端,简历上写满了 Spring Boot 和微服务。

我让他们用 Coding Agent 开发一个采购审批 Agent。两个小时后,代码写完了。

然后空气安静了。

没有人知道接下来该干什么。ERP 怎么接?权限怎么配?审批流走错了怎么回滚?Agent 半夜跑飞了谁来兜底?Token 烧超了怎么控?

五个人面面相觑。代码不是问题。 问题是代码写完之后的所有事。

那一刻我意识到:AI 时代最稀缺的能力,不是写代码,而是 把一个 Agent 从 Demo 变成生产系统,再把它运营成一个靠谱的数字员工

做这件事的人,我称之为 Agent 应用工程师

Agent 应用工程师:三层分工金字塔

[Read More]

AI 时代产品迭代速度提升一倍:不只是编码快了

Every Link in the Product Loop Got Compressed — Not Just Code

上个月和一个做 SaaS 的朋友吃饭。他的产品刚上线四个月,已经迭代了 9 个版本。

我说:「你以前在互联网公司,一个季度能发几个版本?」

他想了想:「两个。还得是顺利的情况下。」

「现在呢?」

「一个月两个。有时候三个。」

我问他为什么快了这么多。他的回答让我愣了一下:

「不只是写代码快了。是 所有事 都快了。调研快了,做素材快了,看数据快了,连决定砍哪个功能都快了。」

这句话比「AI 让编程效率提升 10 倍」重要得多。因为它指向一个被严重低估的变化: AI 压缩的不是产品迭代的某一个环节,而是全链路。

产品迭代全链路压缩

[Read More]

SFT、RL 与 Self-RL:从大模型训练到团队管理的优化系统

Training LLMs, Managing Teams, Raising Kids — Same Optimization System

去年年底,一个带三十人团队的朋友跟我吐槽:「我团队执行力特别强,交代什么做什么,但就是没人主动提新想法。」

我问他:「你的绩效考核怎么算的?」

他说:「Bug 修复数、代码行数、需求交付准时率。」

我说:「那你训练出来的不是工程师,是 KPI 优化器。他们不是不会探索,是探索了没奖励。」

他愣了一下:「这跟训练 AI 有什么区别?」

区别不大。真的。

[Read More]

两个数字员工,一个组织:企业数字员工开发最佳实践

Two Digital Employees, One Org — A Reference Architecture for Building AI Workforce

上个月我在钉钉群里发了一句话:「给数字员工加一个查闲忙的能力。」

十分钟后,我收到了三条消息。第一条来自 Coding Agent:「✅ 已创建 Issue #12:日程能力——支持查询闲忙。」第二条还是它:「✅ 开发完成,15/15 测试通过,已 push,CI 运行中。」第三条来自数字员工本身:「🤖 v1.3.1 已上线,日程插件已更新,随时 @我 开始工作。」

从一句话到生产环境上线,我没有打开电脑,没有写一行代码,没有手动跑一次部署。

这不是 Demo。这是我过去三周每天在用的工作方式。

两个数字员工一个组织:Coding Agent 开发、CI/CD 交付、数字员工上线

[Read More]

为什么 AI 选人、选品、选股、选爆款,都不太灵

The Structural Reason AI Struggles with the Four Hardest Selections

上周跟一个做消费品的朋友聊天,他说:「我们去年花了大几十万买了一套 AI 选品系统,模型跑出来的 TOP 10 推荐,没有一个最后卖爆的。反而是我们产品经理在逛小红书时随手截图说『这个感觉会火』的一款,成了年度销冠。我跟老板汇报的时候都不知道怎么解释——AI 花了五十万选不出来,人刷了五分钟手机选出来了。」

我听完笑了——不是因为 AI 不行,而是因为这种故事太常见了。选股、选人、选品、做爆款内容,四件事看起来领域完全不同,但如果你仔细看它们失败的方式,几乎一模一样。

这不是 AI 暂时不行,是 问题结构决定了 AI 天然受限

AI 选不准的四件事:小样本、非平稳、有博弈、反馈慢

[Read More]