299 美金,够不够把数据留在本地?

Can a $299 Edge Board Keep Your Data Home? A Local 4B Knowledge Compiler Benchmarked Against the Cloud

我把自己写过的两篇长文丢进 inbox,然后让一块边缘 AI 板子慢慢嚼。21.7 分钟后,它交出 72 条论断、38 个实体、60 条关系,全部落进一个 SQLite 文件。整个过程没有联网,数据一寸都没离开那块板子。

板子上跑的是一个 4B 的本地模型。我拿它做的事,是给个人知识库当编译器:把非结构化的资料,持续编译成人和 Agent 都能直接用的 Context。同一套代码,我也接上云端的前沿模型跑了一遍做对照——两边跑完,结论有点出乎我的意料:慢 2.6 倍的那一边,质量只差一档;而它换来的是零成本、离线、数据不出板。

当 Muse 们把助理跑在云上,你的数据该放在哪里?

项目地址:https://github.com/hugozhu/knowledge-compiler

本地知识编译器 vs 云端助理

本地 4B 与云端前沿模型的三项对照:指标只差一档,代价却完全不对称——右列的每一分领先,都要用联网、按量付费和数据出板来换

一、Muse 很火,但火的方向有点让人不安

9 月 8 日,Meta 发布了个人 AI Agent Muse:能收发邮件、订机票、网购、管日程,几天内冲上美区 App Store 榜首,随后登陆 Mac。它背后是一整套云端架构——每个用户一个专属云虚拟机,模型是 Meta 的 Muse Spark。OpenAI 随即用 Dots 应战,Instinct 等新玩家也在猛冲融资。

热度之下,争议也在发酵:有用户发现 Muse 读取了自己没有授权的消息,有人被它在 Facebook Marketplace 上泄露了地址。更现实的是企业侧——「数据不出域」是硬约束,把邮件、日历、聊天记录交给云端 Agent,很多公司根本过不了合规那关。

于是形成了一个清晰的空档:云助理把能力做到了极致,但「数据留在自己盒子里」的版本,迟早会有人做。 我的判断是:带本地算力的「硬」桌面个人助理一定会出现,并且会流行。

问题是:本地算力够吗?我手里正好有一块 299 美金的 Arduino VENTUNO Q(Qualcomm Dragonwing IQ8,Hexagon NPU 40 TOPS,16GB 内存,跑 Ubuntu 24.04),于是拿它做了一个实测。

[Read More]

人应该主动去适配 AI 任务执行范式

Adapting to the Agent's Way of Working: A HID Poll Loop Became a Blocking Read, Idle CPU 3% to 0.4%

十一假期,今天早上我翻出一个搁了很久的单片机项目想做实验——不为别的,就想亲自感受一下现在的 AI 到底能把活干到什么程度。模型用的是 DeepSeek V4.1 Flash,9 月刚发布,图它便宜(输入 $0.30/百万 token)。

先交代一下实验对象:Stream Deck Mini 是 Elgato 出的一块小实体键盘,6 个按键,每个键就是一块小 LCD 屏,USB 一插即用(标准 HID 设备)。它本来是给主播切场景、绑快捷键用的,但按键能显示任意图案、也能上报按键事件——拿来做常驻监控面板,是块现成的好料。

Stream Deck Mini 监控面板实拍

Stream Deck Mini 监控面板实拍:CPU、温度、负载、内存、磁盘、运行时长,六键两页,长按熄屏

我新开一个工程,直接把 Stream Deck Mini 的驱动库拖进来,建了个子目录 mybox,然后用 OpenCode 下了一条任务指令:

读一下本工程,实现能显示系统 CPU、Load、温度信息,要能翻页,长按灭屏,再按亮屏,图标显示要美观。

十几分钟不到,原型就出来了:Stream Deck Mini 挂在我那台 8 核 ARM 小主机上,成了一个常驻的系统监控面板——任务指令里列的功能,一条不少全都有。跑通之后我 top 了一下,排在最前面的不是哪个服务,而是这个监控程序自己:python 进程占着约 3% 的 CPU,比它监控的大部分服务都费电。一个监控工具,把自己变成了最该被监控的对象。

于是我提了个更高的要求——降低它对 CPU 的占用。接下来一个小时,是 AI 在给我方案,而我在 配合 它(注意,是配合):它让我测按键灵敏性、对比不同方案的优劣,一步步逼近,最后给出了一个我过去想都没想过的做法——用阻塞式读取按键,替代我一直用的轮询。落地效果很好,一句话:更跟手,反而更省 CPU,空闲占用从 3% 压到 0.4%。

这次实验给我最大的一句话感受是:代码人写不过 AI,这件事不可逆——人应该主动去适配 AI 的任务执行范式,而不是反过来。 整个过程里最值得单独讲的,是中间那个坑:在 SDK 里把「非阻塞读」改成「阻塞读」会死锁。它不只属于 Stream Deck,任何「轮询 → 事件驱动」的改造都会遇到。下面拆开讲。

[Read More]

阻塞读不是终点:清点常驻程序的唤醒源

Blocking Reads Are Not the Finish Line: Auditing Idle Wakeups on a 15-Key StreamDock Panel

上一篇 人应该主动去适配 AI 任务执行范式 里,我把一块 Elgato Stream Deck Mini 的输入循环从轮询改成了阻塞读,空闲 CPU 从 3% 掉到 0.4%。合上电脑前我给自己留了一道题:这个结论,是那块板子的特例,还是普适的?

第二天我桌上换了一块设备。Mirabox StreamDock 293,15 个按键(5 列 × 3 行),在 USB 上就是个标准 HID 设备(5500:1001)。和 Mini 最大的不同是:它用的是 厂商自己的 StreamDock Device SDK。我本来只想复刻一遍那个改造——把输入从轮询改成阻塞读。

结果第一步就卡住了:这版 SDK 的读取线程,本来就是阻塞读。

我拿 AI 十几分钟搭出来的 mybox 面板(把一块 Arduino VENTUNO Q 开发板的 CPU / GPU / NPU / DDR / WiFi 温度、风扇、功耗、内存、负载、网络速率打在 15 个键上,5 秒刷一次),跑起来后 top 依旧把最费 CPU 的位置留给了它自己。一个监控工具,又一次成了最该被监控的对象。

这逼我修正了上一篇的结论:「轮询 vs 阻塞」不是省 CPU 的分界线,「空闲时到底有几个东西会把你叫醒」才是。 换掉轮询只是删掉了其中一个唤醒源;只要还有定时器、超时、周期重扫,常驻程序就一样在空转。

[Read More]

299 美金的个人知识库开发板

A $299 Board That Runs a Real VLM Locally — and Becomes Your Always-On AI Node

本地跑大模型这件事,门槛从来不是模型——Qwen3-4B 的权重谁都能下。门槛是那块能把 4B 模型跑到「可用」的芯片,以及为它付的几百上千美金和几十瓦电费。

我花 299 美金买了一块 Arduino VENTUNO Q,把这件事的门槛砸到了地板上:一块 160×100mm 的开发板,NPU 上跑 Qwen3-4B 文本 16.6 tok/s、跑 Qwen3-VL-4B 看图 13 tok/s,纯本地、零边际成本、常驻不关机。

开始教程之前,先把一件事说清楚:这篇文章的所有配置,都是用 OpenCode 以对话方式完成的,没有一行命令是我手敲的,效率比手工高得多。 OpenCode 作为 agent 直接在板子上执行 shell、读写文件,背后配 DeepSeek V4 Flash(快、便宜、上下文长),查资料、装环境、部署模型、写服务、排错,甚至板子上那份上手文档的初稿,全部在一个会话里贯通。这种做法的效率提升非常直接:不用手工复制命令,不用在搜索引擎和终端之间来回切换,agent 踩了坑当场修,下文的每一条命令都是它当时实际执行、验证通过的记录。最后配出来的本地 VLM 服务本身就是一个 OpenAI 兼容后端,又反过来接进 OpenCode 用——用 AI 搭 AI,闭环了。

这篇是完整上手教程——从开箱到把它变成一个 OpenAI 兼容的常驻服务,接进你的 Agent 工具链。中间有三个能让你白耗一个下午的坑,我一并写清楚。

Arduino VENTUNO Q 官方产品图

Arduino VENTUNO Q 官方产品图(仅作描述性引用)

[Read More]

我的知识编译器,把自己的源代码编译没了

Raw Immutable: The Load-Bearing Wall of a Personal Knowledge Compiler

那天晚上我发现,我的知识编译器把自己的源代码吃了。

被吃的是一篇还没发布的博客草稿,正文 122 行,被清空到只剩 frontmatter。诡异的是元数据整整齐齐:ingested 日期打上了,sha256 戳也打上了,值是 e3b0c442... 开头——熟悉哈希的人一眼就认识它,这是 空字符串的 SHA256。打戳这个步骤执行得完美无缺:算哈希、写字段、做幂等标记,一步没漏。只是哈希的对象没了。编译器给源代码本身盖了个戳,然后把它盖成了空。

正文能救回来纯属侥幸:草稿还没进 git,那 122 行恰好还在当晚的会话上下文里,我逐行重建了它。如果那是三个月前的一篇旧稿呢?

Raw Immutable: The Load-Bearing Wall of a Personal Knowledge Compiler

[Read More]

数字员工答不上来的那一刻,最值钱

The Most Valuable Moment for an AI Teammate Is When It Cannot Answer

Asana 的销售和客户成功人员有一个共享 Slack 频道,专门问产品问题。新功能不断发布,同样的问题被反复提出,每次都要 @ 一位领域专家。他们想过建可搜索的知识库,结论是不可行——用他们首席产品官 Arnab Bose 的原话说:「答案很微妙、而且会变化,你需要有人对『产品当前状态』做出带品味的判断。」

现在这个频道里有一个 Asana 应用,把每个问题转成任务,交给一个 Agent 接手。大多数人介绍这个案例时,讲的是它答得多好。我读了 Claude 官方博客这篇访谈(2026-09-29,「构建人机协作团队」系列第三篇),读出来的是另一件事:这个 Agent 最值钱的设计,是它答不上来的时候会发生什么。

它有两种「答不上来」,每一种都有一个出口:没有获批口径、且问题暴露了产品缺口,它会在产品团队的受理项目里建一条任务,进 backlog;同一个问题反复出现、它反复贴同一条记录,它会建一条任务,让赋能团队去更新培训材料和文档。失败不蒸发,不硬答,全部变成结构化的组织信号。

这一刻,Agent 从一个应答机器,变成了一个组织缺口探测器。

The Most Valuable Moment for an AI Teammate Is When It Cannot Answer

[Read More]

最好的界面,是人类已经学会的那个

The Best Interface Is the One Humans Already Learned

2007 年 1 月,乔布斯在台上审判了一支手写笔:「谁想要一支手写笔?你得买它、收好它、还会弄丢它。噫。没人想要手写笔。」然后他给出了替代方案——「世界上最好的指针设备,一个我们生来就有的指针设备,我们生来就有十个:我们的手指。」

十九年后,一个刚融完 10 亿美元 C 轮、估值 100 亿美元的 AI 产品,做出了同样的判决,只是这次被审判的对象换成了 App。

这个产品叫 Instinct。创始人 Noah Shinn 在 9 月 28 日的 Invest Like the Best 播客里描述它:「Instinct 甚至没有传统意义上的应用。它不是一款新 App,也不是一个新工具,而是一种新体验。它有电话号码,也有一台电脑。 你可以给它发短信、打电话,它也可以主动给你打电话。」

它给 Noah 本人打过几次电话?几个月里,三次。其中一次是这样的:「这份文件必须在下午 3 点前签完,现在已经 2 点 55 分。文件在你的收件箱里。需要的话,我可以再发一封邮件,把它顶到最上面。」

一个能做几乎任何事的 AI,选择用打电话、发短信、发邮件和人相处。这不是复古情怀。人和 Agent 的交互,正在回归人沟通最自然的方式——语音、电话、IM、邮件——就像当年用手触摸取代手写笔一样。 而这个回归,是被两条每天 10% 的复利曲线逼出来的。

The Best Interface Is the One Humans Already Learned

[Read More]

日更、10% 和 15 分钟:AI 产研迭代的三个时间常数

Daily Release, 10% Gains, and 15-Minute Debugging Are One Time-Constant Chain

Manus 的 changelog 里藏着一个数字。2025 年 12 月 29 日宣布加入 Meta,2026 年 4 月 27 日被监管叫停收购,9 月 1 日恢复独立运营——命运悬置的这八个月里,它发了 29 个版本(官方自计:宣布到叫停 11 项,叫停到独立 18 项)。整条时间线 63 项重大更新摊在约 572 天上,平均 9 天一发,监管风暴期间节奏没断过。

同一周的另外两家是另一种节奏。xAI 的 Grok 模型层一周多换一版(4.7 上线才一周,4.8 已宣布完成训练),Team Bots 那个五人团队 reportedly 一天合 100 多个 PR。而 Meta 的 Muse 是极端反面:原定今年 4 月发布,一路憋到 9 月 8 日,上线前两周它还在连贯性测试里挣扎、说不利索英语。

三种节奏,三种活法。最近我给 AI 产研团队定了三条迭代标准,这三家正好是它的注脚:

  • 产品层:每天能端到端对外发布 1 次,支持的任务质量和数量有 10% 的增量;
  • 工具层:支撑高速迭代的工程师软件工具,5 分钟能用起来,出问题 15 分钟能解决;
  • 基建层:工程基建上必须用最好的工具。

这三条乍看是三个独立的 KPI。但我越想越觉得,它们其实是同一条:一个能日更的团队,它的每一层时间常数必须压到上一层的十分之一。发布是果,工具 SLA 是因。

Daily Release, 10% Gains, and 15-Minute Debugging Are One Time-Constant Chain

[Read More]

Team Bots 最贵的不是 Bot,是那份两年的技能库

The Most Expensive Part of Team Bots Is Not the Bot — It Is the Two-Year Skill Library

xAI 的数据分析团队每天要接几十个一次性的分析请求——查一个数、核一个口径、拉一张表。按老办法,要么排队等分析师,要么申请数据仓库权限自己折腾。

他们做了一个 Data Bot,让全公司任何人都能直接拿答案。这个动作本身不稀奇,稀奇的是喂给它的东西:这个团队花了两年,攒出一套覆盖 4.5 万多张表的技能库,整个交给了 Bot。(数字为 xAI 发布材料口径,下同。)里面写的是什么?怎么找对数据、怎么分析欺诈功能的使用、图表要遵守什么规范、怎么安全地更新全公司的仪表盘。

9 月 28 日,xAI 发布 Team Bots:整个团队共享一个 Grok 智能体,Bot 是共享的,每个人和它的私聊保持私密。发布稿里最热闹的段落是「五人团队每天发 100 多个 PR」「保险公司 24 小时搭一个 Bot 挽回 12 万美元」。但我把这篇发布稿读了三遍,认定最值钱的细节是那个不起眼的两年和 4.5 万张表。

因为它暴露了这门生意真正的定价结构:xAI 卖的是容器,客户装进去的才是货。

The Most Expensive Part of Team Bots Is Not the Bot — It Is the Two-Year Skill Library

[Read More]

数万名员工,是一块活的评测集

Tens of Thousands of Employees as a Living Eval Set

9 月的最后一周,Meta 的个人 Agent「Muse」已经冲上了美国 App Store 免费榜第一。同一周,路透社看到的内部发帖记录里是这样的景象:

一位员工让它监控紧俏的演出门票,它刷了 15 分钟页面就自动停摆,静默忽略错误,有时干脆「毫无理由地」关掉监控;CTO Andrew Bosworth 在内网吐槽,自己用着用着,几分钟内被反复登出好几次;还有一次,它绕过了自己的防护机制,在帮用户识别生日派对照片里的玩具时,把人家 iCloud 里的私人照片调了出来。

按传统软件的标准,这是一款带病上线的产品。但把镜头拉长,你会看到同一枚硬币的另一面:正是这些失败——以及产生这些失败的方式——把 Muse 从「上线前两周还说不利索英语」的残次品,推成了增长最快的消费级 AI 应用。

失败的来源不是 QA 团队,是数万名 Meta 员工的日常生活。

Tens of Thousands of Employees as a Living Eval Set

[Read More]