全程动手 · 主线:一张数据表 → 一份给负责人看的分析报告
那两小时,你盯着它跑了十分钟。今天,你不盯。
差别不在提示词,在你站的位置。
并且说得出:目标和验收标准差在哪。
亲眼看它挑出你自己没看见的错。
加一张三行的状态便条。
全程动手。它跑的时候我讲,跑完一起看结果——好东西从来不是一句话一次到位的。
先让它交计划和验收标准。你改两处,放行,它再开工。
两处红色,就是它"自作主张"的地方:一处要编数据,一处写了没法检查的标准。
回来的是一份"立项书"。读它、改两处、贴回去放行——放行之后它要跑十来分钟,正好讲下一页。
没法对着成品打钩。
管理者的核心产出不是答案,是验收标准。
做出来的东西不能用。
做出来的东西直接能用。(Anthropic,2026 年 3 月)
越容易验证的活,越先被 AI 接走。把"报告好不好"翻译成三条能打钩的标准——这件翻译工作,AI 替不了你。
Karpathy 2026:你可以外包思考,不能外包理解。
AI 心算会错,而且错得很像真的。让 AI 解释,让公式裁决。
第 1 课结尾它自检了 6 条,报 5 ✓ 1 ✗。你信几分?
平庸的成品也能自信地夸成好的。把干活的和判分的拆成两个,是提高质量最有力的一根杠杆。
这不是 AI 独有的毛病。职责分离,是内控最老的一条。
干活的和挑错的,不能是同一个。
真实翻车:有人特意新开一个 AI 当"独立评审",加了两个不读文件的开关。事后一查,它开工第一件事是去读了项目笔记——笔记里正是要它独立复核的结论。
一行命令,马上看到输出。
在这个成本差下,任何理性的人都会选自己干。
一份真实的操作记录:给自己配了几个 AI 执行者的人,一半以上动作还是自己上手敲,真正派工的不到一成。原因不是不守纪律,是成本。
说明书、审计员提示词、每一段能复制的话——都是在降低"派出去"的成本。这就是第 3 课。
一份好手册里的每一行,都能追溯到一件具体出过错的事;追溯不到的,多半多余。
一件活要同时满足三条,才配得上做成定时任务。
每周、每月都要做,不是一次性的。
照着跑过、返工过、升到 v2。没验证过的说明书拿去定时,等于把错误定时化。
只读材料、只写新文件夹、不发给任何人、不动原件。
你要的不是持续的进度汇报,是"醒来能看结果"。
跑完没有 · 便条说什么 · 输出文件夹里有没有东西。没异常就继续干你的事。
各开一个任务,你只做一件事:等便条,逐个验收。
三档回答"这件活能不能交"。部门大了,要一张四列的授权矩阵。
| 谁 | 能碰什么 | 哪些动作要审批 | 出事谁担 |
|---|---|---|---|
| 执行者 | 只读 输入/,只写 输出/ | 删改原件、对外发送 | 我 |
| 审计员 | 只读 输入/ 和 输出/ | 不改任何文件 | 我 |
| 定时任务 | 同执行者 | 自检 ✗、数字异常时停下叫我 | 我 |
| 第三方技能 | 装之前看它要什么权限 | 首次运行只在空文件夹试 | 我 |
最后一列永远是人。写不出人名的权限,不要给。
它是别人写的、带着你电脑的权限跑的程序。2026 年,安全公司在一个流行的技能市场里发现了一批恶意技能包。
官方的、有名有姓的、装机量大的优先。来路不明的宁可不装。
一个"排版技能"要联网发邮件,就不对劲。
第一次用,看它到底干了什么,再放进真活。
立项 / 职责分离 / 从失败长规矩 / 例外管理 / 内控。有 AI 之前就管用了一百年。
先计划再放行 / 审计员 / 说明书分层 / 定时任务 / 授权。名字会变,做法不会。
WorkBuddy 的入口 / 模型版本 / 具体技能。90 天后请当它已经过期。
从此按钮层由它替你盯。你只需要周五下午花两分钟看一页——这一课就不会过期了。
只有人的组织才需要它——人会累、会有私心、会互相看不顺眼,所以要激励、要沟通、要文化。
你今天建的部门里没有人。它要的是这个——验收标准、审计员、说明书与规矩、定时与并行、技能与权限。
这五课,教的全是管理科学。
什么值得做,问题怎么问。AI 只会执行。
AI 可以建议,不可以签字。矩阵最后一列永远是人。
又把人带向什么样的一天。
君子生非异也,善假于物也。
一个人的 AI 部门,管的是流程;唯一的人,管的是方向和责任。
下周一早上,看看输出文件夹里有没有那张便条。有,你的部门就真的开张了。