公开更新于 2026-08-12
建立可治理的 AI 工作系统
把任务表达、规则、Skill 与执行环境串成一套可以运行和复盘的工作系统。
关联:
这个实践在干什么
不是再介绍一个“AI 工具推荐清单”,而是在真实工作里反复使用同一套四层结构,看它能不能:
- 让下一次任务少从零解释
- 让错误和边界可追溯
- 让“能不能上线/能不能改规则”这类高代价动作有明确停手点
假设(当前版本 v0.2.1)
通过任务契约、规则、技能和执行环境的分层,可以在不依赖个人临场发挥的前提下,复现更稳定的结果。
这里的“稳定”指:同类任务的步骤与验收可重复,不是“永远正确”或“全自动无人值守”。
已经放进现场的三类任务(匿名公开)
以下只写任务类型,不写客户名与私人细节。
| 类型 | 任务契约在管什么 | Rule 在管什么 | Skill / 固定做法 | Harness 片段 |
|---|---|---|---|---|
| A. 知识站 / 内容产品 | 本轮改内容还是改结构;是否允许公网 | 状态字段、不假装有证据、发布确认门 | 栏目与 frontmatter 约定、本地 validate | 本地预览端口、构建审计、内容目录 |
| B. 协作方法论沉淀 | 要把口头习惯收成可执行协议,还是只聊天 | 全局规则优先于 skill 扮演;决策归人 | 模式切换(执行 / 短澄清 / 正式澄清) | 规则文件路径、修订历史、备份 |
| C. 固定口令的交付闭环 | 输入是否齐全、验收几条硬指标 | 凭证不落盘、范围门禁 | 专项 Skill / 脚本步骤 | 导出路径、校验清单、存档 |
三类任务共用同一骨架:先契约 → 再规则边界 → 再选能力包 → 在可验证环境里做完并留下记录。
已经看到的现象
有效的部分
- 有契约时,返工更常停在“标准没对齐”,而不是“模型突然变笨”。
- 把“发布 / 改全局规则 / 隐私路径”写成硬边界后,Agent 更少自作主张。
- 同类任务第二次开始,可以指向已有方法页或 Skill,而不是从头讲世界观。
仍然麻烦的部分
- 规则一多,上下文变长,出现规则互相打架或“先读哪一层”不清楚。
- 有些 Skill 仍像角色扮演或长文,和工程化短合同抢优先级(已通过全局优先序在纠正)。
- 多工具并行时,若交接只在聊天里,Harness 的“回写位置”一空,系统感立刻消失。
已知不确定性
- 换一个领域(例如强合规的公司交付 vs 个人内容)时,规则要迁多少才够用?
- 四层结构省下的时间,是否大于维护规则与 Skill 的时间?要以月为尺度看,不能用单次爽感代替。
- 多 Agent 同时写同一工作区时,最低可靠分工还没有定论。
下一次检查点
- 日期:2026-08-18
- 要核对什么:协作场景里,哪些步骤可以固定成 Skill,哪些必须保留“人回一句才能继续”;以及规则冲突是否比 v0.2.1 减少。
- 怎样算有进展:至少再留下一条公开证据(继续 pending / revised 均可),而不是只改文案。
公开承诺
本页是进行中的现场记录。
观察可以写,结论必须克制:在检查点之前,不把 v0.2.1 说成“已证明的最优工作系统”。