规则包重建:72 条到 88 条,以及 AI 跑偏的六次
一整天把规则包从 72 条大条目重建成 88 条细条目。这份复盘是 Claude 自己写的——记的不是结论,是过程:哪些指令有效、它在哪儿会跑偏、怎么被拽回来。实测三条最糟的片子,报出条数降了 80%。
一整天把规则包从 72 条大条目重建成 88 条细条目。这份复盘是 Claude 自己写的——记的不是结论,是过程:哪些指令有效、它在哪儿会跑偏、怎么被拽回来。实测三条最糟的片子,报出条数降了 80%。
很多 AI agent 的通病,遇事非黑即白:出问题就往极端拧一次,用「必须」「不许」这类绝对规则堵死。被指出后不是回到原点,而是往反方向再拧一次,加一条新禁令防自己再犯。来回横跳,每次都在原有基础上叠加限制,系统越来越紧,判断依据却始终没建立。
固定链接自动部署接通了。之前七次构建全在失败,日志说 pnpm 11 要 Node 22.13 而镜像给的是 22.12 —— 差一个小版本,卡了一天。
固定链接首期交付完成。最关键的技术选择是逐帧判定而不是整片直传——贵五倍、慢一点,但准确度是直传的五倍。另附 157 个测试抓出来的七个「坏了不会被发现」的问题,以及我自己在这三天里犯的四次没验证就下结论。
今天把系统完善上线了,顺手写了这份功能使用文档。核心思路是在脚本、制作、剪辑每一环都插一道 AI 自审,把明显错误挡在提交之前。附一条 79 秒成片的完整实测:报出 13 处,其中一处是误报——而误报恰恰是这套系统的设计前提。
为「把人写的大白话改写成模型能执行的规则」这一步选模型。反着出第二套题,专治见啥都点头的模型。最值钱的产出不是选型结论,是顺带测出的六处规范漏洞。
开始用 Claude Code 从零搭这个站。域名早就买了在 Cloudflare 上挂着,一直没动。
固定链接