同一篇 Issue 文章,在一天里留下了 14 条自动门禁 PASS 记录。质量、事实、AI 味和模型用户视角检查都曾放行。
但它仍被连续退回:案例背景看不懂,结尾金句不好,“还是不好”,再短一点,用更具体的例子讲。
这组记录揭开了 AI 写作中一个常被忽略的问题:评审通过,只能说明稿子没有撞上已知的坏法;它不能说明 AI 学会了作者的品味。
分数守住底线,差异暴露取舍
AI 评审擅长检查显性问题:事实是否越界、格式是否合规、句子是否像模板、章节是否完整。它很像代码里的 linter,能阻止明显错误进入下一步,却很难回答“为什么这句话虽然正确,我仍然不想这样写”。
真正的答案藏在改稿里。
我整理了三组人工修改。CDP 稿补上术语解释,把“请求成功”改成“行动后还要回读结果”;Issue 稿删除多系统架构,改用一次筛选器误修复讲清任务恢复点;谈经验传承的稿子删掉木匠、医生等泛化类比,换成初级程序员做数据库迁移的现场。
另一篇 tmux 稿更明显。AI 原稿从“老派工具”谈起,塞进诺基亚、烤面包机和插线板等比喻。用户把这些元话大段删除,先提出真实问题:怎么用 Codex 监督 Kimi Code K3,再依次写做法与感悟。
这些改动没有给文章打出一个更高的分数,却留下了更精确的偏好信号:少谈写作姿态,先交代问题;少堆类比,多给动作;抽象判断必须由真实后果托住。
人类终稿可以成为参照物
一篇最新论文采用了相似思路。研究者以高质量人类短剧成品作为 Skill 更新的参照,先把成品压缩成只剩故事骨架的大纲,再让 Agent 重建剧本。随后,另一个 Agent 必须把重建稿与人类原作逐项对照,差异再被写回外部文本 Skill 库;模型权重没有改变。
这套比较需要一个人类已经认可的终点。没有原作,评审模型只能表达自己的平均偏好;有了原作,它至少要解释人类为何在这里收尾、为何删掉旁白、为何让道具真正参与情节。
这项研究目前只验证了短剧创作,而且仍标注为 work in progress。它不能直接证明同一方法适用于技术文章。但“从成品差异中学习品味”的思路,值得迁移到日常写作流程。

偏好学习需要四道手续
第一,保存版本谱系。初稿、人工终稿、修改者和修改原因必须能对应,不能只留下最后一版。
第二,从多份 diff 提炼候选规则。单次删除可能只是局部修辞;跨多篇反复出现的“术语后置”“真实问题先行”,才可能是稳定偏好。
第三,每条规则绑定原文、终稿和解释,并由人确认后才能进入 Skill。Agent 可以提出候选项,不能自动修改 SKILL.md。
第四,用未参与提炼的留出稿验证。若规则只会复刻旧文章,或让新稿更僵硬,即使自动评分上涨也应撤回。
AI 评审仍然重要,但它应当负责守门。人类一次次改稿留下的差异,才为 AI 提供具体的取舍方向。
