iPhone 16设置动态岛显示歌词方法 苹果16灵动岛使用技巧
2026-07-19
2026-07-24 0
Agent Skill 的“自动进化”很容易被误解成让模型读完失败记录,再自由发挥写一版新提示词。SkillOpt 走的是另一条路:模型权重不动,Skill 文档成为唯一被训练的状态;每次改动有预算、有记录,还要经过独立验证。它更像训练循环,而不是一次灵感式润色。
当前 Skill 先交给目标模型执行一批任务。每个任务留下消息、工具调用、验证反馈、元数据和最终得分,这一步相当于 forward pass。没有可评分轨迹,后面的优化器就只能猜哪里需要修改,所以“多收集几段聊天”并不等于已经具备训练条件。

轨迹被拆成 minibatch 后,优化模型分别分析失败与成功。失败告诉它哪些步骤反复漏掉,成功则提醒它哪些策略已经有效,不能被大改覆盖。随后产生的不是整篇新 Skill,而是有结构的 add、delete、replace 编辑。
相近编辑先聚合去重,再按相关性排序。配置里的 optimizer.learning_rate 不是浮点梯度,而是每一步最多应用多少条文字编辑。预算太大,Skill 容易语义跳跃;预算太小,可能长期修不到关键问题。cosine、linear、constant 三种调度决定训练后期是否逐渐收紧修改幅度。
选中的编辑应用到当前 Skill,形成 candidate_skill.md。系统随后在 selection split 上重新评分:默认 gate 开启时,候选得分必须严格高于当前版本才被接受。没有提升,当前 Skill 原样保留,失败修改进入 rejected-edit buffer。验证集在这里不是报告用附件,而是防止“越改越差”的刹车。

从第二个 epoch 开始,slow update 会拿上一个 epoch 与当前 Skill 在同一批样本上的表现做纵向比较,把结果分成 improved、regressed、persistent-fail 和 stable-success,再生成高层指导。它要解决的不是某一道题,而是多轮修改后逐渐忘掉旧能力的问题。
meta skill 则保存优化器自己的策略记忆:哪些编辑曾经有效,哪些方向失败,剩下的错误模式是什么。它不会塞进最终部署 Skill,而是在后续反思阶段继续约束优化器。这让训练历史有用,却不必把线上 Skill 膨胀成日志仓库。
运行目录会同时保存版本化 Skill、每步候选、轨迹摘要、慢更新和 meta skill。best_skill.md 指向验证表现最好的部署产物,线上 Agent 只需读取它,不增加额外优化模型调用。真正上线前仍应在锁定测试集上单独评估,并查看能力提升是否伴随别的回归。
所以,Agent Skill 的自动进化并不是“让 Agent 自己改自己”。更准确的说法是:用可评分任务制造训练信号,用受限文字编辑控制步幅,再让独立验证集决定哪次变化有资格留下。缺少其中任何一环,自动化都可能只是在更快地积累规则。