"用进废退"的 全 skill 进化系统

1 天前
 stebest

最近 skill 自优化挺火:微软 SkillOpt 拿基准分数当信号,darwin-skill 拿手写 测试题+评委团打分。两个问题:一次只能优化一个你想到的 skill——我装了 230+ 个,瓶颈是我的注意力,不是优化器;而且离线评审永远看不见真实使用—— skill 真正翻车那次、用户怎么纠正的,它们不知道。

所以我写了 lamarck,名字就是冲着 darwin 去的:装一次,全部已装 skill 进入 被动观察,哪个值得进化由证据浮现,不靠人工圈选:

两个 hook 静默记录每次真实 skill 调用,带 skill 文件内容哈希——每笔编辑 都有前后版本窗口,效果指标是用户纠正率(行为数据),不是模型自评 (darwin 引用的论文自己说 LLM 自评准确率约 46%)。 翻车的调用自动蒸馏成回归用例——测试题从现实里收割,零人工编写。 进化有门:≥2 次独立同类 gap 才出提案,有界编辑,用户三选一,后面还有 replay 重放、成对盲评、版本分窗三道回滚防线。 用进废退是字面意思:连续 10 次干净的 skill 降为抽查(收敛);90 天没人 引用的评分条目出修剪提案(废退)。离线优化器只会越改越长。 它用同一套规则进化自己,CHANGELOG 就是可审计的自进化史。 证据方面(自称"自我进化"的东西都该被怀疑,所以):机制自测 44/44,CI 三平台 (ubuntu/macos/windows);突变基准的协议先 commit 进仓库再跑评委—— 已知劣化变体拦截 4/5 、已知改善变体误拦 0/2,原始 verdict 逐字入库,漏网的 那个有公开分析。真实生产案例还在积累,没有的数字不吹。

安装一条命令:npx lamarck-skill(自动接 hook 、备份 settings 、装完自跑 自测)。MIT,遥测不出本机。

https://github.com/newdee/lamarck-skill

欢迎来砸 bench 协议——它就是为可复现设计的。

1009 次点击
所在节点    AI Agent 智能体
0 条回复

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1237990

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX