开源「鲁班」Skill,Claude Fable 5下线前跑通的升级工作流!

图像

来不及解释了,

Claude Fable 5 昨天上线,定位是 Mythos 的安全公开版。
回忆一下 4 月份的 Mythos 当时就是称之为神话级模型,找出了 1 万多个零日漏洞,我刚拿到这个模型的时候,其实有点不知道该测什么。

因为说实话,我测了游戏,也测了 3D 世界,看它那个豪华的评分效果,这些都不会是能难倒它的问题。

Claude Fable 5 这次开放得很突然,窗口也很短。

按 Anthropic 现在给出来的信息,从昨天到 6 月 22 日(就剩 11 天了),Pro、Max、Team 和按席位计费的企业版用户,都能在订阅里用到 Fable 5。
6 月 23 日之后,它会先从订阅方案里移除,后面什么时候再回来,要看官方容量。

如果你是 Claude 订阅用户,我的建议很简单。

这十几天,别拿 Fable 5 问日常问题。

拿它做一件你一直想做,但平时觉得太麻烦很费脑子的事。

因为这玩意真的很贵,也真的很烧 Token。

我是 100 刀的 Claude Max 会员,刚开始也学着想玩玩宝可梦,结果玩一半都不到额度就没了。

所以我这 24 小时没有让它闲聊,也没有让它写文章看看写作是不是比 Opus 好很多。

我让它帮我做了一个 Skill。
更准确一点,是一个专门升级 Skill 的 Skill。

我给它起了个名字,叫鲁班 Skill

图像

🔗 github.com/LearnPrompt/luban-skill

它在一轮打磨之后,把我的 ai news radar 升级到了 v0.7 版本,直接上 GIF 就知道了。

GIF

为了让别人在第一时间,用 10 秒钟就能了解到这个 ai news radar Skill 能干嘛,

Fable 5 甚至用我电脑录制了一段完整的视频传到了 Readme,这段视频我一秒钟都没剪它自己甚至把模型生成过程的多余的时间剪辑掉了,就离谱……

除此之外,他还把我这个项目里原本表达了思路但没讲透的优势,打包成了同一个项目另外一个 Skill,ai radar。

还不止,鲁班 Skill 是会通过横纵的方法吸收同类型 Skill 的优势的(后面会详细拆解),这些优势不是我跟 Agent 凭空讨论或者一拍脑袋就想去迭代的,而是同类型项目拉开差距的特有功能。

会通过以下维度来判断,Github 项目的 Star 数历史和 Release 记录。
通过这些数据来判断它做了什么样的功能,从而导致它的 Star 有了一个非常快的提升。

所以一轮打磨之后还帮我追加了热点模式和时间轴模式。

同时,它还提升了给消息打分的门槛。
之前发现很多得分都在 100 分,是因为在信息源里面,如果 AI 信息源占比过多,分值权重就会很大。
但对于聚合站来说,AI 占比多并不代表完全的质量,

所以 Fable 5 专门做了一个评分的回测工具,算法我也全部公开出来了,让大家来看看这个 Fable 5 的代码水平怎么样。
所以,这就是一次打磨后的效果。

图像

更有意思的点是,我想给他开全量权限,让他连夜跑完的时候,Fable 5 是会主动去预测,它改完这个项目后面的所有想要用的权限,只开放这方面的权限。

图像

那这个升级 Skill 的 Skill 为什么叫鲁班呢?

因为它干的是把一块已经能用、但还很粗糙的木料(本地给自己用的 Skill),刨平、校准、开榫、打磨,最后变成一个别人真的愿意拿走、安装、复用的东西(能公开到 Github 上给所有人用的高水准 Skill)。

这也是我最近越来越强烈的一个感受。

很多人以为 Skill 是一个很神秘的东西,好像里面一定要有复杂脚本,自动化流程,MCP,浏览器操作啥啥啥的。

但大量真正好用的 Skill,主体其实就是提示语。

一段写得足够清楚,边界足够明确,失败模式足够多的提示语。

我常用的 20 万星的 superpowers 和 1.5 万星的 pm-skills 就是最好的例子。

这次的鲁班 Skill 也是这个思路,

这段时间我看了很多 Skill,有 GitHub 上的,有 ClawHub 上的,也有自己写着写着沉淀出来的。

然后我发现一个挺尴尬的问题。

能用,和能发布,中间差着一大截。

基本上所有的 Agent 都会有 Skill Creator 这个初始的 Skill。

确实,你可以直接跟 Agent 说你的需求,让它打包成为一个可以在自己电脑上、在自己的 Agent 上能够顺利运行的 Skill。
我 Hermes 给我打包的 Skill 都上百个了,但我也就打磨开源了 10% 不到。

图像

一个 Skill 在自己电脑上能跑,不代表别人看得懂。

别人看得懂,不代表愿意安装。

愿意安装,不代表三分钟内能跑出第一次工作流闭环。

这就是很多 Skill 发布的时候卡住的地方。

它像一个没有验收标准的手艺活,

你问 Agent 帮你改 SKILL.md,它大概率会干什么?

加几个小标题,补一点触发词,写一段更漂亮的 description,再把 README 整理得工整一点。

有用吗?有但不大。

所以我给 Claude Fable 5 的任务,不是让它润色一个 Skill,而是让它打磨我的 ai news radar 项目,完成一个完整的升级流程。
从这一次升级里面提取出来的这个鲁班 Skill,当然随着它改的项目越来越多,鲁班 Skill 肯定还会发布 2.0 甚至 3.0 版本的。
但是留给 Fable 5 的时间不多了,我决定先把 1.0 版本开源。

[!info] 阅读导览
全文 5 节,即鲁班 Skill 的升级工作流五步:先挑战前提(1.1)→ 去找同类(1.2)→ 横纵分析(1.3)→ Darwin 式评分(1.4)→ SkillOpt 式候选改写(1.5),最后附"发布前六问"

flowchart LR
    A[挑战前提<br>解决谁的问题 / 为什么值得装] --> B[找同类<br>GitHub / ClawHub / skills.sh]
    B --> C[横纵分析<br>纵向演进 + 横向对标]
    C --> D[Darwin 式评分<br>9 维度打分]
    D --> E[SkillOpt 候选改写<br>每轮只改一个方向]
    E --> F{验证门}
    F -- 通过 --> G[出师证书<br>可发布]
    F -- 不通过 --> D

1. 用「鲁班」Skill 升级你的 Skill

1.1. 先挑战前提

会分出去一个掌柜的(产品经理),判断这件工具到底解决谁的什么问题,为什么值得安装。

# skill.md 部分节选1
真实问题:这个Skill解决的真实用户问题是否成立?
独特角度:它的唯一性来自方法论、脚本资产、私有经验、数据、工作流还是展示效果?如果没有唯一性,直接指出同质化风险。
安装理由:用户为什么要安装它,而不是临时问Agent?
公共传播性:它有没有一句话传播钩子?有没有可截图、可录屏、可展示的结果?

这个 Skill 解决的问题真的成立吗?

用户为什么要安装它,而不是临时问 Agent 一句?

它有没有独特的方法论、脚本资产、数据、工作流、展示效果?

它有没有一句话能讲出去的传播钩子?

这些问题先答上来再改。

因为大部分 Skill 的问题,不是写得不够好,而是压根没想清楚为什么值得存在。

1.2. 去找同类

鲁班师爷会派几个行脚去找同类型的 Skill,分析它们为什么被收藏,安装和传播。

# skill.md 部分节选2 **并行搜索策略**
使用子Agent并行搜索提高效率。建议的分工:
子Agent 1 — GitHub同行:搜 <关键词> skill、<关键词> agent skill、<关键词> SKILL.md、<关键词> Claude skill、<关键词> OpenClaw skill
子Agent 2 — Skill市场:ClawHub、skills.sh、Tessl等目录里的同类分类、热门Skill、相近工作流
子Agent 3(用户指定了对标时才需要):深读用户指定的对标仓库或Skill,分析它的README、安装路径、showcase做法
搜索词从当前Skill的name、description、README首屏、核心任务中提取,生成三组:功能词(它做什么)、人群词(谁会用)、形态词(skill/agent/runtime名)。

这也是我觉得 Fable 5 比普通模型更适合干这件事的地方。

它会去横向看 GitHub、ClawHub、skills.sh、Tessl 这些地方里相近的东西。
哪些是直接竞品,哪些是间接竞品,哪些虽然不是同类,但 README、命名、showcase 做得特别好,值得借鉴。

图像

1.3. 横纵分析

# skill.md 部分节选3
纵向:这个Skill从哪里来,要走向哪里
它最初是为了解决什么具体痛点?
它现在是工具、方法论、工作流、风格迁移、还是自动化系统?
它从"私用"变成"公开可用"还缺哪一步?
下一版最该从哪条路演进:更强功能、更好展示、更稳安装、更通用适配、更高验证?

横向:行情里的同类凭什么立足
至少从以下维度判断:
命名钩子:名字有没有记忆点?是否一听就知道解决什么?
一句话定位:是否用人话说清楚用途?
安装摩擦:是否一条命令能装?是否需要复杂前置条件?
首屏信任:README首屏有没有徽章、GIF、截图、结果样例、真实数据?
可验证产物:跑完后有没有HTML、PDF、报告、卡片、diff、测试结果等"看得见"的东西?
安全边界:有没有说明不会乱删、不会泄露、不会擅自发外部请求?
生态兼容:是否明确兼容多个Agent runtime?
故事感:它是不是在讲"为什么现在需要这个Skill",而不是只列功能?

纵向看,这个 Skill 从哪个真实需求里长出来,现在解决什么,下一版应该往哪里走。

横向看,同类 Skill 为什么更容易被理解、更容易被收藏、更容易被安装。

最后交叉出一个判断。

图像

我们真正要抢的生态位,到底是什么。

Fable 5 给我的一个判断就很有意思。

它没有把重点放在「再做一个更好的 AI 日报网站」上。

它反而指出,真正有差异的地方,是 GitHub Pages 上那份静态 JSON。

也就是,它天然就是一个不需要鉴权、不会被下线、可以 fork、可以直接 curl 的开放数据接口。

我当时看到这个判断,确实愣了一下。

因为这不是一个功能建议。

这是生态位判断。

按我以前的思路,大概率还会继续往页面、订阅、信息源、展示样式上加东西。

但它把我从「做一个更好的新闻站」这条路,

拽到了「把自己的公开数据接口说清楚」这条路。

1.4. Darwin 式评分

鲁班师爷会派个量尺师傅来测出最先要打磨的面。

图像

这里我让鲁班 Skill 固定用 9 个维度打分,Frontmatter 与触发条件、工作流清晰度、失败模式、检查点、可执行具体性、资源整合度、整体架构、实测表现等等。

里面权重最高的是实测表现。

也就是说,一个 Skill 写得再漂亮,如果没有测试 prompt,没有前后对比,没有真实输出样例,它也不能算升级成功。

这点我觉得很适合拿来给所有公开 Skill 当体检表。

图像

因为现在很多 Skill 最大的问题,就是 Readme 里的 showcase 老好看了,实际上跑起来就像纯草稿。

1.5. SkillOpt 式候选改写

这块借鉴的是微软 SkillOpt 的思路,

把 Skill 文档当成一个可以优化的状态,但每一轮只改一个主要方向,而且要过验证门。

比如这一轮只修触发词,就不要顺手重写 README。

这一轮只补失败模式,就不要顺手加一堆 showcase。

否则最后你根本不知道变好是因为哪一步。

图像

这个思路很像做实验。

图像

不要一次改十个变量,然后看着结果变了,就说自己找到了方法。

鲁班 Skill 最后会要求候选改写必须过几个门。

至少 2 个典型测试 prompt 输出优于原版。

README 首屏能在 10 秒内说明价值。

安装路径没有新增明显摩擦。

当然,鲁班 Skill 里面还有很多其他很有意思的概念。

比如摆活儿的,就是专门去优化你的 README 和 Showcase。

另外还有访行、过尺、慢刨和回炉等各种各样的概念,以及最终的出师证书。

你看,这就从「写 Prompt」变成了「做产品」。

这也是我这次最想分享的地方。

过去我们讲 Prompt,很多时候讲的是单次效果。

但 Skill 这个东西,开始把 Prompt 变成一种更接近产品的东西。

它有定位,有触发场景,有失败边界,有 showcase,有安装路径。

它不是一次提问。

它是一种可复制的工作方式。

图像

到时候我应该还会开源一个新的 Skill。
这个 Skill 会让我们开源到一个项目里的所有 Skill 都能保持同样类型的风格,让大家一眼就能看出来这就是你做出来的。

我现在越来越觉得,

普通人用 AI 最重要的资产不是收藏了多少工具。

是有没有把自己反复做的那几件事,变成自己的 Skill。

怎么去研究一个陌生领域。

怎么判断一个选题值不值得写。

你怎么把一个粗糙项目包装成能发布的作品。

这些东西一旦沉淀下来就会变成你值得对外分享的手艺。

鲁班 Skill 干的事,就是帮我们去打磨这门手艺。

它不保证每个 Skill 都能火。

这个我也不敢吹。

但它至少能帮你在发布之前,把几个最要命的问题问一遍。

  • 谁会用?
  • 为什么装?
  • 怎么触发?
  • 交付什么?
  • 比同类强在哪?
  • 怎么证明?

答清楚了,再去写 README、补 showcase、录 GIF、做测试 prompt。

完整版本我还会继续迭代,

但这个版本已经足够你拿去喂给你的模型,先给自己所有的 Skill 做一次升级。

我强烈建议你找一个已经能用但还没发布的 SKILL.md 试一下。

用鲁班 Skill 挑挑刺,再整个好活。

[!success] 核心要点

  • 鲁班 Skill 是什么:一个专门升级 Skill 的 Skill,把"能用"打磨成"能发布"(GitHub:LearnPrompt/luban-skill)
  • 五步工作流:先挑战前提(为什么值得存在)→ 找同类(并行搜索对标)→ 横纵分析(纵向演进 + 横向对标)→ Darwin 式评分(9 维度,实测表现权重最高)→ SkillOpt 式候选改写(每轮只改一个方向 + 验证门)
  • 验证门标准:至少 2 个测试 prompt 优于原版;README 首屏 10 秒说清价值;安装无新增摩擦
  • 核心理念:大量好用的 Skill 主体就是提示语;Skill 是把 Prompt 变成可复制的工作方式,从「写 Prompt」走向「做产品」
  • 发布前六问:谁会用?为什么装?怎么触发?交付什么?比同类强在哪?怎么证明?