Skill 越装越多越乱?需要调用时又不知道该调用哪个?我给 Agent 加了一层能力决策层

海外账号升级业务:chatshare.uno
质保 30 天不掉订阅,掉订阅,按天退差价
我以前经常卡在一个很小、却特别浪费时间的问题上。
有时是写公众号文章,有时是在开发过程中做技术选型、设计接口、调试或审查代码。电脑里明明已经装了不少 Skill(给 Agent 的一套执行说明),名字和功能却很相似:这个能写作,那个也能写作;这个能分析代码,另一个也说自己能解决技术问题。
我通常只会在 Codex 的预览列表里挑一圈:记得住的直接用,记不住的先放着。Skill 越装越多,真正需要时反而不知道该选哪个;挑一个怕选错,一起调用又担心重复。

装新的也不省心。有些只是名字不同,能力几乎一样;有些看起来相似,实际边界又完全不同;同一个 Skill 还可能在不同来源里出现多个版本,真正生效的是哪一个,也说不清。
有一次,我又在几个目录之间来回切换,突然意识到:我缺的不是更多 Skill,而是一个负责判断的中间层。
于是,我把这层判断单独做成了 SkillTriage。
Skill 已开源,文末附 GitHub 地址和安装方式。
我把缺的那一层做出来了
SkillTriage 不负责替你执行任务,也不是一个 Skill 市场。它站在“发现”和“执行”之间,先判断现有 Skill 该怎么选,以及新的 Skill 值不值得装。
它的第一步不是让你回忆某个 Skill 名,而是扫描当前环境,建立一份本机能力清单。如果手里已有官方文档或 GitHub 仓库,也可以直接把名称或地址交给它。
接着,它会把任务拆成目标、约束、输入、交付物、环境和权限,再筛选候选。初筛由 Python 标准库脚本完成,负责收集可重复验证的证据;随后 Agent 会阅读候选的完整 SKILL.md,理解它们真正能做什么、不能做什么。
得到的不是一串相似名字,而是一份选择报告:为什么推荐它、为什么不选另一个、要不要组合、当前环境能不能直接使用,以及下一步该怎样显式调用。

这和关键词匹配不一样。关键词只能判断“看起来像不像”,完整说明才能判断“能不能交付需要的结果”。如果一个 Skill 已经足够,报告会直接写明“无需额外 Skill”,不会为了凑组合而推荐一串工具。
安装前,先让它踩一脚刹车
SkillTriage 最有价值的一道检查,发生在安装之前。
看到官方文档里的安装命令,或者 GitHub 上一个看起来不错的 Skill,可以先把仓库名或地址交给它。候选会进入隔离目录,再接受物理路径、正文哈希、文件树、同名冲突和本地引用检查。
这些确定性检查能发现“文件完全重复”或“同名但正文不同”;语义检查则继续比较任务、输入、输出、工作流和边界,判断候选究竟增加了新能力,还是换了名字的旧能力。
报告不会把所有相似性压成一个模糊分数,而是给出明确裁决,例如 SKIP_DUPLICATE、USE_EXISTING、REVIEW_COLLISION、INSTALL_SCOPED 或 COMPOSE。你能看到候选新增了什么、哪个现有 Skill 可以替代它,以及安装后可能由哪个副本生效。
这套流程默认只读。它不会自动安装、删除、覆盖或移动文件,也不会执行待安装 Skill 里的代码。真正改变环境之前,仍然需要你确认。

可以直接这样问:
1 | $skill-triage 检查我准备安装的 Skill:<仓库地址>,先不要安装,告诉我是否和本机已有能力重复。 |
它会先排查候选信息:

再与本机已有 Skill 比较能力和触发关系:

裁决里会写明能力增量、冲突和环境影响:

真正使用时,不用先记住 Skill 名
到了真正做事或需要判断的时候,直接描述目标、约束和交付物就行。SkillTriage 会从本机能力中选出最适合当前问题的主 Skill;确实需要配合时,再给出最小组合和调用顺序。
比如开发一个功能,需要在两个技术方案之间做选择,可以这样问:
1 | $skill-triage 我正在开发一个功能,需要在两个技术方案之间做选择。请找出适合辅助架构权衡和代码审查的 Skill,先解释调用顺序和判断依据,不要直接改代码。 |
它会结合当前场景给出主推荐:

同时列出其他候选和各自适用的场景:

如果当前信息还不足以确定,也会保留其他场景下的预选:

写文章、做产品取舍、设计 API、排查线上问题和评审代码,都可以用同样的方式提问。重点不是让 SkillTriage 替你拍板,而是找到一个能拆解问题、列出约束、比较方案和暴露风险的思考辅助者。

海外账号升级业务:chatshare.uno
质保 30 天不掉订阅,掉订阅,按天退差价
使用之后,看看谁真的被调用过
只知道“推荐过谁”还不够。有些 Skill 看起来很重要,实际很少被调用;有些经常被推荐,执行时却总被另一个替代。
如果工作流显式记录了推荐和实际调用,可以输入 $skill-triage history 查看本地 HTML 报告。

报告会分别显示推荐次数、实际调用次数、成功、失败、被替换次数和常见组合,也可以按调用次数筛选。

这些数字也会回到当前的选择报告中,作为决策背景。但调用次数多,只能说明它更常被采用,不代表它一定适合这次任务。最终仍要回到任务目标、交付物、运行环境和完整的 SKILL.md。
调用记录是可选的。只有 Agent 工作流或用户确认后显式写入 record 事件,history 和 stats 才会有数据;没有记录时只会显示“暂无记录”,不会把未知历史写成 0 次。日志只保存 Skill 名称、时间、任务类别、结果、耗时和组合关系,不保存完整提示词、Token、Cookie 或文件内容。
如果只是想整理本机 Skill 库,而不是处理某个具体任务,还可以使用 doctor 检查同名冲突、正文重复、能力重叠和损坏引用。
它不是万能的,但会把不确定性写出来
SkillTriage 不会假装自己能读懂所有隐藏能力。读不到文件时,它会标记“未验证”;语义重叠无法只靠哈希确认时,它会要求复核;相似度只是审查线索,不是删除依据。它也不是安全认证工具,检查通过不等于候选来源一定可信。
我更看重的是这份克制。Skill 越来越像软件包,真正需要的不是继续堆目录,而是在安装前做判断、调用时讲清依据、使用后留下可以追溯的记录。
Skill 用得越多,积累下来的也不只是工具数量,还包括自己处理架构、产品、写作和工程问题的思考框架。
如果你的 Skill 越装越多,却越来越难选,可以把 SkillTriage 放在安装和调用之前,先做一次判断。
GitHub 地址:https://github.com/ZekerTop/skill-triage
一句话交给 AI 安装:
1 | 帮我安装一下这个skill:https://github.com/ZekerTop/skill-triage |
往期文章👇
GPT Plus升级失败?没有虚拟卡、海外信用卡怎么办?全新技术实现24小时自助直充升级GPT
AI完成任务太耗时?想要摸鱼却又怕耽误时间,于是我做了个AI任务完成提醒器
教你在国内用一个套餐同时体验到Claude Code+Codex两大AI编程助手
最后感谢大家能够看到文章的最后,如果你觉得这篇文章对你有启发或者帮助,不妨点个关注,你的支持将是我最大的动力,我们下次见!
Skill 越装越多越乱?需要调用时又不知道该调用哪个?我给 Agent 加了一层能力决策层
https://gptguide.cn/pages/agent-skill-capability-decision-layer/
