技能三大杀招:让Agent发现新招、告别翻车、打包大神经验!

技能根本不是什么提示词,它是一套正在吃掉你工作流的隐形操作系统!

把那个“技能就是个Markdown文件”的想法从脑子里扔出去——事情早就不是这样了!

2026年的AI圈正在分裂成两拨人:
一拨人觉得技能就是个花里胡哨的提示词包装,直接跟Agent说你要什么它自己会搞定,搞什么复杂框架纯属吃饱了撑的;
另一拨人,比如Y Combinator的CEO Garry Tan,把技能当成自然语言代码来维护和迭代,觉得这是下一件大事。

两拨人都不笨,那问题出在哪?答案很简单:说技能没用的人,他们脑子里想的那个“技能”跟现实世界里的技能根本不是同一个东西。 技能早就不只是Markdown了——它变成了一个夹在提示词和完整程序之间的灰色地带,而这个灰色地带正在悄悄吃掉你的工作流。

技能的定义早就炸了,没人说得清它到底是个啥

官方文档怎么说的?“Skills add reusable knowledge and invocable workflows”。翻译成人话:能重复用的知识和能调用的工作流。这定义宽到等于没定义。一个技能可以只是一个说明文件,也可以是一个带脚本、带工具、带参考文档的完整文件夹。从纯文本到可执行代码,中间全是技能的地盘。

拿三个东西来试试这个定义的边界在哪:
第一个叫Last30days,它帮你追踪HackerNews、Reddit、X上的动态。这玩意儿与其说是传统技能,不如说是一个能被Agent执行的迷你程序——里面除了Markdown还有代码和工具。

第二个叫Symphony,OpenAI开源的一个多Agent编排规范。它就是个Markdown文件,但里面写的是整个多Agent编排器的完整规格说明,推荐的安装方式是让Codex从零把它build出来。一个Markdown文件变成了一个产品的“壳”,每个用户build出来的东西都不一样。

第三个是插件,Claude Code、Hermes、Openclaw这些平台的插件生态已经相当成熟。插件不光包含技能,还有hooks和tools,它们在Agent的不同生命周期节点上介入——有些事你用纯技能就是做不了,必须上插件。

这三个东西放在一起,你还敢说技能“就是个Markdown文件”?所以最靠谱的定义只能往宽了说:技能就是帮助Agent完成任务的信息文件夹。故意模糊,因为这东西本来就没法精确定义。

技能解决的第一个问题:让你发现“原来还能这么玩”

GUI和命令行终端的关系,完美解释了技能在干嘛。命令行什么都能做,GUI能做的事命令行全能做——但问题是你记不住命令。更关键的是,面对一个空白的终端,你根本不知道“能做什么”。GUI把这个问题解决了:它把所有可用的操作明明白白列出来,把“回忆”问题变成了“识别”问题。

技能干的是同一件事。最酷的那些技能,本质上就是在给你看“原来Agent还能这么干”——你之前根本想不到。

比如youtube-notetaker这个技能,把YouTube视频里的幻灯片、笔记、转录文字一次性打包成结构化的笔记;你不是3D设计师?有个技能叫cc-blender-skill,让你用自然语言驱动Blender 5.x建模、材质、灯光、渲染、动画;你不会写HTML?有个WYSIWYG编辑器技能让你直接在页面上编辑和删改AI生成的内容;还有个技能能把Loom录屏视频直接转化成技能。

这些事你给Agent一个提示词它能不能做?可能能。但问题是你根本不知道可以这么问。

技能解决的不是“怎么做”,而是“还能做什么” ——这个区别大了去了。

技能解决的第二个问题:让Agent别再发神经

Agent有个臭毛病:极其不稳定。大多数时候走对路,但偶尔会钻进一个出不来的死胡同。同一个问题问两次,答案的结构、详略甚至结论都可能不一样。闲聊的时候无所谓,但写代码、做报告、搞部署的时候这就是灾难。

技能怎么解决?提供标准操作程序(SOP)。当一个任务看起来有不止一种完成方式的时候,技能告诉Agent“就走这条路”。这些SOP可以被反复打磨然后推送给每一个Agent——就像飞行员的手册,关键任务或者高频任务,我们不希望Agent每次都重新发明轮子。

最典型的例子是那些告诉Agent怎么对接外部资源的技能——没有它们,集成工作经常翻车。比如有Agent无视MCP协议,自己用computer-use去创建API密钥。这就是典型的不稳定——你给它一堆工具,它偏要用自己那套。

Google在2026年8月公开了他们构建、测试和规模化Agent Skills的完整流程。他们怎么保证质量?每个技能入库前必须通过自动化CI/CD流水线:linter检查元数据、目录结构和命名规范;链接检查器确保每个URL都有效;AI辅助检查清单验证指令是否遵循规定的结构模式。提交之后还有持续评估——文档和API会变,模型和Agent框架也会变,今天能用的技能明天可能就废了。

Google这一套东西说明了一个事实:当技能从个人玩具变成团队基础设施的时候,质量控制就不是可选项了,是必选项。

技能解决的第三个问题:把专家的脑子装进文件夹

有些领域的专业知识,用户自己不具备——网络安全、设计、SEO、营销。技能就是给Agent看的O‘Reilly技术手册。

具体例子到处都是:SEO技能帮你优化搜索引擎排名;网络安全技能做安全审计;营销和文案技能处理市场推广;前端幻灯片技能生成漂亮的HTML演示文稿。Garry Tan把YC的早期创始人多角色review文化编码成了31个Claude Code斜杠命令技能,他的gstack项目在GitHub上几个月就收获了近10万星——本质上是一套用“认知分工”把CEO、工程师、QA、Review各角色显式拆分的Agent工作流。

Anthropic打过一个特别好的比方:报税这种事,你愿意交给一个从第一性原理现推的300IQ数学天才,还是一个填过几千份税表的老手?大多数人选老手——不是因为他更聪明,而是他有积累的专业经验。通用模型就是那个数学天才,推理能力强得一塌糊涂,但缺你公司那套没人写下来的流程。

技能干的事,就是把老手的经验打包,让通用模型变成某个领域的专家。

截至2026年2月,公开可用的Agent Skills已经超过85,000个,支持这个标准的主流平台达到27家。仅官方索引到的仓库就超过15,000个,三大marketplace合计超过49万条目。但别被这些数字唬住——根据agentskillreport.com对673个技能的分析,22%连基本验证都过不了。52%的技能token是非功能性内容,许可证文件、构建产物、schema文件这些东西在技能加载时白白占用上下文窗口。

数量不等于质量,而且绝大多数技能质量堪忧。

技能解决的第四个问题:记住你是谁、你习惯怎么干活

这类技能最个人化——它们积累的是关于特定用户的专属知识。比如自动化销售外呼邮件排期的技能,完全符合用户自己的工作风格。它们的关键在于整合了来自之前Agent执行轨迹和用户反馈的信息。

学术圈有个说法:技能是Agent在决策时可以查阅的情景记忆。Hermes这类Agent框架已经实现了完整的“经验提取→知识存储→智能检索→上下文注入→执行验证→自动改进”闭环。技能不只是静态的说明文档,它们可以从执行中学习、从反馈中进化。

技能正在变成Agent的长期记忆——不是记住你说了什么,而是记住你怎么做事。

技能是一个正在形成的操作系统,问题是谁来制定规则

整体来看,技能让Agent系统在token空间里实现复利和规模化。模型光聪明不够——它们还需要程序性知识和如何在更大系统里工作的上下文。技能提供了这个桥梁。

2026年的格局已经相当清晰了。Anthropic在2025年10月推出Claude Skills,12月就把Agent Skills Specification V1.0开源成跨平台标准。TechCrunch管它叫“AI领域的Dockerfile”。2026年8月,Vercel联合Amazon、Cursor、Microsoft、OpenAI等巨头推出了Agent Plugins 1.0规范,旨在统一AI智能体的技能和工具格式,实现“一次编写,处处运行”。Linux基金会下属的AAIF在管理这个标准。

但热闹归热闹,问题也来了。一个技能让DeepSeek V4 Pro声称在多个基准上超越Fable 5的项目,被社区复测发现完全翻车——非但没提高成绩,还花了更多token。面对质疑,作者不公开评测记录,还删除质疑issue。这说明什么?

技能可以包装任何东西,包括假的。

另一个更棘手的问题:当技能可以把一个同事的工作方法、经验乃至语言特点打包成AI“技能包”,谁来保护被“打包”那个人的权益?经验、数据和收益如何分配?这已经不是技术问题了。

所以回到开头那个分裂:说技能没用的人,他们心里想的技能是一个单薄Markdown文件。而现实里的技能是一个从纯文本到可执行程序的光谱——光谱这头是“提示词”,那头是“软件”,中间一大片灰色地带全叫“技能”。

问题不在于技能有没有用,而在于当这个灰色地带越来越大、越来越模糊的时候,谁来定义它的边界?是Anthropic的开放标准,是Vercel牵头的巨头联盟,还是某个GitHub上突然爆火的开源项目?没人知道。但有一件事是确定的:那个说“技能就是个提示词”的人,他的Agent已经在用技能干活了——只是他自己不知道而已。