模型越强,什么 Skills 会越来越值钱?
我之前也有一个直觉:模型越来越强以后,Skills 可能就没那么重要了。

后来发现,这个判断只对了一半。
会被淘汰的,不是 Skills,而是那种把提示词包装成资产的低级 Skills。
比如:
“请一步一步思考。”
“请结构化输出。”
“请像专家一样回答。”
“请写得更专业、更有逻辑。”
这些东西在模型不够稳定的时候确实有用。因为那时候模型经常跑偏,需要靠提示词把它拉回正常轨道。
但模型一旦变强,这类 Skill 就会变得很尴尬。
因为它绑定的是模型短板。
一旦模型补上短板,它就失去了存在理由。
你再把“请结构化输出”“请先分析再总结”写成一份 Skill,本质上只是把模型已经会的东西重新包装了一遍。
这不是长期资产。
这是提示词时代留下来的拐杖。
真正会变得更重要的,是另一类 Skills。
它们不是教模型怎么写、怎么想、怎么表达,而是告诉 Agent:
在这个真实环境里,什么能做,什么不能做,做完怎么证明,失败以后怎么恢复,哪些经验要保存。
这才是强模型时代 Skills 的真正分界线:
模型能力会内化,现实约束必须外部化。
模型可以越来越会写代码,但它不会自动知道这个项目用 pnpm,不用 npm。
模型可以越来越会写文章,但它不会自动知道你的品牌不能制造焦虑、不能夸大收益。
模型可以越来越会分析数据,但它不会自动知道哪张表不能查,哪些字段不能导出。
模型可以越来越会修 bug,但它不会自动知道某个旧接口虽然看起来没人用,其实还被老客户脚本依赖。
所以,模型越强,通用提示词越不值钱;但项目规则、组织边界、工具约束、验证标准和失败经验会越来越值钱。
一句话:
弱模型需要 Skills 补能力。 强模型需要 Skills 管行为。
一、低级 Skills 为什么会贬值?
低级 Skill 最大的问题,不是写得不好。
而是它绑定的是模型能力。
比如很多人会写这种 Skill:
“请你像资深专家一样思考。”
“请用小红书风格写。”
“请用专业、清晰、有逻辑的方式回答。”
“请先理解需求,再分析问题,最后输出结果。”
这类东西不是完全没用。
但它们的价值会随着模型变强迅速下降。
原因很简单:它们没有记录任何外部现实。
它没有告诉模型这个项目的目录结构。
没有告诉模型这个团队的工程规范。
没有告诉模型哪些动作不能做。
没有告诉模型什么结果才算完成。
也没有告诉模型失败以后应该怎么收敛。
它只是在要求模型“表现得更好”。
但强模型本来就会越来越擅长表现。
这就是低级 Skills 的宿命:
当模型不够强时,它看起来像技巧。
当模型足够强时,它就变成重复劳动。
所以未来最先贬值的,一定是这些东西:
通用提示词。
通用写作风格。
基础知识说明。
过于显而易见的 SOP。
比如“如何写日报”“如何写会议纪要”“如何写 Markdown”“如何写基础 SQL”,如果只是常识级说明,模型越强越不需要。
真正值钱的不是这些。
真正值钱的是模型不知道、也不可能天然知道的东西。
二、真正值钱的是现实约束
什么叫现实约束?
就是那些只存在于具体项目、具体组织、具体工具链、具体业务里的规则。
比如在代码项目里:
这个项目用 pnpm,不用 npm。
这个目录是生成物,不要手动改。
这个组件库不能随便引入新依赖。
这个接口虽然旧,但还有客户在用。
这个权限逻辑改完必须补测试。
这些不是通用编程知识。
这是项目现场。
再比如在内容项目里:
这个账号不能制造焦虑。
不能夸大收益。
不能把个体经验包装成普遍规律。
不能用未经验证的数据。
不能把猜测写成事实。
这些也不是通用写作技巧。
这是品牌边界。
再比如在公司流程里:
哪些数据不能导出。
哪些邮件不能自动发送。
哪些客户承诺必须经过确认。
哪些内容涉及法务风险。
哪些操作必须人工审批。
这些东西,模型再强也不会自动知道。
因为它们不属于通用智能,而属于现实系统。
所以,未来 Skills 的价值不在于教模型“更聪明”,而在于把这些现实约束外部化,让 Agent 在行动时能被它们约束。
这也是为什么模型越强,Skills 反而越重要。
不是所有 Skills 都重要。
是那种能把现实约束写进去的 Skills 变重要。
三、模型越强,越需要边界
弱模型时代,我们担心的是模型不会做。
强模型时代,我们担心的是模型太敢做。
这两个问题完全不一样。
不会做,是能力问题。
太敢做,是治理问题。
当模型只是聊天时,错误的成本还比较低。
它写错一段话,你让它重写就行。
但当模型变成 Agent,开始读文件、改代码、跑命令、调用接口、写数据库、发邮件,问题就变了。
错误不再只是“回答错了”。
错误会进入真实系统。
它可能为了通过测试删掉测试。
可能在不确定时伪造引用。
可能把密钥写进日志。
可能误发邮件。
可能把一次临时方案沉淀成长期规范。
也可能把错误经验写进记忆,下一次继续复用。
这时候,真正危险的不是模型太弱,而是模型太强但没有边界。
所以,强模型时代最值钱的 Skills,不是让它更自由,而是让它更收敛。
它要知道:
什么不能做。
什么时候要停。
什么时候要问人。
做完以后怎么验证。
失败以后怎么恢复。
哪些经验可以保存,哪些经验不能保存。
提示词时代,我们优化的是模型怎么说。
Agent 时代,我们治理的是模型怎么做。
这是 Skills 价值重估的根本原因。
四、第一类会升值的 Skills:环境锚定
我认为最先升值的,是环境锚定型 Skill。
它解决的问题很简单:
让 Agent 知道自己到底在哪里做事。
同样是“修 bug”,在不同项目里,正确做法完全不同。
一个项目用 pnpm,另一个项目用 npm。
一个项目测试命令是 pnpm test:unit,另一个项目要先启动依赖服务。
一个项目允许重构,另一个项目正处于冻结期,只能做最小修复。
一个项目可以改接口,另一个项目要兼容一堆历史客户。
这些差异,模型不会天然知道。
如果没有环境锚定,Agent 就会用通用经验做具体事情。
通用经验不一定错,但很容易不适合现场。
所以,一个低级 coding Skill 会说:
“请写高质量代码。”
一个真正有价值的项目 Skill 会说:
这个项目使用 pnpm。
不要引入新的状态管理库。
组件必须放在指定目录。
不要修改生成文件。
改动后必须跑 typecheck 和 unit test。
涉及权限逻辑必须补测试。
前者会贬值。
后者会升值。
因为前者绑定的是模型能力,后者绑定的是项目现实。
写作也一样。
“请用小红书风格写”会越来越便宜。
但“这个账号不能制造焦虑、不能夸大收益、不能把个体经验包装成普遍规律”会越来越重要。
风格会被模型吸收。
边界必须被 Skill 固化。
五、第二类会升值的 Skills:行动边界
第二类会升值的,是行动边界型 Skill。
它解决的问题是:
Agent 能做很多事,但哪些事不能做?
这件事会越来越重要。
因为模型越强,能调用的工具越多,越容易越界。
一个没有边界的强 Agent,不是强助手,而是高风险执行器。
比如在工程场景里,必须明确:
不能为了通过测试删除测试。
不能直接操作生产数据库。
不能把密钥写进日志。
不能绕过安全检查。
不能把猜测写成事实。
不能把临时方案沉淀成长期规范。
这些规则看起来简单,但非常关键。
因为 Agent 的问题经常不是“不努力”,而是“太努力”。
为了完成任务,它可能会走捷径。
为了让测试通过,它可能会改测试。
为了给出结论,它可能会假装确定。
为了显得有进展,它可能会继续乱改。
行动边界型 Skill 的价值,就是让 Agent 从“什么都能试”,变成“只走可验证、可回滚、可解释的路径”。
比如修 CI。
一个低级 Skill 会说:
“请查看日志,修复错误,并运行测试。”
这只是提醒。
一个更有价值的 Skill 会规定:
先定位失败 job。
再读取关键日志。
判断是依赖错误、类型错误、测试错误还是环境错误。
能本地复现再修改。
无法复现就停止并报告不确定性。
禁止为了通过 CI 删除测试。
修复后必须提供通过证据。
这不是让模型更会写代码。
这是让 Agent 更像真实工程师一样行动。
六、第三类会升值的 Skills:反馈闭环
第三类会升值的,是反馈闭环型 Skill。
它解决的问题是:
Agent 怎么知道自己做对了?失败以后怎么修正?
强模型很容易生成“看起来完成”的结果。
但真实任务不是看起来完成,而是要能验证。
代码改完,测试有没有跑?
页面改完,浏览器有没有打开看过?
数据处理完,行数有没有对上?
文章写完,事实和引用有没有查过?
CI 修复后,有没有通过证据?
没有这些,Agent 只是更快地产生“完成感”。
不是完成。
所以验证型 Skill 会越来越重要。
它要规定什么叫完成,怎么检查,失败以后回到哪一步,最终必须提供什么证据。
反馈解释型 Skill 也会越来越重要。
因为 Agent 做事一定会遇到反馈:日志、报错、截图、测试结果、API 返回、用户反馈。
但看到反馈,不代表理解反馈。
一个测试失败,可能是代码问题,也可能是环境问题。
一个 API 返回 200,不代表业务成功。
一个页面能打开,不代表交互可用。
一个日志里有很多 warning,不代表它们都是根因。
如果 Agent 不知道怎么读反馈,它就会不断重试、不断乱改、不断扩大问题。
状态沉淀型 Skill 也在升值。
强模型不等于长期记忆。
它不天然知道上次失败在哪里,哪个方案之前试过,哪个结论已经过期,哪些经验应该复用,哪些经验不能复用。
当 Agent 只是一次性回答问题时,这没那么重要。
但当 Agent 开始持续参与项目、内容、代码、运营、客服和管理时,状态沉淀就变成核心能力。
真正有价值的 Skill,要告诉 Agent:
什么经验要保存。
保存到哪里。
什么时候更新。
什么时候过期。
哪些只在当前任务有效。
哪些可以长期复用。
如何避免旧信息污染新任务。
这类 Skill 的价值,是让 Agent 从一次性执行者,变成长期协作者。
七、几个简单对照
看写作场景。
一个会贬值的写作 Skill 是:
“请用专业、有深度、有逻辑的方式写一篇文章。”
模型越强,这越没价值。
因为它只是控制表达风格。
它没有规定如何定义问题,如何筛选证据,如何判断资料可靠性,如何避免伪造引用,如何检查逻辑跳跃。
一个会升值的研究型写作 Skill 是:
先定义核心问题。
区分事实、观点和推测。
判断资料是否过时。
检查来源是否可靠。
禁止伪造引用。
检查论证链是否跳跃。
把选题、资料和后续角度沉淀进内容库。
这类 Skill 绑定的是研究行为和内容资产。
它会升值。
再看 coding 场景。
一个会贬值的 coding Skill 是:
“请写高质量代码,注意可维护性。”
这太空。
模型越强,它越不需要你这样提醒。
一个会升值的工程 Skill 是:
先确认包管理器。
不要删除测试。
改完必须跑 typecheck 和 unit test。
失败日志要分类。
无法复现要停止。
修复结果要附证据。
重要决策写进 ADR。
重复失败模式写进项目经验。
这类 Skill 绑定的是项目环境、反馈闭环、验证机制和工程边界。
它会升值。
再看品牌内容场景。
一个会贬值的品牌 Skill 是:
“请用高级、有质感、有传播力的品牌语气写。”
这只是风格修饰。
一个会升值的品牌 Skill 是:
不能制造焦虑。
不能夸大收益。
不能暗示医疗效果。
不能贬低竞品。
不能使用未验证数据。
涉及承诺必须保守。
所有结论必须保留边界条件。
这不是风格。
这是风险边界。
风格会被模型吸收。
边界必须被 Skill 固化。
所以,关键不在于这个 Skill 属于写作、编程还是品牌。
关键在于:
它是在控制表面输出,还是在治理真实行动?
八、怎么判断一个 Skill 值不值得写?
我会用一个很简单的问题筛选:
它是在重复模型已经会的能力,还是在记录模型不知道的现实约束?
如果一个 Skill 只是让模型更会写、更会总结、更有逻辑、更像专家,它大概率会贬值。
如果一个 Skill 记录的是项目规则、组织边界、工具用法、验证标准、失败处理和经验沉淀,它才值得长期维护。
可以粗略分一下:
通用提示词型 Skill 会贬值。
通用风格型 Skill 会贬值。
基础知识型 Skill 会贬值。
简单 SOP 型 Skill 会贬值。
项目上下文 Skill 会升值。
工具适配 Skill 会升值。
组织规范 Skill 会升值。
约束 Skill 会大幅升值。
验证 Skill 会升值。
反馈解释 Skill 会升值。
状态沉淀 Skill 会升值。
如果只记三类,那就是:
第一,环境锚定。
让 Agent 知道自己在哪里做事。
第二,行动边界。
让 Agent 知道什么能做、什么不能做。
第三,反馈闭环。
让 Agent 知道做没做对,失败后怎么修正,经验怎么沉淀。
这三类,才是强模型时代最值得写的 Skills。
九、结论:Skills 从提示词资产,变成 Agent 治理资产
模型越强,Skills 不会整体贬值。
它们会分化。
低级 Skills 会被模型吞掉。
高级 Skills 会变成 Agent 的行为基础设施。
过去很多 Skill 的作用,是弥补模型不会写、不会想、不会拆解。
这类 Skill 会随着模型变强而失去价值。
未来真正有价值的 Skill,不是教模型“怎么思考”,而是治理 Agent“怎么在真实环境中行动”。
模型决定能力上限。
Skills 决定能力如何进入现实。
当模型越来越强,Skills 的价值不再是教它生成,而是让它在真实世界中被约束、被验证、被纠偏、被沉淀。
这不是提示词工程的延续。
这是 Agent 治理工程的开始。
提示词时代,我们优化的是模型怎么说。
Agent 时代,我们治理的是模型怎么做。
弱模型需要 Skills 补能力。
强模型需要 Skills 管行为。
未来真正稀缺的,不是更多提示词,而是能让 Agent 稳定行动的行为结构。
会写提示词的人会越来越多。
能设计 Agent 行为结构的人会越来越少。