返回信息流
新闻事件
meng shao (X)
1 个来源

Claude Code 系统提示词削减80%:AI Engineer World's Fair 对谈揭示关键经验

在AI Engineer World's Fair炉边对谈中,Claude Code产品负责人Cat Wu和工程师Thariq Shihipar透露,Claude Code的系统提示词被削减了80%,这一变化适用于Fable 5和Opus 4.8及未来模型。他们分享了关键经验:删除few-shot示例反而更好,减少硬约束、多给上下文,并检验每条指令是否100%成立。对谈还涉及Claude Tag、代码审查去人工化、评测体系等话题。

SynthePulse Insight · AI 深度解读

Claude Code 系统提示词削减 80%:少即是多的反直觉工程哲学

版本 1 · 1 个来源

在 AI Engineer World's Fair 炉边对谈中,Claude Code 产品负责人 Cat Wu 和工程师 Thariq Shihipar 透露,其系统提示词已削减 80%,且这一变化适用于 Fable 5 和 Opus 4.8 及未来前沿模型。背后是一套颠覆传统提示词工程的经验:删除示例、减少禁令、检验每条指令的 100% 正确性,并依赖模型自身的判断力。

  • Claude Code 系统提示词削减 80%,适用于 Fable 5、Opus 4.8 及未来前沿模型。
  • 删除 few-shot 示例反而更好,因为模型比示例更有创造力。
  • 少用“不要做 X”的禁令,多给上下文,避免模型困惑。
  • 每条指令需检验是否 100% 成立,否则软化措辞或让模型自行判断。
  • 该方法依赖 Opus/Fable 级别模型的判断力,小模型仍需详细提示词。
  • Claude Tag 已落地 Anthropic 产品工程团队 65% 的 PR,代码审查逐步去人工化。
展开章节目录系统提示词削减 80% 的核心发现

系统提示词削减 80% 的核心发现

Claude Code 产品负责人 Cat Wu 和工程师 Thariq Shihipar 在 AI Engineer World's Fair 炉边对谈中透露,Claude Code 的系统提示词被削减了 80%,且这一变化适用于 Fable 5 和 Opus 4.8 及未来的前沿模型。这一反直觉的调整源于对提示词工程方法的根本反思。

Thariq 直言,早期(Opus 4 时代)的模型需要大量示例,但现在“删除示例极其有效,因为模型比我们给它的示例更有创造力”。主持人 Simon Willison 当场承认,他此前给用户的首要建议是“给它示例”,如果这不再成立,他的提示词认知模型“有点被打破了”。

团队还发现,少用“不要做 X”的禁令、多给上下文效果更好。禁令对 Claude 是“非常强的冲动”,一旦系统提示词中的硬约束与用户后续指令冲突,模型会陷入困惑。因此方向是:更少硬约束、更多背景信息、总量更少的指令。

检验每条指令的 100% 正确性

Cat Wu 给出了一个可操作的方法论:审视提示词里每一句话,问自己“这句话有没有例外场景?”他们复盘发现很多指令只有 90% 正确——比如“前端改动后必须验证”,但如果只是改一个文案字符串、用户说“快速改一下就行”,强制验证就是错的。

她的判断标准是:要把提示词想象成会被一个善意的人如何误读,然后软化措辞直到它 100% 准确——因为这段话是 100% 的时间都喂给模型的。与其规定“何时该测试”,不如直接让模型“用自己的判断力决定”。

Simon 点出关键前提:这是 Opus/Fable 级别模型才有的能力,一年前的模型没有这种判断力。所以对小模型(如 Haiku)仍需详细提示词——这正是“每个模型一套系统提示词”的原因。Thariq 还补充了一个反直觉观察:大模型在难题上有时反而比小模型更省 token,“前沿智能几乎任何时候都值得”。

Claude 提示 Claude:模型自生成提示词

双方都确认:现在的好模型非常擅长写提示词。subagent 本质就是一个 Claude 为另一个 Claude 写提示词;Claude Code 的 Workflow 工具的提示词本身就是 Claude 写的。Simon 后来据此实践:他让 Fable “用自己的判断力选择低配模型跑 subagent 来干编码活”,效果良好且大幅节省了 Fable 配额。

这一理念延伸至工具设计:趋势是做减法——已移除 grep/glob 改用原生 bash,保持工具少而功能互不重叠。Thariq 形容“模型更像生物学而非物理学,工具设计是一门艺术”。

Claude Tag 与代码审查自动化

对谈中还介绍了 Claude Tag(Slack 协作版 Claude):默认多人协作、可主动长期监控(如自动修 bug 提 PR)、带频道级团队记忆。最惊人的数据是:Anthropic 产品工程团队 65% 的 PR 已由它落地。分工上,复杂任务用 Claude Code 交互迭代,例行任务交给 Claude Tag。

代码审查去人工化方面,核心区域仍由 code owner 人工把关,外层改动已全交自动审查。信任是花六个多月逐步建立的——每次事故都把肇事 PR 加入评测集,确保审查系统永不回退。

评测被视为地基:新模型靠跑完整评测集确认“严格优于上代”才能即插即用替换;除能力评测外还在建行为评测(如用户讨厌模型说“该睡觉了”)。瓶颈不是评测工具,而是构建高质量评测的技能。

Auto Mode 安全与工程观念翻转

Auto Mode 内部人人在用。机制是每次工具调用由 Sonnet 分类器结合对话上下文动态判断,并与沙箱联动。声称对提示词注入、数据外泄的风险“远低于人工审查”——评测数据待公布,Simon 持审慎期待。另有凭证注入模式:凭证在请求时动态注入,代理“可用而不可见”。

工程观念发生翻转:“重写是好事”如今成立——代码库即唯一的 spec,有好测试套件就能放心重写;工程师的价值重心从执行力转向产品品味与商业判断(想法到落地已缩至一周)。面对被模型取代的失落感,答案是用更大的野心对冲——别只把旧工作变成一句提示词,去做以前不敢做的事。文化格言:“我们不和自己谈判”,先做,让权衡自己现身。

可信度边界

本文信息源自 X 用户 meng shao 对 AI Engineer World's Fair 炉边对谈的报道,属于二手转述。对谈嘉宾为 Claude Code 产品负责人 Cat Wu 和工程师 Thariq Shihipar,主持人 Simon Willison。所有具体数字(如 80% 削减、65% PR 落地)和结论均来自对谈中的直接陈述,但未经独立验证。部分声明(如 Auto Mode 安全风险远低于人工审查)标注为“声称”,因评测数据尚未公布。

核心结论

Claude Code 系统提示词削减 80% 的背后,是提示词工程从“给示例、加禁令”向“信任模型判断力、精简指令”的范式转变。这一方法仅适用于前沿模型,且依赖高质量评测和逐步建立的信任。对于从业者,核心启示是:审视每条指令的 100% 正确性,让模型自行决策,并将精力从执行力转向更高层次的产品判断。

主报道

meng shao (X)

主报道来源