· · 1 分钟阅读

VS Code 的 GPT-5.5 提示调优证明了一个硬道理:Harness 设计胜于炒作

VS Code 的 GPT-5.5 实验表明,可衡量的提升来自有纪律的 harness 和提示迭代,而不仅仅是切换到更新的基础模型。

VS Code GPT-5.5 Prompt Engineering AI Agents Developer Tools Benchmarking
这篇文章也有其他语言版本:English, Español, Català, Deutsch, Français, Português, Italiano, 日本語, 한국어, Русский, हिन्दी, Polski, Türkçe, العربية, Bahasa Indonesia, Nederlands

VS Code 的 GPT-5.5 调优文章中最有价值的部分不是获胜方案,而是方法论。清晰的假设、受控的变量处理、实时流量测量和护栏指标——这正是智能体质量应在生产环境中改进的方式。

原文来源:https://code.visualstudio.com/blogs/2026/07/06/optimizing-vscode-coding-harness-model-providers

核心想法很简单:减少探索性漂移,并在编辑后更早地验证。这听起来很明显,但有趣的发现是,在 harness 层设置结构化的提示引导,在延迟、尾部 token 使用量和工具调用次数方面带来了统计上显著的改进,且没有重大质量下降。

我的观点很直白:只追逐模型升级的组织,把容易的性能和成本改善留在了桌面上。Harness 行为和系统提示设计可以比模型切换更快地推动业务指标,尤其是在使用量计费的情况下。

方案 B 胜出是因为它将完整循环正式化了——而不仅仅是搜索约束。它引导模型形成一个本地的可证伪假设,做出一个基于上下文的首个编辑,并运行即时、有针对性的验证。这个顺序反映了优秀的人类工程师在时间压力下的调试方式。

从这个方法中可以复制的

  • 预先定义质量护栏,然后在这些约束下优化延迟和成本。
  • 同时衡量中位数和尾部行为。 首次编辑时间和 token 使用量的 p95 改进往往比 p50 的胜利对真实用户满意度更有价值。
  • 避免过度依赖离线评估。 VS Code 团队使用了离线检查,然后在推广前通过实时流量验证。这个顺序很重要,因为真实工作流会暴露合成基准测试无法发现的行为。

一个值得注意的权衡:短期生存指标的轻微变化。团队通过权衡效果大小和显著性来正确处理这一点,相对于更强、高度显著的效率提升。这是成熟的决策,而非指标挑选。

更广泛的教训是战略性的。提示工程不是"提示魔法",而是产品工程:假设、实验、控制和部署门控。将这个循环制度化的团队将持续改进。而在社交媒体上争论模型排名的团队则不会。

核心观点

在未来一年中,开发者 AI 的竞争优势将越来越少地来自对特定模型系列的访问,而更多地来自谁能可靠地运行这个优化循环。VS Code 的结果是一个实用的蓝图:观察、假设、测试、发布、重复。

分享:
在GitHub上查看此文章的源代码 ↗
← Claude 在 Foundry 中的 GA 关乎企业基础设施,而非模型炒作
Data API Builder 自定义路径让你为人类设计 API,而非为表设计 →