<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Prompt Engineering | The .NET Blog</title><link>https://thedotnetblog.com/zh/tags/prompt-engineering/</link><description>Articles, tutorials and insights from the .NET community.</description><generator>Hugo</generator><language>zh</language><managingEditor>@thedotnetblog (The .NET Blog)</managingEditor><webMaster>@thedotnetblog</webMaster><lastBuildDate>Fri, 17 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://thedotnetblog.com/zh/tags/prompt-engineering/index.xml" rel="self" type="application/rss+xml"/><item><title>VS Code 的 GPT-5.5 提示调优证明了一个硬道理：Harness 设计胜于炒作</title><link>https://thedotnetblog.com/zh/news/emiliano-montesdeoca/gpt-5-5-prompt-tuning-vscode-less-wandering/</link><pubDate>Fri, 17 Jul 2026 00:00:00 +0000</pubDate><author>Emiliano Montesdeoca</author><guid>https://thedotnetblog.com/zh/news/emiliano-montesdeoca/gpt-5-5-prompt-tuning-vscode-less-wandering/</guid><description>VS Code 的 GPT-5.5 实验表明，可衡量的提升来自有纪律的 harness 和提示迭代，而不仅仅是切换到更新的基础模型。</description><content:encoded>&lt;p&gt;VS Code 的 GPT-5.5 调优文章中最有价值的部分不是获胜方案，而是方法论。清晰的假设、受控的变量处理、实时流量测量和护栏指标——这正是智能体质量应在生产环境中改进的方式。&lt;/p&gt;
&lt;p&gt;原文来源：https://code.visualstudio.com/blogs/2026/07/06/optimizing-vscode-coding-harness-model-providers&lt;/p&gt;
&lt;p&gt;核心想法很简单：减少探索性漂移，并在编辑后更早地验证。这听起来很明显，但有趣的发现是，在 harness 层设置结构化的提示引导，在延迟、尾部 token 使用量和工具调用次数方面带来了统计上显著的改进，且没有重大质量下降。&lt;/p&gt;
&lt;p&gt;我的观点很直白：&lt;strong&gt;只追逐模型升级的组织，把容易的性能和成本改善留在了桌面上&lt;/strong&gt;。Harness 行为和系统提示设计可以比模型切换更快地推动业务指标，尤其是在使用量计费的情况下。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;方案 B 胜出&lt;/strong&gt;是因为它将完整循环正式化了——而不仅仅是搜索约束。它引导模型形成一个本地的可证伪假设，做出一个基于上下文的首个编辑，并运行即时、有针对性的验证。这个顺序反映了优秀的人类工程师在时间压力下的调试方式。&lt;/p&gt;
&lt;h3 id="从这个方法中可以复制的"&gt;从这个方法中可以复制的&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;预先定义质量护栏&lt;/strong&gt;，然后在这些约束下优化延迟和成本。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;同时衡量中位数和尾部行为。&lt;/strong&gt; 首次编辑时间和 token 使用量的 p95 改进往往比 p50 的胜利对真实用户满意度更有价值。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;避免过度依赖离线评估。&lt;/strong&gt; VS Code 团队使用了离线检查，然后在推广前通过实时流量验证。这个顺序很重要，因为真实工作流会暴露合成基准测试无法发现的行为。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;一个值得注意的权衡：短期生存指标的轻微变化。团队通过权衡效果大小和显著性来正确处理这一点，相对于更强、高度显著的效率提升。这是成熟的决策，而非指标挑选。&lt;/p&gt;
&lt;p&gt;更广泛的教训是&lt;strong&gt;战略性的&lt;/strong&gt;。提示工程不是&amp;quot;提示魔法&amp;quot;，而是&lt;strong&gt;产品工程&lt;/strong&gt;：假设、实验、控制和部署门控。将这个循环制度化的团队将持续改进。而在社交媒体上争论模型排名的团队则不会。&lt;/p&gt;
&lt;h2 id="核心观点"&gt;核心观点&lt;/h2&gt;
&lt;p&gt;在未来一年中，开发者 AI 的竞争优势将越来越少地来自对特定模型系列的访问，而更多地来自&lt;strong&gt;谁能可靠地运行这个优化循环&lt;/strong&gt;。VS Code 的结果是一个实用的蓝图：观察、假设、测试、发布、重复。&lt;/p&gt;</content:encoded></item></channel></rss>