<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Reinforcement Learning | The .NET Blog</title><link>https://thedotnetblog.com/zh/tags/reinforcement-learning/</link><description>Articles, tutorials and insights from the .NET community.</description><generator>Hugo</generator><language>zh</language><managingEditor>@thedotnetblog (The .NET Blog)</managingEditor><webMaster>@thedotnetblog</webMaster><lastBuildDate>Thu, 18 Jun 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://thedotnetblog.com/zh/tags/reinforcement-learning/index.xml" rel="self" type="application/rss+xml"/><item><title>OpenEnv 和 Foundry 正把讨论推进到静态智能体之外</title><link>https://thedotnetblog.com/zh/news/emiliano-montesdeoca/openenv-foundry-learning-systems-what-stands-out/</link><pubDate>Thu, 18 Jun 2026 00:00:00 +0000</pubDate><author>Emiliano Montesdeoca</author><guid>https://thedotnetblog.com/zh/news/emiliano-montesdeoca/openenv-foundry-learning-systems-what-stands-out/</guid><description>OpenEnv 和 Foundry 的新故事远不只是 reinforcement learning 这类流行词。它真正指向的是这样一种智能体系统：可以根据真实业务结果，随着时间推移被评估、优化并持续改进。</description><content:encoded>&lt;blockquote&gt;
&lt;p&gt;&lt;em&gt;本文为自动翻译。查看原文请&lt;a href="https://thedotnetblog.com/zh/news/emiliano-montesdeoca/openenv-foundry-learning-systems-what-stands-out/"&gt;点击这里&lt;/a&gt;。&lt;/em&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;大多数智能体讨论仍然停留在推理阶段。&lt;/p&gt;
&lt;p&gt;模型能回答提示吗？它能调用工具吗？它能把任务完成一次吗？&lt;/p&gt;
&lt;p&gt;新的 &lt;strong&gt;OpenEnv + Foundry&lt;/strong&gt; 讨论之所以有意思，是因为它想把话题推进到更有雄心的方向：&lt;strong&gt;如何构建一个真正会随着时间不断变好的智能体系统？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;这才是一个好得多的问题。&lt;/p&gt;
&lt;h2 id="关键转变是从响应走向学习闭环"&gt;关键转变是从响应走向学习闭环&lt;/h2&gt;
&lt;p&gt;Foundry 这篇文章把问题放在 environment、evals、rubrics、optimization 和 post-training 这些概念上。&lt;/p&gt;
&lt;p&gt;可以用一句话概括：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;目标不再只是运行一个智能体，而是拥有一个能根据真实结果对智能体进行度量和改进的闭环。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;这正是我认为开发者应该关注的地方。&lt;/p&gt;
&lt;p&gt;因为一旦你这样看，持久的资产就不只是模型或 prompt 了，而是它周围的系统：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;它运行的 environment&lt;/li&gt;
&lt;li&gt;给它打分的 rubric&lt;/li&gt;
&lt;li&gt;解释发生了什么的 traces&lt;/li&gt;
&lt;li&gt;改进配置的 optimizer&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这是一种更适合企业的思考方式。&lt;/p&gt;
&lt;h2 id="即使你不做-rl-研究这也很重要"&gt;即使你不做 RL 研究，这也很重要&lt;/h2&gt;
&lt;p&gt;说实话，OpenEnv、post-training、world-modeling 这些术语很容易让很多开发者立刻失去兴趣。&lt;/p&gt;
&lt;p&gt;但实际结论比术语简单得多。&lt;/p&gt;
&lt;p&gt;即使你从不直接碰训练闭环，这项工作也在塑造未来智能体开发的平台故事：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;evaluations 变成 first-class&lt;/li&gt;
&lt;li&gt;optimization 从偶尔发生变成持续发生&lt;/li&gt;
&lt;li&gt;environments 变成可复用资产&lt;/li&gt;
&lt;li&gt;更好的智能体行为变成可度量的东西，而不只是“demo 里感觉更好”&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这是向前迈出的一大步。&lt;/p&gt;
&lt;h2 id="我的看法"&gt;我的看法&lt;/h2&gt;
&lt;p&gt;这次公告最聪明的地方不是某个具体研究细节。&lt;/p&gt;
&lt;p&gt;而是 framing。&lt;/p&gt;
&lt;p&gt;Microsoft 显然正在把生态从静态 prompt engineering 推向 &lt;strong&gt;outcome-driven 智能体系统&lt;/strong&gt;。这些系统可以被评估、调优、治理，并逐步改进。&lt;/p&gt;
&lt;p&gt;真正的平台价值就在这里。&lt;/p&gt;
&lt;p&gt;如果你今天正在构建智能体，哪怕只是在应用层，也值得关注这个方向会走向哪里。&lt;/p&gt;
&lt;p&gt;原文：&lt;a href="https://devblogs.microsoft.com/foundry/outcome-driven-learning-systems-enterprise-rl-with-openenv-and-foundry/"&gt;面向结果的学习系统：借助 OpenEnv 和 Foundry 的企业级 RL&lt;/a&gt;&lt;/p&gt;</content:encoded></item></channel></rss>