<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Reinforcement Learning | The .NET Blog</title><link>https://thedotnetblog.com/ca/tags/reinforcement-learning/</link><description>Articles, tutorials and insights from the .NET community.</description><generator>Hugo</generator><language>ca</language><managingEditor>@thedotnetblog (The .NET Blog)</managingEditor><webMaster>@thedotnetblog</webMaster><lastBuildDate>Thu, 18 Jun 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://thedotnetblog.com/ca/tags/reinforcement-learning/index.xml" rel="self" type="application/rss+xml"/><item><title>OpenEnv i Foundry empenyen la conversa més enllà dels agents estàtics</title><link>https://thedotnetblog.com/ca/news/emiliano-montesdeoca/openenv-foundry-learning-systems-what-stands-out/</link><pubDate>Thu, 18 Jun 2026 00:00:00 +0000</pubDate><author>Emiliano Montesdeoca</author><guid>https://thedotnetblog.com/ca/news/emiliano-montesdeoca/openenv-foundry-learning-systems-what-stands-out/</guid><description>La nova història d'OpenEnv i Foundry va molt més enllà dels clixés de reinforcement learning. En realitat, impulsa sistemes d'agents que es poden avaluar, optimitzar i millorar amb el temps segons resultats empresarials reals.</description><content:encoded>&lt;blockquote&gt;
&lt;p&gt;&lt;em&gt;Aquest article s&amp;rsquo;ha traduït automàticament. L&amp;rsquo;original és &lt;a href="https://thedotnetblog.com/ca/news/emiliano-montesdeoca/openenv-foundry-learning-systems-what-stands-out/"&gt;aquí&lt;/a&gt;.&lt;/em&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;La majoria de converses sobre agents encara s&amp;rsquo;aturen a la inferència.&lt;/p&gt;
&lt;p&gt;El model pot respondre a la petició? Pot cridar l&amp;rsquo;eina? Pot completar la tasca un cop?&lt;/p&gt;
&lt;p&gt;La nova conversa sobre &lt;strong&gt;OpenEnv + Foundry&lt;/strong&gt; és interessant perquè intenta portar la discussió cap a una cosa més ambiciosa: &lt;strong&gt;com es construeix un sistema d&amp;rsquo;agents que realment millora amb el temps?&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Aquesta és una pregunta molt millor.&lt;/p&gt;
&lt;h2 id="el-canvi-clau-és-passar-de-les-respostes-als-bucles-daprenentatge"&gt;El canvi clau és passar de les respostes als bucles d&amp;rsquo;aprenentatge&lt;/h2&gt;
&lt;p&gt;La publicació de Foundry emmarca el problema al voltant d&amp;rsquo;entorns, avaluacions, rúbriques, optimització i post-entrenament.&lt;/p&gt;
&lt;p&gt;Es pot resumir tot això en una sola frase:&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;l&amp;rsquo;objectiu ja no és només executar un agent, sinó tenir un bucle que mesuri i millori l&amp;rsquo;agent contra els teus resultats reals.&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Això és el que crec que els desenvolupadors han de tenir en compte.&lt;/p&gt;
&lt;p&gt;Perquè, un cop ho veus així, l&amp;rsquo;actiu durador no és només el model o la petició. És el sistema que l&amp;rsquo;envolta:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;l&amp;rsquo;entorn on actua&lt;/li&gt;
&lt;li&gt;la rúbrica que el puntua&lt;/li&gt;
&lt;li&gt;els traces que expliquen què ha passat&lt;/li&gt;
&lt;li&gt;l&amp;rsquo;optimitzador que millora la configuració&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Aquesta és una manera molt més preparada per a l&amp;rsquo;empresa de pensar-hi.&lt;/p&gt;
&lt;h2 id="per-què-importa-fins-i-tot-si-no-fas-recerca-en-rl"&gt;Per què importa fins i tot si no fas recerca en RL&lt;/h2&gt;
&lt;p&gt;Siguem sincers: termes com OpenEnv, post-entrenament i world-modeling poden fer que molts desenvolupadors desconnectin immediatament.&lt;/p&gt;
&lt;p&gt;Però la conclusió pràctica és més simple que la terminologia.&lt;/p&gt;
&lt;p&gt;Encara que no toquis mai directament un bucle d&amp;rsquo;entrenament, aquesta feina modela la història de la plataforma per al desenvolupament futur d&amp;rsquo;agents:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;les avaluacions passen a ser de primera classe&lt;/li&gt;
&lt;li&gt;l&amp;rsquo;optimització esdevé contínua en lloc d&amp;rsquo;ocasional&lt;/li&gt;
&lt;li&gt;els entorns es converteixen en actius reutilitzables&lt;/li&gt;
&lt;li&gt;un millor comportament de l&amp;rsquo;agent esdevé una cosa mesurable, no només &amp;ldquo;sembla millor a les demos&amp;rdquo;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;És un gran pas endavant.&lt;/p&gt;
&lt;h2 id="la-meva-opinió"&gt;La meva opinió&lt;/h2&gt;
&lt;p&gt;El més intel·ligent d&amp;rsquo;aquest anunci no és cap detall de recerca en concret.&lt;/p&gt;
&lt;p&gt;És l&amp;rsquo;enquadrament.&lt;/p&gt;
&lt;p&gt;Microsoft està clarament intentant portar l&amp;rsquo;ecosistema de l&amp;rsquo;enginyeria d&amp;rsquo;ordres estàtiques cap a &lt;strong&gt;sistemes d&amp;rsquo;agents orientats a resultats&lt;/strong&gt;. Sistemes que es poden avaluar, ajustar, governar i millorar gradualment.&lt;/p&gt;
&lt;p&gt;Aquí és on hi ha el valor seriós de la plataforma.&lt;/p&gt;
&lt;p&gt;I si avui estàs construint agents, fins i tot a nivell d&amp;rsquo;aplicació, val la pena seguir cap a on es dirigeix això.&lt;/p&gt;
&lt;p&gt;Publicació original: &lt;a href="https://devblogs.microsoft.com/foundry/outcome-driven-learning-systems-enterprise-rl-with-openenv-and-foundry/"&gt;Sistemes d&amp;rsquo;aprenentatge orientats a resultats: RL empresarial amb OpenEnv i Foundry&lt;/a&gt;&lt;/p&gt;</content:encoded></item></channel></rss>