<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Reinforcement Learning | The .NET Blog</title><link>https://thedotnetblog.com/fr/tags/reinforcement-learning/</link><description>Articles, tutorials and insights from the .NET community.</description><generator>Hugo</generator><language>fr</language><managingEditor>@thedotnetblog (The .NET Blog)</managingEditor><webMaster>@thedotnetblog</webMaster><lastBuildDate>Thu, 18 Jun 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://thedotnetblog.com/fr/tags/reinforcement-learning/index.xml" rel="self" type="application/rss+xml"/><item><title>OpenEnv et Foundry font avancer la conversation au-delà des agents statiques</title><link>https://thedotnetblog.com/fr/news/emiliano-montesdeoca/openenv-foundry-learning-systems-what-stands-out/</link><pubDate>Thu, 18 Jun 2026 00:00:00 +0000</pubDate><author>Emiliano Montesdeoca</author><guid>https://thedotnetblog.com/fr/news/emiliano-montesdeoca/openenv-foundry-learning-systems-what-stands-out/</guid><description>La nouvelle histoire d'OpenEnv et Foundry va bien au-delà des clichés du reinforcement learning. En réalité, elle pousse vers des systèmes d'agents que l'on peut évaluer, optimiser et améliorer dans le temps à partir de résultats métier réels.</description><content:encoded>&lt;blockquote&gt;
&lt;p&gt;&lt;em&gt;Cet article a été traduit automatiquement. Lisez l&amp;rsquo;original &lt;a href="https://thedotnetblog.com/fr/news/emiliano-montesdeoca/openenv-foundry-learning-systems-what-stands-out/"&gt;ici&lt;/a&gt;.&lt;/em&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;La plupart des conversations sur les agents s&amp;rsquo;arrêtent encore à l&amp;rsquo;inférence.&lt;/p&gt;
&lt;p&gt;Le modèle peut-il répondre au prompt ? Peut-il appeler l&amp;rsquo;outil ? Peut-il accomplir la tâche une fois ?&lt;/p&gt;
&lt;p&gt;La nouvelle discussion &lt;strong&gt;OpenEnv + Foundry&lt;/strong&gt; est intéressante parce qu&amp;rsquo;elle essaie d&amp;rsquo;amener la conversation vers quelque chose de plus ambitieux : &lt;strong&gt;comment construire un système d&amp;rsquo;agents qui s&amp;rsquo;améliore réellement au fil du temps ?&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;C&amp;rsquo;est une bien meilleure question.&lt;/p&gt;
&lt;h2 id="le-vrai-changement-va-des-réponses-aux-boucles-dapprentissage"&gt;Le vrai changement va des réponses aux boucles d&amp;rsquo;apprentissage&lt;/h2&gt;
&lt;p&gt;L&amp;rsquo;article Foundry cadre le problème autour des environnements, des evals, des rubrics, de l&amp;rsquo;optimisation et du post-training.&lt;/p&gt;
&lt;p&gt;On peut résumer tout cela en une seule phrase :&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;le but n&amp;rsquo;est plus seulement d&amp;rsquo;exécuter un agent, mais de posséder une boucle qui mesure et améliore l&amp;rsquo;agent par rapport à vos résultats réels.&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;C&amp;rsquo;est le point auquel, selon moi, les développeurs devraient prêter attention.&lt;/p&gt;
&lt;p&gt;Parce qu&amp;rsquo;une fois qu&amp;rsquo;on voit les choses ainsi, l&amp;rsquo;actif durable n&amp;rsquo;est pas seulement le modèle ou le prompt. C&amp;rsquo;est le système autour :&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;l&amp;rsquo;environnement dans lequel il agit&lt;/li&gt;
&lt;li&gt;la rubrique qui le note&lt;/li&gt;
&lt;li&gt;les traces qui expliquent ce qui s&amp;rsquo;est passé&lt;/li&gt;
&lt;li&gt;l&amp;rsquo;optimiseur qui améliore la configuration&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;C&amp;rsquo;est une façon de penser beaucoup plus adaptée à l&amp;rsquo;entreprise.&lt;/p&gt;
&lt;h2 id="pourquoi-cela-compte-même-si-vous-ne-faites-pas-de-recherche-en-rl"&gt;Pourquoi cela compte même si vous ne faites pas de recherche en RL&lt;/h2&gt;
&lt;p&gt;Soyons honnêtes : des termes comme OpenEnv, post-training et world-modeling peuvent faire décrocher beaucoup de développeurs immédiatement.&lt;/p&gt;
&lt;p&gt;Mais la conclusion pratique est plus simple que la terminologie.&lt;/p&gt;
&lt;p&gt;Même si vous ne touchez jamais directement une boucle d&amp;rsquo;entraînement, ce travail façonne le récit de la plateforme pour le futur développement d&amp;rsquo;agents :&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;les évaluations deviennent de première classe&lt;/li&gt;
&lt;li&gt;l&amp;rsquo;optimisation devient continue au lieu d&amp;rsquo;être occasionnelle&lt;/li&gt;
&lt;li&gt;les environnements deviennent des actifs réutilisables&lt;/li&gt;
&lt;li&gt;un meilleur comportement d&amp;rsquo;agent devient quelque chose de mesurable, pas seulement &amp;ldquo;ça semble mieux dans les démos&amp;rdquo;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;C&amp;rsquo;est un grand pas en avant.&lt;/p&gt;
&lt;h2 id="mon-avis"&gt;Mon avis&lt;/h2&gt;
&lt;p&gt;Le plus intelligent dans cette annonce n&amp;rsquo;est pas un détail de recherche en particulier.&lt;/p&gt;
&lt;p&gt;C&amp;rsquo;est le cadrage.&lt;/p&gt;
&lt;p&gt;Microsoft essaie clairement de faire évoluer l&amp;rsquo;écosystème de l&amp;rsquo;ingénierie de prompts statiques vers des &lt;strong&gt;systèmes d&amp;rsquo;agents orientés résultats&lt;/strong&gt;. Des systèmes que l&amp;rsquo;on peut évaluer, régler, gouverner et améliorer progressivement.&lt;/p&gt;
&lt;p&gt;C&amp;rsquo;est là que se trouve la vraie valeur plateforme.&lt;/p&gt;
&lt;p&gt;Et si vous construisez des agents aujourd&amp;rsquo;hui, même au niveau applicatif, il vaut la peine de suivre cette direction.&lt;/p&gt;
&lt;p&gt;Publication originale : &lt;a href="https://devblogs.microsoft.com/foundry/outcome-driven-learning-systems-enterprise-rl-with-openenv-and-foundry/"&gt;Systèmes d&amp;rsquo;apprentissage orientés résultats : RL d&amp;rsquo;entreprise avec OpenEnv et Foundry&lt;/a&gt;&lt;/p&gt;</content:encoded></item></channel></rss>