<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Reinforcement Learning | The .NET Blog</title><link>https://thedotnetblog.com/de/tags/reinforcement-learning/</link><description>Articles, tutorials and insights from the .NET community.</description><generator>Hugo</generator><language>de</language><managingEditor>@thedotnetblog (The .NET Blog)</managingEditor><webMaster>@thedotnetblog</webMaster><lastBuildDate>Thu, 18 Jun 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://thedotnetblog.com/de/tags/reinforcement-learning/index.xml" rel="self" type="application/rss+xml"/><item><title>OpenEnv und Foundry treiben die Diskussion über statische Agents hinaus</title><link>https://thedotnetblog.com/de/news/emiliano-montesdeoca/openenv-foundry-learning-systems-what-stands-out/</link><pubDate>Thu, 18 Jun 2026 00:00:00 +0000</pubDate><author>Emiliano Montesdeoca</author><guid>https://thedotnetblog.com/de/news/emiliano-montesdeoca/openenv-foundry-learning-systems-what-stands-out/</guid><description>Die neue OpenEnv-und-Foundry-Geschichte hat weit mehr mit zu tun als mit Schlagworten rund um Reinforcement Learning. Es geht eigentlich um Agentensysteme, die sich anhand echter Geschäftsergebnisse über die Zeit evaluieren, optimieren und verbessern lassen.</description><content:encoded>&lt;blockquote&gt;
&lt;p&gt;&lt;em&gt;Dieser Beitrag wurde automatisch übersetzt. Lies das Original &lt;a href="https://thedotnetblog.com/de/news/emiliano-montesdeoca/openenv-foundry-learning-systems-what-stands-out/"&gt;hier&lt;/a&gt;.&lt;/em&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;Die meisten Agentendiskussionen enden immer noch bei der Inferenz.&lt;/p&gt;
&lt;p&gt;Kann das Modell die Eingabe beantworten? Kann es das Tool aufrufen? Kann es die Aufgabe einmal erledigen?&lt;/p&gt;
&lt;p&gt;Die neue &lt;strong&gt;OpenEnv + Foundry&lt;/strong&gt;-Diskussion ist interessant, weil sie das Gespräch in eine ehrgeizigere Richtung lenken will: &lt;strong&gt;Wie baut man ein Agentensystem, das sich im Laufe der Zeit tatsächlich verbessert?&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Das ist eine deutlich bessere Frage.&lt;/p&gt;
&lt;h2 id="der-entscheidende-wandel-führt-von-antworten-zu-lernschleifen"&gt;Der entscheidende Wandel führt von Antworten zu Lernschleifen&lt;/h2&gt;
&lt;p&gt;Der Foundry-Beitrag rahmt das Problem über Umgebungen, Evals, Rubrics, Optimierung und Post-Training ein.&lt;/p&gt;
&lt;p&gt;Das lässt sich in einem Satz zusammenfassen:&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Das Ziel ist nicht mehr nur, einen Agenten auszuführen, sondern eine Schleife zu besitzen, die den Agenten anhand deiner tatsächlichen Ergebnisse misst und verbessert.&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Genau darauf sollten Entwickler meiner Meinung nach achten.&lt;/p&gt;
&lt;p&gt;Denn sobald man es so sieht, ist das dauerhafte Asset nicht nur das Modell oder der Prompt. Es ist das System darum herum:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;die Umgebung, in der es handelt&lt;/li&gt;
&lt;li&gt;die Rubrik, die es bewertet&lt;/li&gt;
&lt;li&gt;die Traces, die erklären, was passiert ist&lt;/li&gt;
&lt;li&gt;der Optimierer, der die Konfiguration verbessert&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Das ist eine deutlich unternehmensreifere Denkweise.&lt;/p&gt;
&lt;h2 id="warum-das-wichtig-ist-auch-wenn-du-keine-rl-forschung-machst"&gt;Warum das wichtig ist, auch wenn du keine RL-Forschung machst&lt;/h2&gt;
&lt;p&gt;Seien wir ehrlich: Begriffe wie OpenEnv, Post-Training und World-Modeling können viele Entwickler sofort abschalten.&lt;/p&gt;
&lt;p&gt;Die praktische Erkenntnis ist aber einfacher als die Terminologie.&lt;/p&gt;
&lt;p&gt;Selbst wenn du nie direkt eine Trainingsschleife anfasst, prägt diese Arbeit die Plattformgeschichte für die zukünftige Agentenentwicklung:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Evaluierungen werden erstklassig&lt;/li&gt;
&lt;li&gt;Optimierung wird kontinuierlich statt gelegentlich&lt;/li&gt;
&lt;li&gt;Umgebungen werden zu wiederverwendbaren Assets&lt;/li&gt;
&lt;li&gt;besseres Agentenverhalten wird messbar, nicht nur „fühlt sich in Demos besser an“&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Das ist ein großer Schritt nach vorn.&lt;/p&gt;
&lt;h2 id="meine-einschätzung"&gt;Meine Einschätzung&lt;/h2&gt;
&lt;p&gt;Das Klügste an dieser Ankündigung ist nicht irgendein einzelnes Forschungsdetail.&lt;/p&gt;
&lt;p&gt;Es ist der Rahmen.&lt;/p&gt;
&lt;p&gt;Microsoft versucht klar, das Ökosystem von statischer Prompt-Programmierung hin zu &lt;strong&gt;outcome-driven Agentensystemen&lt;/strong&gt; zu verschieben. Systeme, die sich evaluieren, abstimmen, steuern und schrittweise verbessern lassen.&lt;/p&gt;
&lt;p&gt;Dort liegt der echte Plattformwert.&lt;/p&gt;
&lt;p&gt;Und wenn du heute Agents baust, selbst auf Anwendungsebene, lohnt es sich, diese Entwicklung im Blick zu behalten.&lt;/p&gt;
&lt;p&gt;Originalbeitrag: &lt;a href="https://devblogs.microsoft.com/foundry/outcome-driven-learning-systems-enterprise-rl-with-openenv-and-foundry/"&gt;Outcome-getriebene Lernsysteme: Enterprise-RL mit OpenEnv und Foundry&lt;/a&gt;&lt;/p&gt;</content:encoded></item></channel></rss>