<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Reinforcement Learning | The .NET Blog</title><link>https://thedotnetblog.com/ru/tags/reinforcement-learning/</link><description>Articles, tutorials and insights from the .NET community.</description><generator>Hugo</generator><language>ru</language><managingEditor>@thedotnetblog (The .NET Blog)</managingEditor><webMaster>@thedotnetblog</webMaster><lastBuildDate>Thu, 18 Jun 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://thedotnetblog.com/ru/tags/reinforcement-learning/index.xml" rel="self" type="application/rss+xml"/><item><title>OpenEnv и Foundry выводят разговор за рамки статичных агентов</title><link>https://thedotnetblog.com/ru/news/emiliano-montesdeoca/openenv-foundry-learning-systems-what-stands-out/</link><pubDate>Thu, 18 Jun 2026 00:00:00 +0000</pubDate><author>Emiliano Montesdeoca</author><guid>https://thedotnetblog.com/ru/news/emiliano-montesdeoca/openenv-foundry-learning-systems-what-stands-out/</guid><description>Новая история OpenEnv и Foundry — это не просто набор модных слов про reinforcement learning. По сути, это движение к агентным системам, которые можно оценивать, оптимизировать и улучшать со временем по реальным бизнес-результатам.</description><content:encoded>&lt;blockquote&gt;
&lt;p&gt;&lt;em&gt;Эта статья переведена автоматически. Оригинал можно прочитать &lt;a href="https://thedotnetblog.com/ru/news/emiliano-montesdeoca/openenv-foundry-learning-systems-what-stands-out/"&gt;здесь&lt;/a&gt;.&lt;/em&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;Большинство разговоров об агентах все еще заканчивается на инференсе.&lt;/p&gt;
&lt;p&gt;Может ли модель ответить на запрос? Может ли она вызвать инструмент? Может ли она один раз выполнить задачу?&lt;/p&gt;
&lt;p&gt;Новый разговор &lt;strong&gt;OpenEnv + Foundry&lt;/strong&gt; интересен тем, что он пытается перевести обсуждение в более амбициозную плоскость: &lt;strong&gt;как построить агентную систему, которая действительно улучшается со временем?&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Это куда более хороший вопрос.&lt;/p&gt;
&lt;h2 id="ключевой-сдвиг--от-ответов-к-петлям-обучения"&gt;Ключевой сдвиг — от ответов к петлям обучения&lt;/h2&gt;
&lt;p&gt;Пост Foundry описывает проблему через окружения, evals, rubrics, оптимизацию и post-training.&lt;/p&gt;
&lt;p&gt;Это можно свести к одной фразе:&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;цель уже не просто запустить агента, а иметь петлю, которая измеряет и улучшает агента по отношению к реальным результатам.&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Вот на это, как мне кажется, разработчикам и стоит обратить внимание.&lt;/p&gt;
&lt;p&gt;Потому что, когда смотришь на это так, долговечный актив — это не только модель или prompt. Это система вокруг:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;окружение, в котором он работает&lt;/li&gt;
&lt;li&gt;рубрика, которая его оценивает&lt;/li&gt;
&lt;li&gt;traces, которые объясняют, что произошло&lt;/li&gt;
&lt;li&gt;optimizer, который улучшает конфигурацию&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Это куда более enterprise-ready способ мышления.&lt;/p&gt;
&lt;h2 id="почему-это-важно-даже-если-вы-не-занимаетесь-rl-исследованиями"&gt;Почему это важно, даже если вы не занимаетесь RL-исследованиями&lt;/h2&gt;
&lt;p&gt;Будем честны: такие термины, как OpenEnv, post-training и world-modeling, могут сразу выключить многих разработчиков.&lt;/p&gt;
&lt;p&gt;Но практический вывод проще терминологии.&lt;/p&gt;
&lt;p&gt;Даже если вы никогда напрямую не трогаете тренировочную петлю, эта работа формирует историю платформы для будущей разработки агентов:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;оценки становятся first-class&lt;/li&gt;
&lt;li&gt;оптимизация становится непрерывной, а не случайной&lt;/li&gt;
&lt;li&gt;окружения становятся многократно используемыми активами&lt;/li&gt;
&lt;li&gt;лучшее поведение агента становится чем-то измеримым, а не просто &amp;ldquo;выглядит лучше в демо&amp;rdquo;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Это большой шаг вперед.&lt;/p&gt;
&lt;h2 id="мое-мнение"&gt;Мое мнение&lt;/h2&gt;
&lt;p&gt;Самое умное в этом анонсе — не какая-то одна исследовательская деталь.&lt;/p&gt;
&lt;p&gt;Это framing.&lt;/p&gt;
&lt;p&gt;Microsoft явно пытается перевести экосистему от статичного prompt engineering к &lt;strong&gt;агентным системам, ориентированным на результат&lt;/strong&gt;. Системам, которые можно оценивать, настраивать, управлять ими и постепенно улучшать.&lt;/p&gt;
&lt;p&gt;Именно там находится серьезная ценность платформы.&lt;/p&gt;
&lt;p&gt;И если вы строите агентов сегодня, даже на уровне приложения, стоит следить за тем, куда это движется.&lt;/p&gt;
&lt;p&gt;Оригинальная публикация: &lt;a href="https://devblogs.microsoft.com/foundry/outcome-driven-learning-systems-enterprise-rl-with-openenv-and-foundry/"&gt;Системы обучения, ориентированные на результат: корпоративный RL с OpenEnv и Foundry&lt;/a&gt;&lt;/p&gt;</content:encoded></item></channel></rss>