<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Reinforcement Learning | The .NET Blog</title><link>https://thedotnetblog.com/pt/tags/reinforcement-learning/</link><description>Articles, tutorials and insights from the .NET community.</description><generator>Hugo</generator><language>pt</language><managingEditor>@thedotnetblog (The .NET Blog)</managingEditor><webMaster>@thedotnetblog</webMaster><lastBuildDate>Thu, 18 Jun 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://thedotnetblog.com/pt/tags/reinforcement-learning/index.xml" rel="self" type="application/rss+xml"/><item><title>OpenEnv e Foundry empurram a conversa além dos agentes estáticos</title><link>https://thedotnetblog.com/pt/news/emiliano-montesdeoca/openenv-foundry-learning-systems-what-stands-out/</link><pubDate>Thu, 18 Jun 2026 00:00:00 +0000</pubDate><author>Emiliano Montesdeoca</author><guid>https://thedotnetblog.com/pt/news/emiliano-montesdeoca/openenv-foundry-learning-systems-what-stands-out/</guid><description>A nova história de OpenEnv e Foundry vai muito além dos chavões de reinforcement learning. Na verdade, ela aponta para sistemas de agentes que podem ser avaliados, otimizados e melhorados ao longo do tempo com base em resultados reais de negócio.</description><content:encoded>&lt;blockquote&gt;
&lt;p&gt;&lt;em&gt;Este artigo foi traduzido automaticamente. Leia o original &lt;a href="https://thedotnetblog.com/pt/news/emiliano-montesdeoca/openenv-foundry-learning-systems-what-stands-out/"&gt;aqui&lt;/a&gt;.&lt;/em&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;A maioria das conversas sobre agentes ainda para na inferência.&lt;/p&gt;
&lt;p&gt;O modelo consegue responder ao prompt? Consegue chamar a ferramenta? Consegue concluir a tarefa uma vez?&lt;/p&gt;
&lt;p&gt;A nova discussão &lt;strong&gt;OpenEnv + Foundry&lt;/strong&gt; é interessante porque tenta levar a conversa para um lugar mais ambicioso: &lt;strong&gt;como construir um sistema de agentes que realmente melhora com o tempo?&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Essa é uma pergunta muito melhor.&lt;/p&gt;
&lt;h2 id="a-mudança-central-é-sair-das-respostas-e-entrar-nos-loops-de-aprendizado"&gt;A mudança central é sair das respostas e entrar nos loops de aprendizado&lt;/h2&gt;
&lt;p&gt;O post da Foundry enquadra o problema em torno de ambientes, evals, rubrics, otimização e post-training.&lt;/p&gt;
&lt;p&gt;Dá para resumir tudo isso em uma frase:&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;o objetivo já não é apenas executar um agente, mas ter um loop que meça e melhore o agente em relação aos seus resultados reais.&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;É nisso que eu acho que os desenvolvedores devem prestar atenção.&lt;/p&gt;
&lt;p&gt;Porque, quando você enxerga assim, o ativo duradouro não é só o modelo ou o prompt. É o sistema ao redor:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;o ambiente em que ele atua&lt;/li&gt;
&lt;li&gt;a rubric que o avalia&lt;/li&gt;
&lt;li&gt;os traces que explicam o que aconteceu&lt;/li&gt;
&lt;li&gt;o optimizer que melhora a configuração&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Essa é uma forma de pensar muito mais pronta para a empresa.&lt;/p&gt;
&lt;h2 id="por-que-isso-importa-mesmo-se-você-não-faz-pesquisa-em-rl"&gt;Por que isso importa mesmo se você não faz pesquisa em RL&lt;/h2&gt;
&lt;p&gt;Sejamos honestos: termos como OpenEnv, post-training e world-modeling podem fazer muitos desenvolvedores desligarem na hora.&lt;/p&gt;
&lt;p&gt;Mas o takeaway prático é mais simples do que a terminologia.&lt;/p&gt;
&lt;p&gt;Mesmo que você nunca toque diretamente um loop de treinamento, esse trabalho molda a história da plataforma para o desenvolvimento futuro de agentes:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;avaliações passam a ser first-class&lt;/li&gt;
&lt;li&gt;otimização deixa de ser ocasional e vira contínua&lt;/li&gt;
&lt;li&gt;ambientes se tornam ativos reutilizáveis&lt;/li&gt;
&lt;li&gt;um comportamento melhor do agente vira algo mensurável, não apenas &amp;ldquo;parece melhor nas demos&amp;rdquo;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Isso é um grande avanço.&lt;/p&gt;
&lt;h2 id="minha-opinião"&gt;Minha opinião&lt;/h2&gt;
&lt;p&gt;O mais inteligente neste anúncio não é um detalhe específico de pesquisa.&lt;/p&gt;
&lt;p&gt;É o framing.&lt;/p&gt;
&lt;p&gt;A Microsoft está claramente tentando mover o ecossistema da engenharia de prompts estáticos para &lt;strong&gt;sistemas de agentes orientados a resultados&lt;/strong&gt;. Sistemas que podem ser avaliados, ajustados, governados e melhorados gradualmente.&lt;/p&gt;
&lt;p&gt;É aí que está o valor sério da plataforma.&lt;/p&gt;
&lt;p&gt;E se você está construindo agentes hoje, mesmo na camada de aplicação, vale acompanhar para onde isso está indo.&lt;/p&gt;
&lt;p&gt;Publicação original: &lt;a href="https://devblogs.microsoft.com/foundry/outcome-driven-learning-systems-enterprise-rl-with-openenv-and-foundry/"&gt;Sistemas de aprendizado orientados a resultados: RL empresarial com OpenEnv e Foundry&lt;/a&gt;&lt;/p&gt;</content:encoded></item></channel></rss>