Bu yazı otomatik olarak çevrilmiştir. Orijinalini buradan okuyabilirsiniz.
Ajanlarla ilgili konuşmaların çoğu hâlâ çıkarımda duruyor.
Model prompt’u cevaplayabiliyor mu? Aracı çağırabiliyor mu? Görevi bir kez tamamlayabiliyor mu?
Yeni OpenEnv + Foundry tartışması ilginç çünkü konuşmayı daha iddialı bir yere taşımaya çalışıyor: gerçekten zamanla gelişen bir ajan sistemi nasıl kurulur?
Bu çok daha iyi bir soru.
Temel değişim cevaplardan öğrenme döngülerine geçiştir
Foundry yazısı problemi environment, evals, rubrics, optimization ve post-training etrafında çerçeveliyor.
Bunu tek bir cümlede özetleyebiliriz:
Hedef artık sadece bir ajanı çalıştırmak değil, gerçek sonuçlarınıza karşı ajanı ölçen ve iyileştiren bir döngüye sahip olmaktır.
Geliştiricilerin dikkat etmesi gereken kısım tam olarak bu.
Çünkü bunu böyle gördüğünüzde kalıcı varlık yalnızca model ya da prompt olmaz. Onun etrafındaki sistemdir:
- hareket ettiği environment
- onu puanlayan rubric
- ne olduğunu açıklayan traces
- konfigurasyonu iyileştiren optimizer
Bu, enterprise için çok daha hazır bir düşünme biçimi.
RL araştırması yapmasanız bile neden önemli
Dürüst olalım: OpenEnv, post-training ve world-modeling gibi terimler birçok geliştiriciyi hemen uzaklaştırabilir.
Ama pratik çıkarım terminolojiden daha basit.
Bir training loop’a doğrudan hiç dokunmasanız bile bu çalışma, gelecekteki ajan geliştirme için platform hikayesini şekillendiriyor:
- evaluations first-class olur
- optimization ara sıra değil sürekli hale gelir
- environments yeniden kullanılabilir varlıklara dönüşür
- daha iyi ajan davranışı “demoda daha iyi hissediliyor” değil, ölçülebilir bir şey olur
Bu büyük bir ileri adım.
Benim görüşüm
Bu duyurudaki en akıllı şey tek bir araştırma detayı değil.
Çerçeveleme.
Microsoft açıkça ekosistemi statik prompt engineering’den outcome-driven agent systems’e taşımaya çalışıyor. Değerlendirilebilen, ayarlanabilen, yönetilebilen ve kademeli olarak iyileştirilebilen sistemler.
Gerçek platform değeri orada.
Ve bugün ajanlar geliştiriyorsanız, uygulama katmanında bile olsa, bunun nereye gittiğini takip etmeye değer.
Orijinal yazı: Sonuç odaklı öğrenme sistemleri: OpenEnv ve Foundry ile kurumsal RL
