<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Evaluations | The .NET Blog</title><link>https://thedotnetblog.com/tr/tags/evaluations/</link><description>Articles, tutorials and insights from the .NET community.</description><generator>Hugo</generator><language>tr</language><managingEditor>@thedotnetblog (The .NET Blog)</managingEditor><webMaster>@thedotnetblog</webMaster><lastBuildDate>Fri, 29 May 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://thedotnetblog.com/tr/tags/evaluations/index.xml" rel="self" type="application/rss+xml"/><item><title>Model router evals, pek çok ekibin atladığı adımdır</title><link>https://thedotnetblog.com/tr/news/emiliano-montesdeoca/model-router-evals-before-you-trust-the-routing/</link><pubDate>Fri, 29 May 2026 00:00:00 +0000</pubDate><author>Emiliano Montesdeoca</author><guid>https://thedotnetblog.com/tr/news/emiliano-montesdeoca/model-router-evals-before-you-trust-the-routing/</guid><description>Foundry'deki yeni model router evaluation repo'su önemlidir çünkü routing kararlarının, otomatik model seçimini sihir gibi görmeden önce kalite, gecikme ve maliyet açısından ölçülmesi gerekir.</description><content:encoded>&lt;blockquote&gt;
&lt;p&gt;&lt;em&gt;Bu makale otomatik olarak çevrildi. Orijinal sürüm için &lt;a href="https://thedotnetblog.com/tr/news/emiliano-montesdeoca/model-router-evals-before-you-trust-the-routing/"&gt;buraya tıklayın&lt;/a&gt;.&lt;/em&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;Otomatik model routing kulağa harika gelir; ta ki bunun workload&amp;rsquo;unuz için doğru seçim olduğunu yine de kanıtlamanız gerektiğini fark edene kadar.&lt;/p&gt;
&lt;p&gt;İşte bu yüzden yeni &lt;strong&gt;model router evaluation repo&lt;/strong&gt; faydalıdır.&lt;/p&gt;
&lt;p&gt;Ekiplerin gerçekten önemli olan sorulara daha somut cevaplar vermesini sağlar:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;routing kaliteyi koruyor mu?&lt;/li&gt;
&lt;li&gt;maliyeti iyileştiriyor mu?&lt;/li&gt;
&lt;li&gt;gecikmeye etkisi ne?&lt;/li&gt;
&lt;li&gt;model subset&amp;rsquo;i kısıtlarsam ne değişir?&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="kaynak-makale-doğru-soruları-soruyor"&gt;Kaynak makale doğru soruları soruyor&lt;/h2&gt;
&lt;p&gt;Orijinal yazıda en sevdiğim şeylerden biri, model router&amp;rsquo;ı kendiliğinden iyi kabul etmemesi.&lt;/p&gt;
&lt;p&gt;Bunun yerine rahatsız edici ama doğru soruları soruyor:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&amp;ldquo;&lt;strong&gt;Prompt&amp;rsquo;larımda, model router&amp;rsquo;ın otomatik seçtiği model, aksi halde benim seçeceğim tek modelle eşleşiyor mu ya da onu geçiyor mu?&lt;/strong&gt;&amp;rdquo;&lt;/li&gt;
&lt;li&gt;&amp;ldquo;&lt;strong&gt;Gerçekten uçtan uca para mı tasarruf ediyorum, yoksa sadece harcamayı bir yerden başka bir yere mi kaydırıyorum?&lt;/strong&gt;&amp;rdquo;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Bu tam olarak doğru tutum.&lt;/p&gt;
&lt;p&gt;Çünkü otomatik routing çekici olsa da bu hâlâ bir system decision. Ve system decision&amp;rsquo;lar beğenilmemeli, ölçülmelidir.&lt;/p&gt;
&lt;h2 id="bu-repo-ilk-bakışta-göründüğünden-neden-daha-önemli"&gt;Bu repo ilk bakışta göründüğünden neden daha önemli&lt;/h2&gt;
&lt;p&gt;Bir düzeyde bu sadece bir evaluation repo&amp;rsquo;su.&lt;/p&gt;
&lt;p&gt;Başka bir düzeyde ise olgunluk işaretidir.&lt;/p&gt;
&lt;p&gt;Şunu söylüyor: otomatik routing&amp;rsquo;i benimsemek istiyorsanız, işte test etmek için daha disiplinli bir yol:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;kalite&lt;/li&gt;
&lt;li&gt;maliyet&lt;/li&gt;
&lt;li&gt;gecikme&lt;/li&gt;
&lt;li&gt;subset trade-off&amp;rsquo;ları&lt;/li&gt;
&lt;li&gt;model dağılım davranışı&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Bu, routing&amp;rsquo;i iyi markalanmış bir black box gibi ele almaktan çok daha iyidir.&lt;/p&gt;
&lt;h2 id="benim-görüşüm"&gt;Benim görüşüm&lt;/h2&gt;
&lt;p&gt;Bu, AI platform&amp;rsquo;ların daha fazlasına ihtiyaç duyduğu tooling türüne iyi bir örnek: daha fazla sihir değil, güvenmeden önce sihri doğrulamanın daha fazla yolu.&lt;/p&gt;
&lt;p&gt;Ekiplerin test edilmemiş varsayımlar üzerinde pahalı güven inşa etmesini böyle önlersiniz.&lt;/p&gt;
&lt;p&gt;Orijinal makale: &lt;a href="https://devblogs.microsoft.com/foundry/how-to-run-evals-for-model-router/"&gt;How to run evals for the model router&lt;/a&gt;&lt;/p&gt;</content:encoded></item><item><title>AI geliştirmenin zor kısmı artık erişim değil. Doğru modeli iyi bir şekilde işletmek</title><link>https://thedotnetblog.com/tr/news/emiliano-montesdeoca/foundry-managing-models-cost-quality-developer-guide/</link><pubDate>Tue, 26 May 2026 00:00:00 +0000</pubDate><author>Emiliano Montesdeoca</author><guid>https://thedotnetblog.com/tr/news/emiliano-montesdeoca/foundry-managing-models-cost-quality-developer-guide/</guid><description>Yeni Foundry rehberi, model seçimi, maliyet kontrolü, değerlendirme ve yaşam döngüsü yönetiminin artık production AI systems içindeki asıl ayrıştırıcılar olduğunu güçlü biçimde savunuyor.</description><content:encoded>&lt;blockquote&gt;
&lt;p&gt;&lt;em&gt;Bu yazı otomatik olarak çevrilmiştir. Orijinal sürüm için &lt;a href="https://thedotnetblog.com/tr/news/emiliano-montesdeoca/foundry-managing-models-cost-quality-developer-guide/"&gt;buraya tıklayın&lt;/a&gt;.&lt;/em&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;Güçlü bir model erişimine sahip olmanın tek başına yeterli olduğu dönemi çoktan geride bıraktık.&lt;/p&gt;
&lt;p&gt;Bu yeni &lt;strong&gt;Foundry model, cost ve quality yönetimi rehberi&lt;/strong&gt; tam olarak bunu doğru yakalıyor.&lt;/p&gt;
&lt;p&gt;Asıl zorluk artık operasyonel:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;her workload için doğru modeli seçmek&lt;/li&gt;
&lt;li&gt;onu kendi verinizle doğrulamak&lt;/li&gt;
&lt;li&gt;latency ve harcamayı yönetmek&lt;/li&gt;
&lt;li&gt;upgrade&amp;rsquo;leri ve regression riskini yönetmek&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Ciddi ekiplerin iyi olması gereken şey tam olarak bu.&lt;/p&gt;
&lt;h2 id="kaynak-makale-problemi-doğru-tanımlıyor"&gt;Kaynak makale problemi doğru tanımlıyor&lt;/h2&gt;
&lt;p&gt;Orijinal yazıdan bir cümle bu değişimi çok iyi yakalıyor:&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&amp;ldquo;&lt;strong&gt;Bugün AI sistemleri kurmanın en zor kısmı artık yetenekli bir modele erişmek değil. Gerçek bir uygulamanın tüm yaşam döngüsü boyunca doğru modeli nasıl seçeceğinizi, doğrulayacağınızı, optimize edeceğinizi ve işleteceğinizi bilmektir.&lt;/strong&gt;&amp;rdquo;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;Bu tam olarak doğru teşhis.&lt;/p&gt;
&lt;p&gt;Çok fazla ekip hâlâ model selection&amp;rsquo;ın ana karar olduğunu düşünüyor.&lt;/p&gt;
&lt;p&gt;Değil.&lt;/p&gt;
&lt;p&gt;Asıl büyük problem model operation:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;hangi workload&amp;rsquo;a hangi model gider?&lt;/li&gt;
&lt;li&gt;quality nasıl doğrulanır?&lt;/li&gt;
&lt;li&gt;kabul edilebilir cost şekli nedir?&lt;/li&gt;
&lt;li&gt;yeni bir model geldiğinde ya da eski model drift ettiğinde ne olur?&lt;/li&gt;
&lt;li&gt;gerçek workflow&amp;rsquo;ları bozmadan bir değişiklik nasıl test edilir?&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Asıl engineering işi şimdi bu.&lt;/p&gt;
&lt;h2 id="bu-foundry-parçası-neden-faydalı"&gt;Bu Foundry parçası neden faydalı&lt;/h2&gt;
&lt;p&gt;Bu makaleyi seviyorum, çünkü AI systems hakkında deneyimli platform engineer&amp;rsquo;ların gerçekten düşünmesi gerektiği şekilde konuşuyor.&lt;/p&gt;
&lt;p&gt;&amp;ldquo;En akıllı modeli seç ve devam et&amp;rdquo; gibi değil.&lt;/p&gt;
&lt;p&gt;Capability, latency, cost, safety, governance ve upgrade pressure gibi trade-off&amp;rsquo;lar altında yaşayan sistemler olarak ele alıyor.&lt;/p&gt;
&lt;p&gt;Bu, benchmark odaklı iyimserlikten çok daha faydalı.&lt;/p&gt;
&lt;h2 id="en-önemli-değişim-önce-kriterleri-düşünmek"&gt;En önemli değişim, önce kriterleri düşünmek&lt;/h2&gt;
&lt;p&gt;Orijinal yazı, model catalog&amp;rsquo;u açmadan önce başarı kriterlerini tanımlamayı öneriyor.&lt;/p&gt;
&lt;p&gt;Bu, ekiplerin benimseyebileceği en önemli alışkanlıklardan biri.&lt;/p&gt;
&lt;p&gt;Catalog&amp;rsquo;u önce açarsanız, itibara bağlanırsınız.&lt;/p&gt;
&lt;p&gt;Kriterleri önce tanımlarsanız, workload gerçekliğine bağlanırsınız.&lt;/p&gt;
&lt;p&gt;Bu daha sağlıklı bir süreç.&lt;/p&gt;
&lt;p&gt;Çünkü benchmark&amp;rsquo;ı kazanan model, şu alanlarda kazanan model olmak zorunda değildir:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;sizin prompt&amp;rsquo;larınız&lt;/li&gt;
&lt;li&gt;sizin latency budget&amp;rsquo;ınız&lt;/li&gt;
&lt;li&gt;sizin cost guardrail&amp;rsquo;leriniz&lt;/li&gt;
&lt;li&gt;sizin governance gereksinimleriniz&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Olgun AI engineering tam olarak bu farkta başlıyor.&lt;/p&gt;
&lt;h2 id="multi-model-hikâyesi-gerçek-bir-avantaja-dönüşüyor"&gt;Multi-model hikâyesi gerçek bir avantaja dönüşüyor&lt;/h2&gt;
&lt;p&gt;Bir başka hoşuma giden şey de model-agnostic yaklaşım.&lt;/p&gt;
&lt;p&gt;Makale Foundry&amp;rsquo;yi tek model destinasyonu olarak değil, şu alanların üzerinde bir operating surface olarak sunuyor:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Microsoft modelleri&lt;/li&gt;
&lt;li&gt;partner modelleri&lt;/li&gt;
&lt;li&gt;open-source modeller&lt;/li&gt;
&lt;li&gt;post-trained varyantlar&lt;/li&gt;
&lt;li&gt;routing ve optimization stratejileri&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Bu önemli, çünkü model esnekliği artık lüks değil. Risk yönetiminin bir parçası.&lt;/p&gt;
&lt;p&gt;Kalite değişirse, fiyatlar oynarsa veya quota daralırsa, ekiplerin seçeneğe ihtiyacı olur.&lt;/p&gt;
&lt;h2 id="maliyet-kontrolü-ikincil-bir-konu-değil"&gt;Maliyet kontrolü ikincil bir konu değil&lt;/h2&gt;
&lt;p&gt;Makale maliyeti de mimari bir concern olarak ele almakta haklı.&lt;/p&gt;
&lt;p&gt;Bu, &amp;ldquo;sonra optimize ederiz&amp;rdquo; problemi değil.&lt;/p&gt;
&lt;p&gt;Eğer her görevi varsayılan olarak en ağır modele gönderirseniz, bu demo&amp;rsquo;da harika çalışabilir ve production ekonomisinde çökebilir.&lt;/p&gt;
&lt;p&gt;Bu yüzden şu bölümler bence birçok kişinin sandığından daha önemli:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;routing&lt;/li&gt;
&lt;li&gt;batching&lt;/li&gt;
&lt;li&gt;caching&lt;/li&gt;
&lt;li&gt;provisioned throughput&lt;/li&gt;
&lt;li&gt;quota management&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Maliyet disiplinini sistem tasarımının bir parçası olarak gören ekipler, bunu sonradan temizlik işi gören ekiplerden çok daha iyi dayanır.&lt;/p&gt;
&lt;h2 id="benim-görüşüm"&gt;Benim görüşüm&lt;/h2&gt;
&lt;p&gt;Bu Foundry parçası faydalı, çünkü AI systems hakkında deneyimli engineer&amp;rsquo;ların gerçekten onları nasıl işletmesi gerektiği gibi konuşuyor.&lt;/p&gt;
&lt;p&gt;Demo gibi değil.
Tek seferlik prototype gibi değil.
Leaderboard turizmi gibi hiç değil.&lt;/p&gt;
&lt;p&gt;Workload&amp;rsquo;lar, kısıtlar, trade-off&amp;rsquo;lar ve sürekli değişim için operating systems gibi.&lt;/p&gt;
&lt;p&gt;Konuşmayı bu seviyede sürdürmemiz gerekiyor.&lt;/p&gt;
&lt;p&gt;Ve production AI systems geliştiriyorsanız, ekiplerin erken içselleştirmesi gereken mindset tam olarak bu.&lt;/p&gt;
&lt;p&gt;Orijinal gönderi: &lt;a href="https://devblogs.microsoft.com/foundry/build-2026-foundry-models/"&gt;A Developer’s Guide to Managing Models, Cost and Quality in Microsoft Foundry&lt;/a&gt;&lt;/p&gt;</content:encoded></item><item><title>Foundry'nin gözlemlenebilirlikten ROI'ye uzanan hikâyesi, ciddi ajan platformlarının ihtiyaç duyduğu şeydir</title><link>https://thedotnetblog.com/tr/news/emiliano-montesdeoca/foundry-observability-to-roi-agent-devops-loop/</link><pubDate>Mon, 25 May 2026 00:00:00 +0000</pubDate><author>Emiliano Montesdeoca</author><guid>https://thedotnetblog.com/tr/news/emiliano-montesdeoca/foundry-observability-to-roi-agent-devops-loop/</guid><description>Foundry'nin en yeni gözlemlenebilirlik duyurusu önemlidir; çünkü tracing, değerlendirme, optimizasyon ve ROI'yi AI agents için tek bir operasyon döngüsünde birleştiriyor.</description><content:encoded>&lt;blockquote&gt;
&lt;p&gt;&lt;em&gt;Bu yazı otomatik olarak çevrilmiştir. Orijinal sürüm için &lt;a href="https://thedotnetblog.com/tr/news/emiliano-montesdeoca/foundry-observability-to-roi-agent-devops-loop/"&gt;buraya tıklayın&lt;/a&gt;.&lt;/em&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;AI agents production&amp;rsquo;da yaşayacaksa, gözlemlenebilirlik logs ve traces&amp;rsquo;ta bitmemeli.&lt;/p&gt;
&lt;p&gt;Bu yüzden Foundry&amp;rsquo;nin yeni observability-to-ROI hikâyesi önemli hissettiriyor.&lt;/p&gt;
&lt;p&gt;Asıl mesaj &amp;ldquo;daha fazla dashboard ekledik&amp;rdquo; değil.&lt;/p&gt;
&lt;p&gt;Asıl mesaj, ciddi agent platformlarının sürekli bir operasyon döngüsüne ihtiyaç duymasıdır:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;ne olduğunu trace et&lt;/li&gt;
&lt;li&gt;iyi olup olmadığını değerlendir&lt;/li&gt;
&lt;li&gt;çalışılması gereken kısmı optimize et&lt;/li&gt;
&lt;li&gt;sonucu business value ile bağla&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Bu, alışıldık platform laf kalabalığından çok daha güçlü bir hikâye.&lt;/p&gt;
&lt;h2 id="kaynak-makaledeki-kilit-cümle-her-şeyi-söylüyor"&gt;Kaynak makaledeki kilit cümle her şeyi söylüyor&lt;/h2&gt;
&lt;p&gt;Orijinal yazı, bence agent geliştiren her ekibin dikkat etmesi gereken bir cümleyle açılıyor:&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&amp;ldquo;Bir AI agent&amp;rsquo;ı yayına almak kolay kısımdır. Onu production&amp;rsquo;da doğru, güvenli ve hesap verebilir halde tutmak ise ekiplerin takıldığı yerdir.&amp;rdquo;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;Bu tam olarak doğru.&lt;/p&gt;
&lt;p&gt;Artık ana sorunun &amp;ldquo;bir agent&amp;rsquo;a havalı bir şey yaptırabilir miyim?&amp;rdquo; olduğu aşamayı geçtik.&lt;/p&gt;
&lt;p&gt;Daha zor ve daha değerli soru şu:&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;gerçek kullanıcılar, gerçek araçlar ve gerçek maliyetlerle etkileşime girmeye başladığında o sistemi işletebilir miyim?&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Foundry konuşmayı tam da bu tarafa itmeye çalışıyor.&lt;/p&gt;
&lt;h2 id="neden-bu-başka-bir-agent-demosundan-daha-önemli"&gt;Neden bu, başka bir agent demosundan daha önemli&lt;/h2&gt;
&lt;p&gt;Birçok AI agent duyurusu hâlâ creation&amp;rsquo;a odaklanıyor: agent&amp;rsquo;ı kur, tools&amp;rsquo;u bağla, tasks&amp;rsquo;i route et, interface&amp;rsquo;i yayınla.&lt;/p&gt;
&lt;p&gt;Bunların hepsi tamam.&lt;/p&gt;
&lt;p&gt;Ama operasyonel sorular, çoğu ciddi sistemin ya sürdürülebilir olmasını ya da pahalı bir deneye dönüşmesini belirleyen yer:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;agent production&amp;rsquo;da gerçekte ne yapıyor?&lt;/li&gt;
&lt;li&gt;doğru şeyi yaptı mı?&lt;/li&gt;
&lt;li&gt;zamanla kötüleşiyor mu?&lt;/li&gt;
&lt;li&gt;yarattığı değere kıyasla çok mu pahalı?&lt;/li&gt;
&lt;li&gt;hangi configuration değişiklikleri gerçekten quality&amp;rsquo;yi iyileştirdi?&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Bu yüzden Foundry duyurusunun tipik bir feature roundup&amp;rsquo;tan daha önemli olduğunu düşünüyorum. Sadece agent creation hikâyesi değil, bir Agent DevOps loop tanımlamaya çalışıyor.&lt;/p&gt;
&lt;h2 id="dört-parçalı-döngü-burada-gerçek-ürün"&gt;Dört parçalı döngü burada gerçek ürün&lt;/h2&gt;
&lt;p&gt;Makale platformu temelde dört capability etrafında düzenliyor:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Trace&lt;/li&gt;
&lt;li&gt;Evaluate&lt;/li&gt;
&lt;li&gt;Monitor&lt;/li&gt;
&lt;li&gt;Optimize&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Doğru şekil bu.&lt;/p&gt;
&lt;p&gt;Hatta production agent workload&amp;rsquo;ları için ciddiye alınmak isteyen her platformun sonunda bu dördüne de ihtiyacı olacağını söyleyebilirim.&lt;/p&gt;
&lt;p&gt;Tracing tek başına yetmez.&lt;/p&gt;
&lt;p&gt;Evaluation tek başına yetmez.&lt;/p&gt;
&lt;p&gt;Kanıt olmadan optimization sadece tahmindir.&lt;/p&gt;
&lt;p&gt;Ve telemetry olmadan ROI konuşması çoğu zaman tiyatrodur.&lt;/p&gt;
&lt;h2 id="interoperability-tarafı-özellikle-akıllıca"&gt;Interoperability tarafı özellikle akıllıca&lt;/h2&gt;
&lt;p&gt;Duyurudaki en güçlü kararlardan biri, Foundry&amp;rsquo;nin tüm agent&amp;rsquo;ların tek bir framework&amp;rsquo;te kurulacağını varsaymaması.&lt;/p&gt;
&lt;p&gt;Kaynak post, tracing ve evals&amp;rsquo;in şu alanlara yayıldığını açıkça söylüyor:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;LangChain&lt;/li&gt;
&lt;li&gt;LangGraph&lt;/li&gt;
&lt;li&gt;OpenAI SDK&lt;/li&gt;
&lt;li&gt;Microsoft Agent Framework&lt;/li&gt;
&lt;li&gt;OpenTelemetry üzerinden custom frameworks&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Bu önemli.&lt;/p&gt;
&lt;p&gt;Çünkü platform lock-in, başlangıçta faydalı olan bir operations hikâyesini daha az cazip hale getirmenin en hızlı yollarından biri.&lt;/p&gt;
&lt;p&gt;Ekipler framework seçimlerini koruyup yine de production-grade telemetry ve evaluation surface elde edebiliyorsa, sürtünme ciddi biçimde azalır.&lt;/p&gt;
&lt;h2 id="rubric-evaluation-insanların-beklediğinden-daha-önemli-olabilir"&gt;Rubric evaluation insanların beklediğinden daha önemli olabilir&lt;/h2&gt;
&lt;p&gt;Rubric evaluation kısmı da ayrıca değerli.&lt;/p&gt;
&lt;p&gt;Bence bu, bütün post&amp;rsquo;taki en pratik eklemelerden biri.&lt;/p&gt;
&lt;p&gt;Neden? Çünkü &amp;ldquo;iyi&amp;rdquo; bağlama bağlıdır.&lt;/p&gt;
&lt;p&gt;Makale, rubric evaluation&amp;rsquo;ın &amp;ldquo;agent&amp;rsquo;in amaçlanan davranışından context-aware evaluation criteria ürettiğini&amp;rdquo; söylüyor. Bu sistemlerin ihtiyaç duyduğu yön tam olarak bu.&lt;/p&gt;
&lt;p&gt;Genel kalite puanlaması faydalıdır.&lt;/p&gt;
&lt;p&gt;Ama sonunda ekiplerin agent&amp;rsquo;ları kendi standartlarına göre puanlaması gerekir:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;tone&lt;/li&gt;
&lt;li&gt;task completion&lt;/li&gt;
&lt;li&gt;policy adherence&lt;/li&gt;
&lt;li&gt;latency expectations&lt;/li&gt;
&lt;li&gt;cost sınırları&lt;/li&gt;
&lt;li&gt;domain&amp;rsquo;e özgü business rules&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Evaluation&amp;rsquo;ın akademik açıdan ilginç olmaktan çıkıp operasyona anlam kazandırdığı nokta burasıdır.&lt;/p&gt;
&lt;h2 id="roi-en-rahatsız-edici-kısım-ve-bu-yüzden-önemli"&gt;ROI en rahatsız edici kısım ve bu yüzden önemli&lt;/h2&gt;
&lt;p&gt;Duyurunun ROI kısmının önemli olduğunu düşünmemin nedeni de tam olarak bunun rahatsız edici olması.&lt;/p&gt;
&lt;p&gt;Kaynak post doğrudan soruyor:&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&amp;ldquo;bu agent maliyetine değiyor mu?&amp;rdquo;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;AI konuşmalarında bu soru sık sık geçiştirilir.&lt;/p&gt;
&lt;p&gt;Ama doğru soru budur.&lt;/p&gt;
&lt;p&gt;Platform gerçekten cost, task completion, time saved ve production traces&amp;rsquo;ı tek yerde birleştirebiliyorsa, engineering ve leadership için çok daha iyi bir ortak dil sağlar.&lt;/p&gt;
&lt;p&gt;Ve dürüst olmak gerekirse, böyle bir ortak dile ciddi şekilde ihtiyaç var.&lt;/p&gt;
&lt;h2 id="benim-görüşüm"&gt;Benim görüşüm&lt;/h2&gt;
&lt;p&gt;Bu batch&amp;rsquo;teki en iyi platform seviyesi duyurulardan biri, çünkü agent&amp;rsquo;ları inşa etmeye değil, işletmeye odaklanıyor.&lt;/p&gt;
&lt;p&gt;Asıl zor iş de tam burada başlıyor.&lt;/p&gt;
&lt;p&gt;Önümüzdeki birkaç yılın en güçlü AI platformları, sadece daha fazla model veya daha fazla demo erişimi olanlar olmayacak. Ekiplerin davranışı trace etmesine, sonuçları değerlendirmesine, güvenli biçimde optimize etmesine ve maliyeti kanıtla savunmasına yardım eden platformlar olacak.&lt;/p&gt;
&lt;p&gt;Foundry&amp;rsquo;nin bu hikâyesi tam da o yöne gitmeye çalışıyor.&lt;/p&gt;
&lt;p&gt;Bu yüzden ciddiye alınmayı hak ediyor.&lt;/p&gt;
&lt;p&gt;Orijinal yazı: &lt;a href="https://devblogs.microsoft.com/foundry/build-2026-from-observability-to-roi-for-ai-agents-on-any-framework/"&gt;Build 2026: From observability to ROI for AI agents on any framework&lt;/a&gt;&lt;/p&gt;</content:encoded></item></channel></rss>