<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Evaluations | The .NET Blog</title><link>https://thedotnetblog.com/de/tags/evaluations/</link><description>Articles, tutorials and insights from the .NET community.</description><generator>Hugo</generator><language>de</language><managingEditor>@thedotnetblog (The .NET Blog)</managingEditor><webMaster>@thedotnetblog</webMaster><lastBuildDate>Fri, 29 May 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://thedotnetblog.com/de/tags/evaluations/index.xml" rel="self" type="application/rss+xml"/><item><title>Model Router Evals sind der Schritt, den zu viele Teams überspringen</title><link>https://thedotnetblog.com/de/news/emiliano-montesdeoca/model-router-evals-before-you-trust-the-routing/</link><pubDate>Fri, 29 May 2026 00:00:00 +0000</pubDate><author>Emiliano Montesdeoca</author><guid>https://thedotnetblog.com/de/news/emiliano-montesdeoca/model-router-evals-before-you-trust-the-routing/</guid><description>Das neue Foundry-Repository für Model-Router-Evaluierungen ist wichtig, weil Routing-Entscheidungen vor dem Einsatz automatischer Modellauswahl gegen Qualität, Latenz und Kosten gemessen werden müssen, statt sie als Magie zu behandeln.</description><content:encoded>&lt;blockquote&gt;
&lt;p&gt;&lt;em&gt;Dieser Beitrag wurde automatisch übersetzt. Für die Originalversion &lt;a href="https://thedotnetblog.com/de/news/emiliano-montesdeoca/model-router-evals-before-you-trust-the-routing/"&gt;klicke hier&lt;/a&gt;.&lt;/em&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;Automatisches Model-Routing klingt großartig, bis man merkt, dass man immer noch beweisen muss, dass es die richtige Wahl für die eigene Workload ist.&lt;/p&gt;
&lt;p&gt;Genau deshalb ist das neue &lt;strong&gt;Model-Router-Evaluierungs-Repository&lt;/strong&gt; nützlich.&lt;/p&gt;
&lt;p&gt;Es gibt Teams eine konkretere Möglichkeit, die Fragen zu beantworten, auf die es wirklich ankommt:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;behält das Routing die Qualität bei?&lt;/li&gt;
&lt;li&gt;verbessert es die Kosten?&lt;/li&gt;
&lt;li&gt;was macht es mit der Latenz?&lt;/li&gt;
&lt;li&gt;was ändert sich, wenn ich die Modellauswahl einschränke?&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="der-ausgangsartikel-stellt-die-richtigen-fragen"&gt;Der Ausgangsartikel stellt die richtigen Fragen&lt;/h2&gt;
&lt;p&gt;Eine Sache, die mir am Originalbeitrag besonders gefällt, ist, dass der Model Router nicht als selbstverständlich gut behandelt wird.&lt;/p&gt;
&lt;p&gt;Stattdessen werden die unbequemen, aber richtigen Fragen gestellt:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&amp;ldquo;&lt;strong&gt;Stimmt auf meinen Prompts das automatisch ausgewählte Modell des Model Routers mit dem Einzelmodell überein, das ich sonst wählen würde, oder ist es besser?&lt;/strong&gt;&amp;rdquo;&lt;/li&gt;
&lt;li&gt;&amp;ldquo;&lt;strong&gt;Spare ich tatsächlich Ende zu Ende Geld, oder verschiebe ich nur Ausgaben von einem Ort an einen anderen?&lt;/strong&gt;&amp;rdquo;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Das ist genau die richtige Haltung.&lt;/p&gt;
&lt;p&gt;Denn automatisches Routing ist attraktiv, aber es bleibt eine Systementscheidung. Und Systementscheidungen sollten gemessen, nicht bewundert werden.&lt;/p&gt;
&lt;h2 id="warum-dieses-repository-mehr-bedeutet-als-es-zunächst-klingt"&gt;Warum dieses Repository mehr bedeutet, als es zunächst klingt&lt;/h2&gt;
&lt;p&gt;Auf einer Ebene ist das einfach ein Evaluierungs-Repository.&lt;/p&gt;
&lt;p&gt;Auf einer anderen Ebene ist es ein Zeichen von Reife.&lt;/p&gt;
&lt;p&gt;Es sagt: Wenn du automatisches Routing einführen willst, findest du hier eine diszipliniertere Art zu testen:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Qualität&lt;/li&gt;
&lt;li&gt;Kosten&lt;/li&gt;
&lt;li&gt;Latenz&lt;/li&gt;
&lt;li&gt;Trade-offs bei Subsets&lt;/li&gt;
&lt;li&gt;Verhalten der Modellverteilung&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Das ist viel besser, als Routing als Black Box mit gutem Branding zu behandeln.&lt;/p&gt;
&lt;h2 id="meine-einschätzung"&gt;Meine Einschätzung&lt;/h2&gt;
&lt;p&gt;Das ist ein gutes Beispiel für die Art von Tools, die KI-Plattformen mehr brauchen: nicht mehr Magie, sondern mehr Möglichkeiten, die Magie zu validieren, bevor man ihr vertraut.&lt;/p&gt;
&lt;p&gt;So vermeiden Teams, teures Vertrauen auf ungeprüfte Annahmen zu bauen.&lt;/p&gt;
&lt;p&gt;Originalbeitrag: &lt;a href="https://devblogs.microsoft.com/foundry/how-to-run-evals-for-model-router/"&gt;How to run evals for the model router&lt;/a&gt;&lt;/p&gt;</content:encoded></item><item><title>Die schwierige Seite der KI-Entwicklung ist nicht mehr der Zugriff. Es ist, das richtige Modell gut zu betreiben</title><link>https://thedotnetblog.com/de/news/emiliano-montesdeoca/foundry-managing-models-cost-quality-developer-guide/</link><pubDate>Tue, 26 May 2026 00:00:00 +0000</pubDate><author>Emiliano Montesdeoca</author><guid>https://thedotnetblog.com/de/news/emiliano-montesdeoca/foundry-managing-models-cost-quality-developer-guide/</guid><description>Der neue Foundry-Leitfaden macht ein starkes Argument: Modellauswahl, Kostenkontrolle, Evaluierung und Lifecycle-Management sind jetzt die eigentlichen Unterscheidungsmerkmale produktiver KI-Systeme.</description><content:encoded>&lt;blockquote&gt;
&lt;p&gt;&lt;em&gt;Dieser Beitrag wurde automatisch übersetzt. Für die Originalversion &lt;a href="https://thedotnetblog.com/de/news/emiliano-montesdeoca/foundry-managing-models-cost-quality-developer-guide/"&gt;klicke hier&lt;/a&gt;.&lt;/em&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;Wir sind längst über die Phase hinaus, in der allein der Zugang zu einem leistungsfähigen Modell ausreichte.&lt;/p&gt;
&lt;p&gt;Das ist genau der Punkt, den dieser neue &lt;strong&gt;Foundry-Leitfaden für Modell-, Kosten- und Qualitätsmanagement&lt;/strong&gt; richtig trifft.&lt;/p&gt;
&lt;p&gt;Die eigentliche Herausforderung ist jetzt operativ:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;das richtige Modell pro Workload auswählen&lt;/li&gt;
&lt;li&gt;es gegen deine eigenen Daten validieren&lt;/li&gt;
&lt;li&gt;Latenz und Ausgaben verwalten&lt;/li&gt;
&lt;li&gt;Upgrades und Regression-Risiken steuern&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Das ist das, worin ernsthafte Teams gut werden müssen.&lt;/p&gt;
&lt;h2 id="der-ausgangsartikel-formuliert-das-problem-richtig"&gt;Der Ausgangsartikel formuliert das Problem richtig&lt;/h2&gt;
&lt;p&gt;Ein Satz aus dem Originalpost bringt diesen Wandel sehr gut auf den Punkt:&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&amp;ldquo;&lt;strong&gt;Der schwierigste Teil beim Bau von KI-Systemen heute ist nicht mehr, Zugriff auf ein leistungsfähiges Modell zu bekommen. Es geht darum, zu wissen, wie man das richtige Modell über den gesamten Lebenszyklus einer realen Anwendung auswählt, validiert, optimiert und betreibt.&lt;/strong&gt;&amp;rdquo;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;Das ist genau die richtige Diagnose.&lt;/p&gt;
&lt;p&gt;Zu viele Teams denken immer noch, die Modellauswahl sei die Hauptentscheidung.&lt;/p&gt;
&lt;p&gt;Ist sie nicht.&lt;/p&gt;
&lt;p&gt;Die Modellbetriebsführung ist das größere Problem:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Welche Workload bekommt welches Modell?&lt;/li&gt;
&lt;li&gt;Wie wird Qualität überprüft?&lt;/li&gt;
&lt;li&gt;Welche Kostenstruktur ist akzeptabel?&lt;/li&gt;
&lt;li&gt;Was passiert, wenn ein neues Modell auftaucht oder ein altes abdriftet?&lt;/li&gt;
&lt;li&gt;Wie testet man eine Änderung, ohne reale Workflows zu brechen?&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Das ist jetzt die eigentliche Ingenieursarbeit.&lt;/p&gt;
&lt;h2 id="warum-dieser-foundry-beitrag-nützlich-ist"&gt;Warum dieser Foundry-Beitrag nützlich ist&lt;/h2&gt;
&lt;p&gt;Ich mag diesen Artikel, weil er über KI-Systeme so spricht, wie erfahrene Plattformingenieure tatsächlich darüber nachdenken müssen.&lt;/p&gt;
&lt;p&gt;Nicht als &amp;ldquo;nimm das klügste Modell und mach weiter&amp;rdquo;.&lt;/p&gt;
&lt;p&gt;Sondern als Systeme, die unter Zielkonflikten leben:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Fähigkeit&lt;/li&gt;
&lt;li&gt;Latenz&lt;/li&gt;
&lt;li&gt;Kosten&lt;/li&gt;
&lt;li&gt;Sicherheit&lt;/li&gt;
&lt;li&gt;Governance&lt;/li&gt;
&lt;li&gt;Upgrade-Druck&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Das ist viel hilfreicher als benchmarkgetriebener Optimismus.&lt;/p&gt;
&lt;h2 id="der-wichtigste-wandel-ist-zuerst-auf-kriterien-zu-schauen"&gt;Der wichtigste Wandel ist, zuerst auf Kriterien zu schauen&lt;/h2&gt;
&lt;p&gt;Der Ausgangsartikel empfiehlt, Erfolgskriterien zu definieren, bevor man den Modellschrank öffnet.&lt;/p&gt;
&lt;p&gt;Ich finde, das ist eine der wichtigsten Gewohnheiten, die Teams entwickeln können.&lt;/p&gt;
&lt;p&gt;Wenn du zuerst den Katalog öffnest, orientierst du dich an Reputation.&lt;/p&gt;
&lt;p&gt;Wenn du zuerst Kriterien definierst, orientierst du dich an der Realität der Workload.&lt;/p&gt;
&lt;p&gt;Das ist ein gesünderer Prozess.&lt;/p&gt;
&lt;p&gt;Denn das Modell, das einen Benchmark gewinnt, ist nicht automatisch das Modell, das gewinnt bei:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;deinen Prompts&lt;/li&gt;
&lt;li&gt;deinem Latenzbudget&lt;/li&gt;
&lt;li&gt;deinen Kostenlimits&lt;/li&gt;
&lt;li&gt;deinen Governance-Anforderungen&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Dieser Unterschied ist der Punkt, an dem reife KI-Entwicklung beginnt.&lt;/p&gt;
&lt;h2 id="die-multi-modell-geschichte-wird-zu-einem-echten-vorteil"&gt;Die Multi-Modell-Geschichte wird zu einem echten Vorteil&lt;/h2&gt;
&lt;p&gt;Ein weiterer Punkt, der mir gefällt, ist die explizit modellagnostische Ausrichtung.&lt;/p&gt;
&lt;p&gt;Der Artikel präsentiert Foundry nicht als Ein-Modell-Ziel, sondern als operative Oberfläche über:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Microsoft-Modelle&lt;/li&gt;
&lt;li&gt;Partner-Modelle&lt;/li&gt;
&lt;li&gt;Open-Source-Modelle&lt;/li&gt;
&lt;li&gt;posttrainierte Varianten&lt;/li&gt;
&lt;li&gt;Routing- und Optimierungsstrategien&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Das ist wichtig, weil Modellflexibilität kein Luxus mehr ist. Sie ist Teil des Risikomanagements.&lt;/p&gt;
&lt;p&gt;Wenn sich Qualität verschiebt, Preise ändern oder Quoten knapp werden, brauchen Teams Optionen.&lt;/p&gt;
&lt;h2 id="kostenkontrolle-ist-kein-nebenthema"&gt;Kostenkontrolle ist kein Nebenthema&lt;/h2&gt;
&lt;p&gt;Der Artikel ist auch richtig, wenn er Kosten als architektonisches Thema rahmt.&lt;/p&gt;
&lt;p&gt;Das ist kein &amp;ldquo;wir optimieren das später&amp;rdquo;-Problem.&lt;/p&gt;
&lt;p&gt;Wenn du standardmäßig jede Aufgabe an das schwerste Modell sendest, kann das in einer Demo hervorragend funktionieren und unter Produktionsökonomie zusammenbrechen.&lt;/p&gt;
&lt;p&gt;Deshalb halte ich die Abschnitte zu:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Routing&lt;/li&gt;
&lt;li&gt;Batching&lt;/li&gt;
&lt;li&gt;Caching&lt;/li&gt;
&lt;li&gt;Provisioned Throughput&lt;/li&gt;
&lt;li&gt;Quotenmanagement&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;für wichtiger, als viele vielleicht denken.&lt;/p&gt;
&lt;p&gt;Teams, die Kostendisziplin als Teil des Systemdesigns behandeln, werden viel besser altern als Teams, die sie als nachträgliche Aufräumarbeit sehen.&lt;/p&gt;
&lt;h2 id="meine-einschätzung"&gt;Meine Einschätzung&lt;/h2&gt;
&lt;p&gt;Das ist ein nützlicher Foundry-Beitrag, weil er über KI-Systeme so spricht, wie erfahrene Ingenieure sie tatsächlich betreiben müssen.&lt;/p&gt;
&lt;p&gt;Nicht als Demos.
Nicht als einmalige Prototypen.
Und nicht als Benchmark-Tourismus.&lt;/p&gt;
&lt;p&gt;Sondern als Betriebssysteme für Workloads, Einschränkungen, Zielkonflikte und ständige Veränderung.&lt;/p&gt;
&lt;p&gt;Auf dieses Gesprächsniveau sollte sich die Branche weiter zubewegen.&lt;/p&gt;
&lt;p&gt;Und wenn du produktive KI-Systeme baust, dann ist genau das die Denkweise, die Teams früh verinnerlichen sollten.&lt;/p&gt;
&lt;p&gt;Originalpost: &lt;a href="https://devblogs.microsoft.com/foundry/build-2026-foundry-models/"&gt;A Developer’s Guide to Managing Models, Cost and Quality in Microsoft Foundry&lt;/a&gt;&lt;/p&gt;</content:encoded></item><item><title>Foundrys Observability-to-ROI-Geschichte ist genau das, was ernsthafte Agentenplattformen brauchen</title><link>https://thedotnetblog.com/de/news/emiliano-montesdeoca/foundry-observability-to-roi-agent-devops-loop/</link><pubDate>Mon, 25 May 2026 00:00:00 +0000</pubDate><author>Emiliano Montesdeoca</author><guid>https://thedotnetblog.com/de/news/emiliano-montesdeoca/foundry-observability-to-roi-agent-devops-loop/</guid><description>Die neueste Foundry-Ankündigung zur Observability ist wichtig, weil sie Tracing, Bewertung, Optimierung und ROI in einen einzigen Betriebszyklus für KI-Agenten verbindet.</description><content:encoded>&lt;blockquote&gt;
&lt;p&gt;&lt;em&gt;Dieser Beitrag wurde automatisch übersetzt. Für die Originalversion &lt;a href="https://thedotnetblog.com/de/news/emiliano-montesdeoca/foundry-observability-to-roi-agent-devops-loop/"&gt;klicke hier&lt;/a&gt;.&lt;/em&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;Wenn KI-Agenten in der Produktion leben sollen, darf Observability nicht bei Logs und Traces enden.&lt;/p&gt;
&lt;p&gt;Deshalb fühlt sich die neue Foundry-Story von Observability zu ROI wichtig an.&lt;/p&gt;
&lt;p&gt;Die eigentliche Botschaft ist nicht &amp;ldquo;wir haben mehr Dashboards hinzugefügt&amp;rdquo;.&lt;/p&gt;
&lt;p&gt;Die eigentliche Botschaft ist, dass ernsthafte Agentenplattformen einen kontinuierlichen Betriebskreislauf brauchen:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;nachverfolgen, was passiert ist&lt;/li&gt;
&lt;li&gt;bewerten, ob es gut war&lt;/li&gt;
&lt;li&gt;das verbessern, was Arbeit braucht&lt;/li&gt;
&lt;li&gt;das Ergebnis mit Geschäftswert verbinden&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Das ist eine viel stärkere Geschichte als das übliche Plattform-Geschwurbel.&lt;/p&gt;
&lt;h2 id="der-schlüsselsatz-im-ausgangsartikel-sagt-alles"&gt;Der Schlüsselsatz im Ausgangsartikel sagt alles&lt;/h2&gt;
&lt;p&gt;Der Originalbeitrag beginnt mit einer Zeile, auf die meiner Meinung nach jedes Team, das Agenten baut, achten sollte:&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&amp;ldquo;Einen KI-Agenten bereitzustellen ist der leichte Teil. Ihn in der Produktion genau, sicher und verantwortbar zu halten, ist der Punkt, an dem Teams stecken bleiben.&amp;rdquo;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;Genau so ist es.&lt;/p&gt;
&lt;p&gt;Wir sind längst über die Phase hinaus, in der die Hauptfrage lautete: &amp;ldquo;Kann ich einen Agenten dazu bringen, irgendetwas Cooles zu tun?&amp;rdquo;&lt;/p&gt;
&lt;p&gt;Die schwierigere und wertvollere Frage ist:&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Kann ich das Ding betreiben, sobald es mit echten Nutzern, echten Tools und echten Kosten interagiert?&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Genau dorthin versucht Foundry die Unterhaltung zu verschieben.&lt;/p&gt;
&lt;h2 id="warum-das-wichtiger-ist-als-noch-eine-agenten-demo"&gt;Warum das wichtiger ist als noch eine Agenten-Demo&lt;/h2&gt;
&lt;p&gt;Viele KI-Agenten-Ankündigungen konzentrieren sich immer noch auf die Erstellung: Agent bauen, Tools verdrahten, Aufgaben routen, Oberfläche veröffentlichen.&lt;/p&gt;
&lt;p&gt;Das ist alles in Ordnung.&lt;/p&gt;
&lt;p&gt;Aber die operativen Fragen entscheiden darüber, ob die meisten ernsthaften Systeme nachhaltig werden oder zu teuren Experimenten:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Was macht der Agent in der Produktion eigentlich?&lt;/li&gt;
&lt;li&gt;Hat er das Richtige getan?&lt;/li&gt;
&lt;li&gt;Wird er mit der Zeit schlechter?&lt;/li&gt;
&lt;li&gt;Ist er zu teuer für den Wert, den er schafft?&lt;/li&gt;
&lt;li&gt;Welche Konfigurationsänderungen haben die Qualität wirklich verbessert?&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Deshalb denke ich, dass die Foundry-Ankündigung wichtiger ist als eine typische Feature-Zusammenfassung. Sie versucht, einen Agent DevOps-Kreislauf zu definieren, nicht nur eine Agenten-Erzählung.&lt;/p&gt;
&lt;h2 id="der-vier-teil-kreislauf-ist-hier-das-eigentliche-produkt"&gt;Der Vier-Teil-Kreislauf ist hier das eigentliche Produkt&lt;/h2&gt;
&lt;p&gt;Der Artikel ordnet die Plattform im Grunde um vier Fähigkeiten:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Trace&lt;/li&gt;
&lt;li&gt;Evaluate&lt;/li&gt;
&lt;li&gt;Monitor&lt;/li&gt;
&lt;li&gt;Optimize&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Das ist die richtige Form.&lt;/p&gt;
&lt;p&gt;Ich würde sogar sagen, dass jede Plattform, die bei Agenten-Produktionslasten ernst genommen werden will, am Ende alle vier braucht.&lt;/p&gt;
&lt;p&gt;Tracing allein reicht nicht.&lt;/p&gt;
&lt;p&gt;Evaluation allein reicht nicht.&lt;/p&gt;
&lt;p&gt;Optimierung ohne Belege ist bloß Raten.&lt;/p&gt;
&lt;p&gt;Und ROI-Rhetorik ohne Telemetrie ist meist Theater.&lt;/p&gt;
&lt;h2 id="der-interoperabilitätsaspekt-ist-besonders-klug"&gt;Der Interoperabilitätsaspekt ist besonders klug&lt;/h2&gt;
&lt;p&gt;Eine der stärksten Entscheidungen der Ankündigung ist, dass Foundry nicht so tut, als würden alle Agenten in einem einzigen Framework gebaut.&lt;/p&gt;
&lt;p&gt;Der Originalbeitrag spricht ausdrücklich darüber, dass Tracing und Evals sich über Folgendes erstrecken:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;LangChain&lt;/li&gt;
&lt;li&gt;LangGraph&lt;/li&gt;
&lt;li&gt;OpenAI SDK&lt;/li&gt;
&lt;li&gt;Microsoft Agent Framework&lt;/li&gt;
&lt;li&gt;benutzerdefinierte Frameworks über OpenTelemetry&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Das ist wichtig.&lt;/p&gt;
&lt;p&gt;Denn Plattform-Lock-in ist einer der schnellsten Wege, um eine an sich nützliche Operations-Story weniger attraktiv zu machen.&lt;/p&gt;
&lt;p&gt;Wenn Teams ihre Framework-Wahl behalten können und trotzdem Telemetrie- und Evaluationsoberflächen auf Produktionsniveau erhalten, sinkt die Reibung erheblich.&lt;/p&gt;
&lt;h2 id="rubrik-evaluierung-könnte-am-ende-wichtiger-werden-als-viele-erwarten"&gt;Rubrik-Evaluierung könnte am Ende wichtiger werden, als viele erwarten&lt;/h2&gt;
&lt;p&gt;Auch der Teil zur Rubrik-Evaluierung ist erwähnenswert.&lt;/p&gt;
&lt;p&gt;Ich glaube, das ist eine der praktischsten Ergänzungen im gesamten Beitrag.&lt;/p&gt;
&lt;p&gt;Warum? Weil &amp;ldquo;gut&amp;rdquo; vom Kontext abhängt.&lt;/p&gt;
&lt;p&gt;Der Artikel sagt, dass die Rubrik-Evaluierung &amp;ldquo;kontextbezogene Bewertungskriterien aus dem beabsichtigten Verhalten Ihres Agenten&amp;rdquo; generiert. Genau in diese Richtung müssen sich diese Systeme entwickeln.&lt;/p&gt;
&lt;p&gt;Generische Qualitätsbewertung ist nützlich.&lt;/p&gt;
&lt;p&gt;Aber am Ende müssen Teams Agenten nach ihren eigenen Standards bewerten:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Tonfall&lt;/li&gt;
&lt;li&gt;Aufgabenerledigung&lt;/li&gt;
&lt;li&gt;Policy-Einhaltung&lt;/li&gt;
&lt;li&gt;Latenzerwartungen&lt;/li&gt;
&lt;li&gt;Kostenlimits&lt;/li&gt;
&lt;li&gt;domänenspezifische Geschäftsregeln&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Dort wird Evaluation operativ bedeutsam statt nur akademisch interessant.&lt;/p&gt;
&lt;h2 id="roi-ist-der-unbequemste-teil-und-genau-deshalb-ist-er-wichtig"&gt;ROI ist der unbequemste Teil, und genau deshalb ist er wichtig&lt;/h2&gt;
&lt;p&gt;Ich finde auch den ROI-Teil der Ankündigung wichtig, gerade weil er unbequem ist.&lt;/p&gt;
&lt;p&gt;Der Beitrag stellt die Frage direkt:&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&amp;ldquo;Ist dieser Agent das wert, was er kostet?&amp;rdquo;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;Diese Frage wird in KI-Gesprächen oft umschifft.&lt;/p&gt;
&lt;p&gt;Aber sie ist die richtige Frage.&lt;/p&gt;
&lt;p&gt;Wenn die Plattform Kosten, Aufgabenerledigung, eingesparte Zeit und Produktionstraces wirklich an einem Ort verbinden kann, gibt das Engineering und Führung eine viel bessere gemeinsame Sprache.&lt;/p&gt;
&lt;p&gt;Und ehrlich gesagt wird diese gemeinsame Sprache dringend gebraucht.&lt;/p&gt;
&lt;h2 id="mein-fazit"&gt;Mein Fazit&lt;/h2&gt;
&lt;p&gt;Das ist eine der besseren Plattform-Ankündigungen in dieser Runde, weil sie sich auf das Betreiben von Agenten konzentriert und nicht nur auf deren Bau.&lt;/p&gt;
&lt;p&gt;Und dort beginnt die eigentliche harte Arbeit.&lt;/p&gt;
&lt;p&gt;Die stärksten KI-Plattformen der nächsten Jahre werden nicht einfach die sein, die mehr Modelle oder mehr Demos bieten. Es werden die sein, die Teams helfen, Verhalten zu verfolgen, Ergebnisse zu bewerten, sicher zu optimieren und Kosten mit Belegen zu rechtfertigen.&lt;/p&gt;
&lt;p&gt;Diese Foundry-Story versucht genau in diese Richtung zu gehen.&lt;/p&gt;
&lt;p&gt;Deshalb ist sie es wert, ernst genommen zu werden.&lt;/p&gt;
&lt;p&gt;Originalbeitrag: &lt;a href="https://devblogs.microsoft.com/foundry/build-2026-from-observability-to-roi-for-ai-agents-on-any-framework/"&gt;Build 2026: From observability to ROI for AI agents on any framework&lt;/a&gt;&lt;/p&gt;</content:encoded></item></channel></rss>