<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Benchmarking | The .NET Blog</title><link>https://thedotnetblog.com/pl/tags/benchmarking/</link><description>Articles, tutorials and insights from the .NET community.</description><generator>Hugo</generator><language>pl</language><managingEditor>@thedotnetblog (The .NET Blog)</managingEditor><webMaster>@thedotnetblog</webMaster><lastBuildDate>Fri, 17 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://thedotnetblog.com/pl/tags/benchmarking/index.xml" rel="self" type="application/rss+xml"/><item><title>Strojenie Promptów GPT-5.5 w VS Code Udowadnia Trudną Prawdę: Projekt Harnessa Liczy Się Bardziej Niż Szum</title><link>https://thedotnetblog.com/pl/news/emiliano-montesdeoca/gpt-5-5-prompt-tuning-vscode-less-wandering/</link><pubDate>Fri, 17 Jul 2026 00:00:00 +0000</pubDate><author>Emiliano Montesdeoca</author><guid>https://thedotnetblog.com/pl/news/emiliano-montesdeoca/gpt-5-5-prompt-tuning-vscode-less-wandering/</guid><description>Eksperyment VS Code z GPT-5.5 pokazuje, że wymierne zyski pochodzą z zdyscyplinowanego projektowania harnessa i iteracji promptów, a nie tylko z wymiany na nowsze modele fundamentowe.</description><content:encoded>&lt;p&gt;Najbardziej wartościową częścią wpisu o strojeniu GPT-5.5 w VS Code nie jest zwycięski wariant. To metodologia. Jasna hipoteza, kontrolowane zabiegi, pomiary na żywym ruchu i metryki barier ochronnych – to dokładnie to, jak jakość agentów powinna być ulepszana w środowiskach produkcyjnych.&lt;/p&gt;
&lt;p&gt;Oryginalne źródło: &lt;a href="https://code.visualstudio.com/blogs/2026/07/06/optimizing-vscode-coding-harness-model-providers"&gt;https://code.visualstudio.com/blogs/2026/07/06/optimizing-vscode-coding-harness-model-providers&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;Podstawowa idea była prosta: zmniejszyć dryf eksploracyjny i wcześniej walidować po edycjach. Brzmi oczywiście, ale interesującym odkryciem jest to, że strukturalne wskazówki promptowe na poziomie harnessa przyniosły statystycznie silne ulepszenia w opóźnieniu, zużyciu tokenów ogona i liczbie wywołań narzędzi bez poważnego załamania jakości.&lt;/p&gt;
&lt;p&gt;Moje zdanie jest dosadne: &lt;strong&gt;organizacje, które gonią tylko za aktualizacjami modeli, zostawiają na stole łatwe zyski wydajnościowe i kosztowe&lt;/strong&gt;. Zachowanie harnessa i projekt promptu systemowego mogą przesuwać metryki biznesowe szybciej niż zmiana modelu, zwłaszcza przy rozliczeniach opartych na użyciu.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Wariant B wygrał&lt;/strong&gt;, ponieważ sformalizował pełną pętlę, a nie tylko ograniczenie wyszukiwania. Zachęcił model do sformułowania lokalnej falsyfikowalnej hipotezy, wykonania ugruntowanej pierwszej edycji i przeprowadzenia natychmiastowej skoncentrowanej walidacji. Ta sekwencja odzwierciedla to, jak dobrzy inżynierowie debugują pod presją czasu.&lt;/p&gt;
&lt;h3 id="co-skopiować-z-tego-podejścia"&gt;Co skopiować z tego podejścia&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Zdefiniuj bariery ochronne jakości z góry&lt;/strong&gt;, a następnie optymalizuj pod kątem opóźnienia i kosztów w ramach tych ograniczeń.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Mierz zarówno medianę, jak i zachowanie ogona.&lt;/strong&gt; Ulepszenia p95 w czasie do pierwszej edycji i zużyciu tokenów są często cenniejsze niż zwycięstwa p50 dla rzeczywistej satysfakcji użytkownika.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Unikaj przetrenowania na samych ewaluacjach offline.&lt;/strong&gt; Zespół VS Code użył kontroli offline, a następnie walidował na żywym ruchu przed wdrożeniem. Ta kolejność ma znaczenie, ponieważ prawdziwe przepływy pracy ujawniają zachowania, które syntetyczne benchmarki pomijają.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Jeden kompromis zasługuje na uwagę: niewielki ruch w krótkoterminowych metrykach przetrwania. Zespół poradził sobie z tym prawidłowo, ważąc wielkość efektu i istotność statystyczną przeciwko silniejszym, wysoce istotnym zyskom wydajnościowym. To dojrzałe podejmowanie decyzji, a nie wybiórcze dobieranie metryk.&lt;/p&gt;
&lt;p&gt;Szersza lekcja jest &lt;strong&gt;strategiczna&lt;/strong&gt;. Inżynieria promptów to nie „magia promptów&amp;quot;. To &lt;strong&gt;inżynieria produktu&lt;/strong&gt;: hipotezy, eksperymenty, kontrole i bramki wdrożeniowe. Zespoły, które operacjonalizują tę pętlę, będą się stale poprawiać. Zespoły, które debatują o rankingach modeli w mediach społecznościowych, nie.&lt;/p&gt;
&lt;h2 id="konkluzja"&gt;Konkluzja&lt;/h2&gt;
&lt;p&gt;W nadchodzącym roku przewaga konkurencyjna w AI dla programistów będzie pochodzić mniej z dostępu do konkretnej rodziny modeli, a bardziej z &lt;strong&gt;tego, kto potrafi niezawodnie prowadzić tę pętlę optymalizacyjną&lt;/strong&gt;. Wyniki VS Code to praktyczny plan: obserwuj, hipotezuj, testuj, wysyłaj, powtarzaj.&lt;/p&gt;</content:encoded></item></channel></rss>