<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Prompt Engineering | The .NET Blog</title><link>https://thedotnetblog.com/it/tags/prompt-engineering/</link><description>Articles, tutorials and insights from the .NET community.</description><generator>Hugo</generator><language>it</language><managingEditor>@thedotnetblog (The .NET Blog)</managingEditor><webMaster>@thedotnetblog</webMaster><lastBuildDate>Fri, 17 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://thedotnetblog.com/it/tags/prompt-engineering/index.xml" rel="self" type="application/rss+xml"/><item><title>Il Prompt Tuning di GPT-5.5 in VS Code Dimostra una Verità Dura: Il Design dell'Harness Batte l'Hype</title><link>https://thedotnetblog.com/it/news/emiliano-montesdeoca/gpt-5-5-prompt-tuning-vscode-less-wandering/</link><pubDate>Fri, 17 Jul 2026 00:00:00 +0000</pubDate><author>Emiliano Montesdeoca</author><guid>https://thedotnetblog.com/it/news/emiliano-montesdeoca/gpt-5-5-prompt-tuning-vscode-less-wandering/</guid><description>L'esperimento di VS Code con GPT-5.5 mostra che i miglioramenti misurabili arrivano da un harness disciplinato e dall'iterazione dei prompt, non solo dal passaggio a modelli foundation più recenti.</description><content:encoded>&lt;p&gt;La parte più preziosa del post sul tuning di GPT-5.5 di VS Code non è la variante vincente. È la metodologia. Un&amp;rsquo;ipotesi chiara, trattamenti controllati, misurazione su traffico live e metriche guardrail è esattamente come la qualità degli agenti dovrebbe essere migliorata in ambienti di produzione.&lt;/p&gt;
&lt;p&gt;Fonte originale: &lt;a href="https://code.visualstudio.com/blogs/2026/07/06/optimizing-vscode-coding-harness-model-providers"&gt;https://code.visualstudio.com/blogs/2026/07/06/optimizing-vscode-coding-harness-model-providers&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;L&amp;rsquo;idea centrale era semplice: ridurre la deriva esplorativa e validare prima dopo le modifiche. Sembra ovvio, ma il risultato interessante è che la guida strutturale del prompt a livello di harness ha guidato miglioramenti statisticamente forti in latenza, utilizzo di token in coda e conteggio delle chiamate tool senza un collasso maggiore della qualità.&lt;/p&gt;
&lt;p&gt;La mia opinione è schietta: &lt;strong&gt;le organizzazioni che inseguono solo gli aggiornamenti del modello stanno lasciando sul tavolo facili guadagni di performance e costo&lt;/strong&gt;. Il comportamento dell&amp;rsquo;harness e il design del prompt di sistema possono spostare le metriche di business più velocemente del cambio modello, specialmente quando è coinvolta la fatturazione basata sull&amp;rsquo;uso.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Il trattamento B ha vinto&lt;/strong&gt; perché ha formalizzato il ciclo completo, non solo la restrizione della ricerca. Ha spinto il modello a formare un&amp;rsquo;ipotesi locale falsificabile, fare una prima modifica fondata ed eseguire una validazione mirata immediata. Quella sequenza rispecchia come i bravi ingegneri umani fanno debug sotto pressione temporale.&lt;/p&gt;
&lt;h3 id="cosa-copiare-da-questo-approccio"&gt;Cosa copiare da questo approccio&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Definisci i guardrail di qualità in anticipo&lt;/strong&gt;, poi ottimizza per latenza e costo sotto quei vincoli.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Misura sia il comportamento mediano che quello in coda.&lt;/strong&gt; I miglioramenti p95 nel tempo alla prima modifica e nell&amp;rsquo;uso di token sono spesso più preziosi delle vittorie p50 per la soddisfazione utente reale.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Evita di ottimizzare eccessivamente solo per eval offline.&lt;/strong&gt; Il team VS Code ha usato controlli offline, poi ha validato su traffico live prima del rollout. Quell&amp;rsquo;ordine conta perché i workflow reali espongono comportamenti che i benchmark sintetici non catturano.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Un compromesso merita attenzione: un leggero movimento nelle metriche di sopravvivenza a breve termine. Il team lo ha gestito correttamente pesando dimensione dell&amp;rsquo;effetto e significatività rispetto a guadagni di efficienza più forti e altamente significativi. Questa è decision-making maturo, non cherry-picking di metriche.&lt;/p&gt;
&lt;p&gt;La lezione più ampia è &lt;strong&gt;strategica&lt;/strong&gt;. Il prompt engineering non è &amp;ldquo;magia dei prompt.&amp;rdquo; È &lt;strong&gt;product engineering&lt;/strong&gt;: ipotesi, esperimenti, controlli e gate di deployment. I team che operationalizzano questo ciclo miglioreranno continuamente. I team che discutono le classifiche dei modelli sui social media no.&lt;/p&gt;
&lt;h2 id="in-sintesi"&gt;In sintesi&lt;/h2&gt;
&lt;p&gt;Nel prossimo anno, il vantaggio competitivo nell&amp;rsquo;AI per sviluppatori arriverà meno dall&amp;rsquo;accesso a una specifica famiglia di modelli e più da &lt;strong&gt;chi può eseguire questo ciclo di ottimizzazione in modo affidabile&lt;/strong&gt;. I risultati di VS Code sono un progetto pratico: osserva, ipotizza, testa, spedisci, ripeti.&lt;/p&gt;</content:encoded></item></channel></rss>