أكثر جزء قيم في منشور ضبط GPT-5.5 لـ VS Code ليس المتغير الفائز. بل المنهجية. فرضية واضحة، ومعالجات خاضعة للتحكم، وقياس حركة المرور الحية، ومقاييس الحماية — هذا هو بالضبط كيف يجب تحسين جودة الوكيل في بيئات الإنتاج.
المصدر الأصلي: https://code.visualstudio.com/blogs/2026/07/06/optimizing-vscode-coding-harness-model-providers
الفكرة الأساسية كانت بسيطة: تقليل الانجراف الاستكشافي والتحقق مبكرًا بعد التعديلات. يبدو ذلك بديهيًا، لكن النتيجة المثيرة للاهتمام هي أن التوجيه الهيكلي للتعليمات في طبقة الحزام قاد تحسينات إحصائية قوية في زمن الاستجابة واستخدام الرموز الطرفية وعدد استدعاءات الأدوات دون انهيار كبير في الجودة.
رأيي واضح: المنظمات التي تطارد فقط ترقيات النموذج تترك مكاسب أداء وتكلفة سهلة على الطاولة. سلوك الحزام وتصميم تعليمات النظام يمكنهما تحريك مقاييس الأعمال أسرع من تبديل النموذج، خاصة عندما تكون الفوترة قائمة على الاستخدام.
العلاج B فاز لأنه أضفى الطابع الرسمي على الحلقة الكاملة، وليس فقط تقييد البحث. لقد وجه النموذج لتشكيل فرضية محلية قابلة للدحض، وإجراء تعديل أولي قائم على الأدلة، وتشغيل تحقق مركز فوري. هذا التسلسل يعكس كيفية عمل المهندسين البشريين الجيدين تحت ضغط الوقت.
ما يجب على الفرق التي تبني وكلاء برمجة داخليين نسخه:
- حدد حواجز الجودة مقدمًا، ثم حسّن زمن الاستجابة والتكلفة ضمن تلك القيود.
- قِس كلاً من الوسيط وسلوك الذيل. تحسينات p95 في وقت أول تعديل واستخدام الرموز غالبًا ما تكون أكثر قيمة من مكاسب p50 لرضا المستخدم الحقيقي.
- تجنب الإفراط في التكييف للتقييمات غير المتصلة وحدها. فريق VS Code استخدم فحوصات غير متصلة، ثم تحقق على حركة المرور الحية قبل الطرح. هذا الترتيب مهم لأن سير العمل الحقيقي يكشف سلوكيات تفوتها المعايير الاصطناعية.
مفاضلة واحدة تستحق الاهتمام: حركة طفيفة في مقاييس البقاء قصيرة المدى. الفريق تعامل مع هذا بشكل صحيح بوزن حجم التأثير والأهمية ضد مكاسب الكفاءة القوية والعالية الأهمية. هذا هو اتخاذ قرار ناضج، وليس انتقاء المقاييس.
الدرس الأوسع استراتيجي. هندسة التعليمات ليست “سحر التعليمات.” إنها هندسة منتج: فرضيات، تجارب، ضوابط، وبوابات نشر. الفرق التي تجعل هذه الحلقة عملية ستتحسن باستمرار. الفرق التي تناقش تصنيفات النماذج على وسائل التواصل الاجتماعي لن تتحسن.
في العام القادم، الميزة التنافسية في AI للمطورين ستأتي أقل من الوصول إلى عائلة نماذج محددة وأكثر من من يمكنه تشغيل حلقة التحسين هذه بشكل موثوق. نتائج VS Code هي مخطط عملي: لاحظ، افترض، اختبر، شحن، كرر.
