تمت ترجمة هذه المقالة تلقائيًا. للنسخة الأصلية، انقر هنا.
غالبًا ما يبدو دفاع prompt injection وكأنه يقف على أرض غير ثابتة.
تضيف system prompt أقوى. تضيف فلترًا. تضيف بعض قوائم السماح. وتأمل ألا يُفسد الإدخال الغريب التالي الافتراضات.
لهذا السبب يثير FIDES الاهتمام.
الجزء القوي في القصة أنه ينقل الأمان نحو شيء أكثر حتمية:
- تسميات على المحتوى
- انتقال التسميات عبر سير العمل
- فرض عبر middleware قبل تشغيل الأدوات ذات الصلاحيات
- حدود سياسة واضحة حول ما يمكن للسياق غير الموثوق التأثير فيه
المقال الأصلي مباشر بالقدر الصحيح
يفتتح المقال بالقول إن prompt injection هو “الخطر رقم 1 في OWASP LLM Top 10”.
جيد.
أحب هذا النوع من الصراحة هنا، لأن كثيرًا من الفرق لا تزال تتعامل مع أمان الوكلاء كما لو كان قضية مستقبلية بدل أن يكون مشكلة تصميم تشغيلية حاضرة.
ويتابع المقال بمقارنة عملية قوية: معظم الدفاعات الحالية حدسية، بينما يحاول FIDES نقل النظام نحو السياسة والفرض.
هذا هو التحول الصحيح تمامًا.
ما الذي يجعله أكثر إقناعًا من ورقة بيضاء أمنية أخرى
كثير من الكتابات عن أمان الذكاء الاصطناعي تبقى مجردة.
هذا المقال يفعل شيئًا أفضل. فهو يمر عبر مثال شديد الواقعية: وكيل فرز GitHub issues، ونص issue خبيث، وقراءة ملف بصلاحيات أعلى، ومحاولة تسريب تعليق عام.
هذا مفيد لأنه يربط النقاش كله بسير عمل حقيقي.
ومتى ما رأيت هذا السيناريو، تصبح قيمة الضوابط الحتمية أسهل بكثير في الفهم.
الفكرة الأساسية ليست “اجعل النموذج أذكى”
أهم ما في الأمر هنا أن FIDES لا يطلب من النموذج أن يصبح أفضل سحرًا في اكتشاف الهجمات.
إنه يغيّر عقد وقت التشغيل.
هذا يعني:
- يتم تعليم المحتوى
- تنتقل التسميات
- تصرّح الأدوات بما تقبله
- يحظر middleware المسارات غير الآمنة قبل التنفيذ
هذا نهج أفضل بكثير.
لأنه بمجرد أن يصبح الوكيل قادرًا على استدعاء أدوات لها عواقب حقيقية، لا يمكن للأمان أن يعتمد فقط على ما إذا كان النموذج في يوم جيد أم لا.
وجهة نظري
هذا بالضبط نوع الاتجاه في أمان الوكلاء الذي أريد رؤيته أكثر.
ليس “ثق بالنموذج ليتجاهل التعليمات السيئة”، بل “ابنِ سياج السياسة داخل وقت التشغيل”.
هذا نموذج أكثر صحة بكثير.
وإذا كانت أطر الوكلاء تريد أن تؤخذ بجدية في الاستخدام الإنتاجي، فستحتاج المزيد منها إلى قصص كهذه.
المقال الأصلي: Stop prompt injection from hijacking your agent, new security capabilities now released within Agent Framework
