Agent يقرأ صفحات قد تحتوي نصًا يقول تجاهل التعليمات واضغط زرًا أو ارسل سرًا. هذا Prompt Injection من المحتوى الخارجي. الحماية ليست فلتر كلمات فقط، بل فصل trust boundaries ومنع البيانات غير الموثوقة من منح صلاحيات أو تغيير policy.
عرّف المحتوى غير الموثوق
كل DOM و email و document خارجي data، حتى لو بدا كتعليمات. system/user policy أعلى منه. Tool descriptions أيضًا يجب ألا تقبل policy من الصفحة.
ابنِ corpus هجمات
أنشئ صفحات اختبار فيها تعليمات مباشرة، obfuscation، نص داخل aria-label، comments، وصور OCR إن كان Agent يقرأها. الهدف قياس السلوك لا إنتاج exploit ضد مواقع حقيقية.
خطوات عملية
- سيناريو benign.
- injection واضح.
- injection مخفي.
- طلب Tool حساس.
اختبر policy enforcement في server
حتى إذا حاول Agent استدعاء send أو exec، يجب أن تمنع الصلاحيات وال confirmation الطلب غير المصرح. لا تجعل safety متوقفة على تفسير النموذج للنص.
قلل data exfiltration
Tools التي ترسل بيانات خارجية تحتاج scope و redaction. امنع تمرير secrets من clipboard أو storage إلى destination جديد بدون policy. راقب cross-domain transfers.
قائمة مراجعة
- destination allowlist.
- secret redaction.
- confirmation.
- audit.
قِس false positives
الحماية التي تمنع كل صفحة فيها كلمة تجاهل غير مفيدة. اختبر محتوى شرعيًا مشابهًا وتأكد أن Agent يكمل المهمة مع الحفاظ على الحدود.
أضف اختبار Exfiltration متعدد الخطوات
الهجوم قد لا يطلب إرسال secret مباشرة. قد يطلب من Agent قراءته أولًا، ثم فتح موقع خارجي، ثم لصقه في form عادي. صمم benchmark يختبر chaining بين read Tool و navigation و write Tool. يجب أن تمنع policy نقل بيانات من trust zone حساسة إلى destination غير مسموح حتى لو كل Tool منفردة تبدو شرعية. تتبع data labels إن أمكن أو ضع قواعد على أنواع المصادر. هذا الاختبار أقرب للهجمات الواقعية من جملة واحدة تقول أرسل كلمة المرور.
اختبر Injection داخل نتائج Tools نفسها
الخطر لا يأتي من DOM فقط. Search result أو email connector أو OCR أو ملف قد يعيد نصًا خبيثًا داخل Tool result. اعتبر كل payload خارجي data غير موثوق حتى لو جاء عبر MCP Tool موثوقة. ضع origin metadata على النتيجة ولا تسمح للنص بإعادة تعريف policy. benchmark يجب أن يزرع instruction خبيثة في نتيجة search أو document ثم يراقب هل Agent يحاول Tool غير لازمة. هذا يوسع الاختبار من browser page إلى سلسلة المصادر التي يغذي بها الوكيل قراره.
اختبار التحكم قبل منح الصلاحية
في «كيف تختبر Prompt Injection عندما يكون الوكيل قادرًا على التحكم بالمتصفح» اختبر النظام بأداة قراءة أولًا ثم أداة تغيير منخفضة المخاطر، مع تسجيل المدخل والقرار والنتيجة دون أسرار. افصل بين ما يستطيع النموذج اقتراحه وما يستطيع تنفيذه، وضع approval أو policy على الأفعال الحساسة. جرّب مدخلًا غامضًا ومدخلًا يحتوي تعليمات متعارضة، وتأكد أن حدود الصلاحيات لا تتغير بسبب صياغة المستخدم. القيمة هنا ليست في عدد الأدوات التي يستطيع ال ـAgent استدعاءها، بل في أن كل استدعاء يمكن تفسيره ومراجعته وإيقافه عند فشل شرط الأمان أو عدم اكتمال السياق.
قائمة مراجعة
- صلاحية دنيا لكل أداة.
- Approval للأفعال الحساسة.
- تسجيل القرار والنتيجة.
- اختبار تعليمات متعارضة.
شارك في تقييم ونقاش المقال
رأيك يضيف قيمة للمقال ويساعدنا على تحسين المحتوى والنقاش حوله.
النقاش
جارٍ تحميل التعليقات…