
MMAligner يرفع رفض المدخلات متعددة الوسائط الخطرة الى 99 بالمئة
بحث MMAligner يحلل سبب تجاوز الصور والمدخلات متعددة الوسائط لحواجز الامان، ويقترح معايرة التمثيلات لاعادتها الى منطقة الرفض داخل النموذج.
MMAligner يرفع رفض المدخلات متعددة الوسائط الخطرة الى 99 بالمئة
قد يرفض نموذج متعدد الوسائط طلبا نصيا خطرا، لكنه يستجيب لطلب يحمل المعنى نفسه عند تقديمه عبر صورة او مزيج من النص والصورة. بحث MMAligner المنشور على arXiv في 6 اغسطس 2026 يحاول تفسير سبب هذه الفجوة.
المشكلة في التمثيل
وجد الباحثون ان آليات الرفض المتعلمة من النص تبقى موجودة، لكن بعض المدخلات الخطرة متعددة الوسائط تتحول الى تمثيلات داخلية تقع خارج حدود الرفض. يقترح MMAligner معايرة هذه التمثيلات ودفع المدخلات الخطرة نحو المنطقة التي تنشط فيها استجابة الرفض، مع الحفاظ على المدخلات السليمة قدر الامكان.
بحسب الورقة، رفعت الطريقة متوسط معدل رفض المدخلات الخطرة الى 99 في المئة عبر عدة نماذج مفتوحة، مع تراجع في المنفعة يقل عن 2 في المئة. الورقة مقررة للظهور في ACM CCS 2026، وتقدم اتجاها مهما لمعالجة السلامة من داخل تمثيلات النموذج بدلا من الاعتماد فقط على مرشحات خارجية.