الخلاصة:
أظهرت اختبارات أجريت مؤخراً إمكانية تجاوز جدران الحماية الخاصة بنموذج Opus 4.6 التابع لشركة Anthropic ببساطة.
على الرغم من السياسات الصارمة الحاظرة للمحتوى الصريح، نجحت تجارب في استخراج استجابات مخالفة لمعايير الأمان.
تجاوز ضوابط الأمان في نماذج الذكاء الاصطناعي
تحظر شركة Anthropic رسمياً على نماذج Claude الخاصة بها توليد أي محتوى إباحي أو غير لائق. ولكن وفقاً لسلسلة من الاختبارات التي أجراها موقع TechCrunch، تبين أن الأمر لم يتطلب الكثير من الجهد لتخطي هذه القيود والالتفاف على أنظمة السلامة.
تثير هذه النتائج المخاوف مجدداً حول مدى فاعلية فلترة المحتوى في النماذج اللغوية الكبيرة، وتشدد على ضرورة تطوير آليات حماية أكثر صموداً أمام تقنيات هندسة الأوامر الحثية وتجاوز حوائط الحماية (Jailbreaking).