لقد حصلت مؤخرا لمشاهدة ما يحدث عند كسر حماية بعض أقوى نماذج الذكاء الاصطناعي في العالم.
لا تقلق، لم يتم استخدام هذا التلاعب بالذكاء الاصطناعي لاختراق أي شخص أو بناء قنبلة نووية. لقد تمكنت ببساطة من رؤية مدى ضعف بعض النماذج الحدودية في التخلص من حواجز السلامة الخاصة بها.
قامت FAR.AI، وهي منظمة غير ربحية تعمل في مجال سلامة الذكاء الاصطناعي ومقرها في كاليفورنيا، ببناء أداة تأخذ مجموعة من المطالبات الإشكالية وتولد أكثر من ألف إصدار مختلف في محاولة لتحديد عمليات كسر الحماية الفعالة. رأيت بعض النماذج تضع خطة مفصلة لشن هجوم إلكتروني على سد وهمي لتوليد الطاقة الكهرومائية، من بين أمور أخرى. في كثير من الأحيان، كان الأمر يتطلب تجربة العشرات من المطالبات، حيث ترفض النماذج الكثير منها على الفور.
لقد تحدثت مع FAR.AI قبل صدور تقرير جديد، والذي شهد قيام المجموعة باختبار حواجز السلامة لنماذج من أربع شركات أمريكية مشهورة: Anthropic’s Claude Opus 4.8 وFable 5؛ OpenAI’s GPT 5.5 و5.6؛ جوجل الجوزاء 3.1 برو؛ وGrok 4.3 و4.5، من شركة SpaceXAI المجمعة حديثًا لـ Elon Musk. إنها مطالبات يتم إنشاؤها تلقائيًا مصممة لخداع النماذج للقيام بأشياء قد تكون ضارة، مثل إنشاء برامج استغلالية وتوفير تفاصيل لتطوير أسلحة كيميائية أو بيولوجية.
ووجد التقرير أن Grok كان الأكثر عرضة لعمليات كسر الحماية، حيث تم العثور على 448 عملية كسر حماية، يليه Gemini، حيث تم العثور على 249 حالة، في حين كان Claude وFable وGPT منيعين ضد الهجمات. ومع ذلك، هذا لا يعني أن هذه النماذج محصنة ضد عمليات كسر الحماية الأكثر تعقيدًا، والتي قد تتضمن التفاعل مع النموذج بطرق أكثر تعقيدًا، وفقًا لـ FAR.AI وخبراء آخرين.
قام التقرير أيضًا بحساب تكلفة جعل النماذج تسيء التصرف باستخدام نموذج ذكاء اصطناعي آخر لإنشاء عمليات كسر الحماية المختلفة تلقائيًا. النتائج رخيصة للغاية، إذا أخذنا كل الأمور بعين الاعتبار — 58 دولارًا أمريكيًا لكسر حماية Grok و278 دولارًا أمريكيًا لكسر حماية Gemini.
يقول آدم جليف، الرئيس التنفيذي لشركة FAR.AI والخبير في سلامة الذكاء الاصطناعي ومواءمته: “إن نماذج الذكاء الاصطناعي في الوقت الحالي أقل تنظيمًا من المطاعم”.
يقول جليف إن النتائج توضح الحاجة إلى معايير ولوائح مفروضة من الخارج. يقول: “الحديث عن الاعتماد على الالتزامات الطوعية، وأن شركات الذكاء الاصطناعي ستكون قادرة على التنظيم الذاتي، هو هراء”.
لكن جليف يعتقد أيضًا أن النتائج تظهر أنه يمكن اختبار النماذج بشكل منهجي للتأكد من سلامتها. ويقول: “هناك زاوية متفائلة هنا”. “الدفاع والسلامة ممكنان حقًا.”
يقول روهين شاه، مدير سلامة ومواءمة الذكاء الاصطناعي العام في Google DeepMind، إن نتائج التقرير “لا ينبغي تفسيرها على أنها تقييم شامل لسلامة وأمن جيميني”، لأنه ليست كل عمليات الهروب من السجن بنفس القدر من الخطورة.
يقول شاه: “نحن نعمل باستمرار على تحسين إجراءاتنا الوقائية”. “إننا نجري فرقًا حمراء وتقييمات مكثفة عبر مخاطر إساءة الاستخدام الشديدة ونطبق طبقات متعددة من الحماية طوال عملية التطوير والنشر.”
“تعكس هذه النتائج الاستثمار المستدام الذي قمنا به في إجراءاتنا الوقائية،” كما قال المتحدث باسم الشؤون الإنسانية مايكل أسيمان لمجلة WIRED. “نحن نواصل تطوير أنظمة السلامة لدينا حيث أصبحت هذه الهجمات أكثر تعقيدًا.”
“تمثل عمليات كسر الحماية تحديًا مستمرًا في جميع أنحاء الصناعة، ونحن نعمل باستمرار على تعزيز ضماناتنا مع تطور تقنيات الهجوم. وقال المتحدث باسم OpenAI، غابي رايلا، في بيان لمجلة WIRED: “إننا نختبر نماذجنا بدقة ضد التهديدات الجديدة ونستخدم تلك النتائج لتحسين وسائل الحماية لدينا”.
لم تستجب شركة SpaceXAI لطلب WIRED للتعليق.
وتلزم قوانين الولاية التي تم إقرارها مؤخرًا في كاليفورنيا ونيويورك مطوري الذكاء الاصطناعي الحدودي بنشر تقارير السلامة، وقريبًا، سيلزم قانون إلينوي تلك الشركات بتقييم ممارسات السلامة الخاصة بها من قبل مدققين خارجيين. لكن الحكومة الفيدرالية لم توافق بعد على أي متطلبات محددة تتعلق بالسلامة، وتبع ذلك حالة من الفوضى بينما تحاول الصناعة – والمسؤولون – اكتشاف ذلك.


