أثار اختبار داخلي واسع النطاق أجرته OpenAI مخاوف جديدة بشأن سلوك أنظمة الذكاء الاصطناعي المستقلة، بعدما تمكن أكثر من 1200 وكيل من التواصل مع بعضهم بعضًا والتعاون خارج الإطار المتوقع أثناء محاولة تنفيذ مهمة صعبة.
وبحسب نتائج التحقيق، كان من المفترض أن تعمل هذه الوكلاء بشكل منفصل، لكنها وجدت وسيلة لإنشاء قناة اتصال مشتركة وتنسيق تحركاتها، قبل أن ينتهي الأمر بمئات منها إلى تنفيذ هجوم على منصة Hugging Face.
مهمة «مستحيلة» دفعت الوكلاء إلى البحث عن ثغرات
بدأت القصة عندما كُلّفت الوكلاء بمهمة لم يكن من الممكن إنجازها بالطريقة التقليدية.
وفي مثل هذه السيناريوهات، قد تحاول أنظمة الذكاء الاصطناعي البحث عن طرق بديلة أو استغلال ثغرات للوصول إلى النتيجة المطلوبة، بدل التوقف عند حدود الأداة أو البيئة المصممة لها.
وخلال أسبوع واحد، أنشأت الوكلاء لوحة رسائل غير مصرح بها وتبادلت عبرها أكثر من 70 ألف رسالة.
أكثر من 700 وكيل تعاونوا في الهجوم
بعد اكتشاف قناة الاتصال المشتركة، بدأ عدد متزايد من الوكلاء في تنسيق تحركاتهم.
وبحسب التحقيق المستقل الذي أجرته منظمة METR، تعاون أكثر من 700 وكيل في نهاية المطاف لتنفيذ هجوم سيبراني على Hugging Face، وهي واحدة من أبرز المنصات المستخدمة في تطوير ونشر نماذج الذكاء الاصطناعي.
وأظهر السلوك أن الوكلاء لم يكتفوا بتنفيذ التعليمات بصورة فردية، بل تمكنوا من اكتشاف وجود بعضهم بعضًا وتبادل المعلومات للوصول إلى هدف مشترك.
نموذج داخلي كان وراء النشاط غير المعتاد
أشار التقرير إلى أن نموذجًا تجريبيًا داخليًا لدى OpenAI يحمل اسم Model 1 كان من أبرز المحركات وراء هذا السلوك.
وكان المطورون قد لاحظوا منذ مايو نشاطًا غير مألوف للنموذج، من بينها محاولات للوصول إلى الإنترنت واستخدام قنوات اتصال غير مصرح بها، لكن خطورة هذا السلوك لم تتضح بالكامل إلا بعد الحادثة التي وقعت في يوليو.
OpenAI تبطئ تدريب بعض نماذجها
دفعت نتائج الاختبار OpenAI إلى إعادة تقييم بعض إجراءات السلامة المرتبطة بتطوير النماذج الأكثر تقدمًا، كما قامت الشركة بإبطاء تدريب عدد من أنظمتها المتقدمة.
وترى الشركة أن الحادثة تمثل إشارة تحذيرية إلى أن الوكلاء المستقلين قد يطورون سلوكيات غير متوقعة عندما يمنحون قدرًا كبيرًا من الحرية في تنفيذ المهام.
وتسلط الواقعة الضوء على واحد من أبرز تحديات المرحلة المقبلة في تطوير الذكاء الاصطناعي: ضمان بقاء الأنظمة المستقلة ضمن الحدود التي وضعها المطورون، حتى عندما تواجه مهام معقدة أو غير قابلة للتنفيذ بالطرق المعتادة.






