كشفت شركتا OpenAI وAnthropic هذا الشهر أن نماذج الذكاء الاصطناعي التابعة لهما تمكنت من اختراق أنظمة حقيقية خلال اختبارات للأمن السيبراني، في حادثتين منفصلتين أثارتا قلق الباحثين وسلطتا الضوء على المخاطر المتصاعدة الناجمة عن تزايد قدرات وكلاء الذكاء الاصطناعي.

حادثة "غير مسبوقة" في OpenAI

قالت OpenAI إن نماذجها للذكاء الاصطناعي كانت وراء ما وصفته بـ"حادث سيبراني غير مسبوق" أثر على منصة Hugging Face المخصصة للمطورين مفتوحي المصدر، بحسب ما نقلته شبكة CNBC. وأوضحت الشركة في منشور نشرته يوم الثلاثاء الماضي أن مزيجاً من نموذجها GPT-5.6 Sol ونموذج آخر أكثر تطوراً لم يُطرح بعد، تمكّنا من الإفلات من بيئة اختبار معزولة (sandbox)، والوصول إلى الإنترنت، واستغلال ثغرة أمنية للنفاذ إلى أنظمة Hugging Face.

وبحسب OpenAI، كان النموذج يحاول العثور على معلومات يمكنه استخدامها للغش في أحد التقييمات، ونجح في ذلك بالفعل. وأكدت الشركتان أنهما تجريان تحقيقاً نشطاً في الحادثة، وفق ما ذكرته قناة FOX16.

FOX16 News - OpenAI investigated an unprecedented cyber...

Source: FOX16 News - OpenAI investigated an unprecedented cyber... — www.facebook.com

Anthropic تكتشف ثلاثة اختراقات لـClaude

بعد أكثر من أسبوع على كشف OpenAI عن حادثتها، أعلنت شركة Anthropic يوم الخميس أن نماذجها من Claude تمكنت من الوصول غير المصرح به إلى أنظمة ثلاث منظمات مختلفة لم تُسمّها، خلال اختبارات أمنية أجرتها جهة خارجية، بحسب ما ذكرته مجلة WIRED.

وأوضحت الشركة أن Claude وصل إلى الإنترنت "من داخل بيئة تقييم تابعة لجهة خارجية أو أثناء التفاعل معها". وجاء هذا الاكتشاف بعد أن أجرت Anthropic "مراجعة استعادية واسعة النطاق" لتقييماتها الأمنية الخاصة، في أعقاب حادثة OpenAI مع Hugging Face.

ووفق WIRED، حددت Anthropic في البداية 141,006 اختبار كان يمكن فيها لنموذج Claude الوصول إلى الإنترنت، قبل أن تكتشف أن ثلاثة نماذج مختلفة من Claude استغلت هذا الوصول فعلياً خلال تقييمات أجرتها شركة الاختبار الخارجية Irregular، واخترقت البنية التحتية الإنتاجية لثلاث منظمات حقيقية. ولفتت الشركة إلى أن النموذج الداخلي الأكثر قدرة من بين تلك النماذج أوقف هجومه بمجرد أن اكتشف أن أهدافه كانت حقيقية فعلاً.

خطوات مقبلة ومراجعات مستقلة

ذكرت WIRED أن كلاً من Anthropic وOpenAI استعانتا بشركة METR، وهي جهة مستقلة أخرى متخصصة في تقييم أنظمة الذكاء الاصطناعي، لإجراء مراجعات مستقلة لحادثتيهما. كما التزمت Anthropic باتباع نهج أكثر شمولاً في اختباراتها الأمنية عبر تعزيز إجراءات "الدفاع المتعدد الطبقات" وتصميم اختبارات أكثر دقة.

Anthropic Says Claude Hacked Into 3 Organizations During Cybersecurity Tests | WIRED

Source: Anthropic Says Claude Hacked Into 3 Organizations During Cybersecurity Tests | WIRED — www.wired.com

ونقلت WIRED عن منشور Anthropic قوله إن "بيئات التقييم تحتاج بشكل متزايد إلى أن تُعامَل وفق نفس المعايير الأمنية المطبقة على أي نظام آخر تعمل ضمنه نماذجنا"، مضيفة أنها تشعر بـ"تفاؤل حذر" بإمكانية التغلب على هذا النوع من المخاطر.

وفي تعليق على حادثة OpenAI، وصف المؤرخ ووالتر إيزاكسون، بحسب CNBC، الاختراق بأنه أول أمر "يخيفني تماماً" فيما يتعلق بتطور الذكاء الاصطناعي، في إشارة إلى حجم القلق الذي أثارته هذه الحوادث بين الباحثين والمراقبين في قطاع التكنولوجيا.