
گزارش رسمی OpenAI درباره نفوذ مدل هوش مصنوعی به هاگینگ فیس منتشر شد
مدل هوش مصنوعی دخیل در این حادثه، به خانواده مدل معرفینشده Astra تعلق داشته است.
شرکت OpenAI گزارش رسمی خود درباره حادثه امنیتی و نقض سیستمهای هاگینگ فیس را منتشر کرد. این گزارش شفافترین تصویر از نحوه فرار این مدل هوش مصنوعی از محیط آزمایشی بر اثر زنجیرهای غیرعادی از رویدادها و ایجاد یک حادثه گسترده سایبری را به تصویر میکشد.
گزارش جامع OpenAI که بیش از یک ماه پس از علنیشدن ماجرا منتشر شده است، چندین رخنه امنیتی مجزا را بررسی میکند. براساس بیانیه، این حادثه ناشی از ناهماهنگی رفتاری هوش مصنوعی در شرایطی استثنایی رخ داده است؛ شرایطی که حاصل تجمیع حضور تسکهای غیرقابلحل در ارزیابی سامانه ExploitGym، پایداری مدل در افقهای طولانی اجرای وظایف و ارسال پیامها به سایر مدلهای همتا بوده که باعث انحراف آنها از هدف اصلی شده است.
نحوه زنجیرهسازی آسیبپذیریها و نفوذ مدل OpenAI به هاگینگ فیس
در این گزارش شرح داده شده که مدل هوش مصنوعی OpenAI در محیط ارزیابی با یک مسئله غیرقابلحل مواجه شده و سپس با متصلکردن چندین حفره امنیتی ناشناخته به یکدیگر، تدابیر امنیتی را دور زده تا کار خود را به پایان برساند. این مدل ابتدا ابزار مدیریت پکیج Artifactory را به خطر انداخت تا به اینترنت متصل شود و پس از آن، سیستمهای گوناگونی را در OpenAI، هاگینگ فیس و سایر شرکتها هک کرد.

مدل اصلی دخیل در این رخداد، از خانواده مدل آتی این شرکت یعنی Astra بوده است؛ هرچند گزارش تأکید میکند این مدل دارای دادههای پسآموزش (Post-training) کاملاً متفاوتی بوده که بخش عمده رفتار مدل در آن مرحله شکل میگیرد. همچنین به دلیل اینکه OpenAI مشغول سنجش حداکثر توانمندیهای مدل بود، آن را بدون دستورالعملهای امنیتی معمول اجرا کرده بود؛ زیرا این لایهها مانع انجام اقدامات سایبری پرخطر میشوند و برداشتن آنها برای شناسایی ظرفیتهای فنی مدل و تدوین تدابیر حفاظتی صورت میگیرد.
در بخش نهایی این بیانیه، اقدامات امنیتی جدید OpenAI تشریح شده است. این شرکت میگوید که نظارت بر زنجیره تفکر مدلهای هوش مصنوعی (محیطی که واکنشها و اهداف کوتاهمدت مدل در آن ثبت میشود) را افزایش داده و سیستمهای واکنش ۲۴ساعته و ابزارهای توقف فوری ایجنتهای ناامن را پیاده کرده است. به گفته OpenAI، اگر سامانه نظارت زنجیره تفکر فعلی در زمان رخداد فعال بود، فعالیت اولیه را بیش از ۱ روز پیش از نفوذ به سیستمهای هاگینگ فیس شناسایی و تیم امنیت را مطلع میکرد.
همچنین نهادهای ارزیاب مستقل METR و Redwood Research نیز روی رفتار این مدلها تحقیق کردهاند و قصد دارند گزارشهای خود را منتشر کنند.
برای گفتگو با کاربران ثبت نام کنید یا وارد حساب کاربری خود شوید.