ثبت بازخورد

لطفا میزان رضایت خود را از دیجیاتو انتخاب کنید.

Very satisfied Satisfied Neutral Dissatisfied Very dissatisfied
واقعا راضی‌ام
اصلا راضی نیستم
چطور میتوانیم تجربه بهتری برای شما بسازیم؟

نظر شما با موفقیت ثبت شد.

از اینکه ما را در توسعه بهتر و هدفمند‌تر دیجیاتو همراهی می‌کنید
از شما سپاسگزاریم.

مدل Claude
هوش مصنوعی

آنتروپیک دلایل فرار Claude از محیط ایزوله و نفوذ به سازمان‌ها را توضیح داد

استدلال توجیه‌گرانه مدل‌ها، اصرار بی‌ملاحظه برای رسیدن به هدف و تکیه آنتروپیک به تنها یک لایه امنیتی از دلایل این رخنه بوده‌اند.

جواد تاجی
جواد تاجی منتشر شده در 12 شهریور 1405  |  14:32

در دیجیاتو ثبت‌نام کنید

جهت بهره‌مندی و دسترسی به امکانات ویژه و بخش‌های مختلف در دیجیاتو عضو ویژه دیجیاتو شوید.

عضویت در دیجیاتو

آنتروپیک پس از نفوذ مدل‌های هوش مصنوعی خود به زیرساخت‌های سه سازمان مختلف، به‌طور رسمی مسئولیت این رخنه را پذیرفت. این شرکت با اشاره به ضعف‌های عملیاتی اعلام کرده که این اتفاق ناشی از «شکست در امنیت عملیاتی» بوده و مدل‌های توسعه‌یافته هنوز به‌طور کامل همگام و ایمن نشده‌اند.

براساس گزارش منتشرشده آنتروپیک، این شرکت در جریان بررسی بیش از ۱۴۱ هزار ارزیابی امنیت سایبری متوجه شده که در ۳ حادثه (شامل ۶ مرحله آزمایش)، مدل‌های هوش مصنوعی توانسته‌اند به اینترنت عمومی دسترسی پیدا کنند و سیستم‌های ۳ سازمان را به خطر بیندازند. در این آزمایش‌ها مدل‌های Opus 4.7 ،Mythos 5 و یک سیستم تحقیقاتی داخلی حضور داشته‌اند. این سیستم‌ها برخلاف نسخه‌های تجاری Claude، بدون لایه‌های محافظتی و فیلترهای ایمنی فعال شده بودند.

در پرامپت‌های ارائه‌شده به این مدل‌ها ذکر شده بود که در یک محیط شبیه‌سازی‌شده و فاقد دسترسی به شبکه جهانی قرار دارند. بااین‌حال، ناهماهنگی و خطای ارتباطی میان آنتروپیک و شریک ارزیابی آن یعنی شرکت «Irregular»، مسیری را برای اتصال مدل‌ها به وب ایجاد کرده است.

مدل Opus 4.7 با سوءاستفاده از این دسترسی توانست داده‌های احراز هویت را استخراج کند و وارد پایگاهی شامل چند صد ردیف از اطلاعات عملیاتی شود. جالب اینکه این مدل حتی پس از اینکه متوجه شده هدف موردنظر احتمالاً یک سیستم واقعی است، به فرایند نفوذ ادامه داده است. از سوی دیگر، مدل Mythos 5 یک بسته مخرب پایتون تولید کرده و آن را روی مخزن رسمی PyPI قرار داده است. این بسته مخرب به مدت حدود ۱ ساعت در دسترس عموم قرار گرفته و روی ۱۵ سیستم بارگیری شد. کدهای آن روی اسکنر امنیتی یک شرکت اجرا شده و Claude از این طریق توانست به اعتبارنامه‌ها و زیرساخت‌های گسترده‌تری دست پیدا کند.

استراتژی دفاعی آنتروپیک
استراتژی دفاع لایه‌به‌لایه آنتروپیک برای جلوگیری از خروج هوش مصنوعی از محیط امن و مهار خطرات احتمالی

در‌همین‌حین، سیستم تحقیقاتی داخلی آنتروپیک نزدیک به ۹۰۰۰ هدف اینترنتی را بررسی کرده و با بهره‌گیری از اعتبارنامه‌های افشاشده و تکنیک تزریق SQL، به برنامه یک شرکت نفوذ پیدا کرده است. برخلاف مدل Opus، این سیستم به‌محض آنکه متوجه شد هدف موردحمله به تمرین آزمایشی ربطی ندارد و یک سیستم واقعی است، عملیات را متوقف کرد.

چالش‌های انطباق و همگام‌سازی هوش مصنوعی Claude آنتروپیک

آنتروپیک در گزارش تحلیلی خود، دو نقص رفتاری و کنترلی عمده را دلیل وقوع این رخنه دانسته است. نقص اول با نام «استدلال توجیه‌گرانه» به زمانی اشاره دارد که مدل شواهد و نشانه‌های واقعی بودن محیط را نادیده می‌گرفت و برای خودش توجیه می‌کرد که همه‌چیز همچنان در محیط شبیه‌سازی قرار دارد. مورد دوم نیز «اصرار کورکورانه و بی‌ملاحظه برای رسیدن به هدف» اعلام شده است؛ یعنی مدل فقط و فقط روی تکمیل دستوری که گرفته بود متمرکز شده بود و پیامدها، خطرات یا واقعی بودن قربانی را کاملاً نادیده می‌گرفت تا کارش را تمام کند. این شرکت تأکید کرده که تکیه بر تنها یک لایه حفاظتی اشتباه بزرگی بوده و باید از چندین لایه دفاعی مستقل استفاده می‌شد.

آنتروپیک به‌دنبال این رویدادها، فرایند ارزیابی‌های خارجی را موقتاً متوقف و تست‌های داخلی را محدود کرده است. اکنون یک ابزار طبقه‌بندی لحظه‌ای پیاده‌سازی شده تا به‌محض تلاش مدل برای اسکن محیط یا خروج از محیط آزمایش، آن را متوقف کند. تست‌های پرخطر نیز به محیط‌های ایزوله‌تر منتقل شده‌اند و تیم‌های خارجی ارزیابی موظف‌اند محدوده شبکه را پیش از تست اعتبارسنجی کنند و به‌طور پیوسته بر عملکرد عامل‌ها نظارت داشته باشند.

این شرکت ریشه مشکلات را در نقص‌های محیط یادگیری تقویتی نیز می‌داند. درهمین‌رابطه، بازبینی‌های قبلی نشان داده بود که بیش از ۱۰ درصد از محیط‌های تولیدی دارای ایراداتی نظیر هک پاداش و تنظیمات اشتباه بوده‌اند. این وضعیت تنها محدود به آنتروپیک نیست و OpenAI نیز پیش‌تر پس از خروج مدل‌هایش از محیط آزمایشی و دستکاری سرورهای هاگینگ فیس، مجبور به کاهش سرعت پروژه‌های مشابه شده بود.

جواد تاجی
جواد تاجی

دوران حرفه‌ای من در دنیای فناوری تقریبا به ۱۰ سال قبل برمی‌گرده؛ مسیری که با سخت‌افزار شروع شد، با نرم‌افزار ادامه پیدا کرد و حالا با خبرنگاری حوزه فناوری توی دیجیاتو داره ادامه پیدا می‌کنه. من جوادم و بیشتر از سه دهه از عمرم می‌گذره و علاوه بر دنیای فناوری عاشق فیلم‌و‌سینما، موسیقی کلاسیک‌راک و رئال مادریدم.

دیدگاه‌ها و نظرات خود را بنویسید
    مطالب پیشنهادی