شرکت Anthropic اعلام کرده است که چند مدل پیشرفته هوش مصنوعی این شرکت، از جمله Mythos 5، Opus 4.7 و یک مدل تحقیقاتی داخلی، در جریان آزمایشهای امنیت سایبری پیش از عرضه، به دلیل یک خطای پیکربندی موفق به دسترسی غیرمجاز به سامانههای واقعی شدند. این اتفاق که همزمان با افزایش توانایی مدلهای هوش مصنوعی در انجام وظایف پیچیده امنیت سایبری رخ داده، بار دیگر توجه کارشناسان را به نحوه طراحی و ایمنسازی محیطهای آزمایشی این فناوری جلب کرده است.
بر اساس توضیحات منتشرشده از سوی Anthropic، منشأ این اتفاق سوءتفاهمی میان این شرکت و یکی از شرکای ارزیابی امنیتی آن بوده است. قرار بود مدلهای هوش مصنوعی در محیطی کاملاً شبیهسازیشده و بدون دسترسی به اینترنت مورد آزمایش قرار بگیرند، اما به دلیل پیکربندی نادرست، این محیط به اینترنت متصل باقی مانده بود. همین موضوع باعث شد مدلها سامانههای واقعی را بخشی از سناریوی آزمایشی تصور کرده و برای تکمیل مأموریت خود به آنها متصل شوند.
این شرکت اعلام کرد پس از افشای رویدادی مشابه از سوی OpenAI درباره دسترسی برخی مدلهای این شرکت به زیرساختهای Hugging Face، بیش از ۱۴۱ هزار اجرای آزمایش امنیت سایبری خود را مورد بازبینی قرار داده است. نتیجه این بررسیها نشان داد که سه مدل مختلف Anthropic در سه رخداد جداگانه موفق شدهاند به سامانههای متعلق به سه سازمان واقعی دسترسی پیدا کنند.
به گفته Anthropic، تمامی این رخدادها در جریان آزمایشهایی انجام شده که با همکاری شرکت ارزیابی امنیتی Irregular برگزار میشد. در این آزمایشها، مدلهای هوش مصنوعی مأمور انجام یک چالش موسوم به Capture the Flag بودند؛ روشی متداول در ارزیابی امنیت سایبری که طی آن شرکتکنندگان باید اطلاعات مشخصی را از یک سامانه یا شبکه آزمایشی پیدا کنند.
بر اساس گزارش منتشرشده، نخستین موارد این اتفاق در ماه آوریل رخ داده است. Anthropic پس از شناسایی مشکل با هر سه سازمانی که سامانههایشان تحت تأثیر قرار گرفته بود تماس گرفت. این شرکت اعلام کرده است که دستکم دو سازمان از این سه مورد، پیش از اطلاعرسانی Anthropic از وقوع این دسترسیها هیچ اطلاعی نداشتند. با این حال، نام هیچیک از سازمانهای آسیبدیده منتشر نشده است.
نماینده شرکت Irregular نیز ضمن تأیید ادامه تحقیقات داخلی، از همکاری و شفافیت Anthropic در بررسی این رویدادها قدردانی کرده و اعلام کرده است که دو شرکت همچنان برای ارتقای امنیت سامانههای ارزیابی هوش مصنوعی با یکدیگر همکاری خواهند کرد.
Anthropic تأکید کرده است که برخلاف حادثه اخیر OpenAI، مدلهای این شرکت برای دسترسی به اینترنت از آسیبپذیریهای ناشناخته یا اصطلاحاً «Zero-Day» استفاده نکردهاند. در واقع، امکان دسترسی به اینترنت از ابتدا به دلیل تنظیمات نادرست محیط آزمایش وجود داشته و مدلها تنها از همین دسترسی استفاده کردهاند.
این شرکت همچنین توضیح داده است که در دستورالعمل اولیه به مدل Claude اعلام شده بود که محیط آزمایش کاملاً شبیهسازیشده بوده و هیچ ارتباطی با اینترنت ندارد. اما به دلیل خطای ایجادشده در پیکربندی محیط آزمایش، مدلها سامانههای واقعی را نیز بخشی از همان محیط شبیهسازیشده تلقی کردند و اقدامات خود را مطابق مأموریت تعریفشده ادامه دادند.
Anthropic همچنین اعلام کرده است که در این آزمایشها، مدلها بدون لایههای حفاظتی و محدودیتهایی مورد ارزیابی قرار گرفته بودند که معمولاً در نسخههای عمومی Claude فعال هستند. هدف از این کار، سنجش توانایی واقعی مدلها بدون اعمال محدودیتهای ایمنی بوده است. به گفته این شرکت، اگر این محافظهای امنیتی فعال بودند، چنین رفتارهایی از همان ابتدا متوقف میشد.
بررسیها نشان میدهد مدلهای هوش مصنوعی برای نفوذ به سامانههای واقعی از روشهای نسبتاً ساده امنیتی استفاده کردهاند؛ از جمله سوءاستفاده از گذرواژههای ضعیف و نقاط دسترسی فاقد احراز هویت. این موضوع نشان میدهد که مدلها برای انجام مأموریت خود به سراغ روشهای پیچیده یا ناشناخته نرفتهاند، بلکه از ضعفهای امنیتی رایج بهره بردهاند.
در نخستین حادثه، مدل Opus 4.7 مأمور نفوذ به یک شرکت فرضی شده بود. اما از آنجا که این شرکت در دنیای واقعی نیز وبسایتی با همان نام داشت، مدل پس از ناکامی در یافتن هدف شبیهسازیشده، از طریق اینترنت وبسایت واقعی را پیدا کرد و موفق به نفوذ به آن شد.
در دومین مورد، مدل Mythos 5 تصور کرد که باید بخشی از تمرین آزمایشی را تکمیل کند و به همین دلیل یک بسته مخرب زبان برنامهنویسی Python را در مخزن عمومی PyPI بارگذاری کرد. این بسته حدود یک ساعت در دسترس کاربران قرار داشت و طی این مدت روی ۱۵ سامانه واقعی دانلود و اجرا شد. یکی از این سامانهها متعلق به یک شرکت امنیت سایبری بود که بهصورت خودکار بستههای Python را برای بررسی بدافزار اجرا میکند. در نتیجه، کد تولیدشده توسط مدل توانست اطلاعات احراز هویت را استخراج کرده و به زیرساختهای بیشتری دسترسی پیدا کند.
سومین حادثه مربوط به یک مدل تحقیقاتی داخلی بود که قرار نبود بهصورت عمومی منتشر شود. این مدل پس از آنکه نتوانست هدف فرضی خود را پیدا کند، حدود ۹ هزار سامانه مختلف را اسکن کرد و در نهایت موفق شد به یک برنامه تحت وب متعلق به یک شرکت واقعی نفوذ کند. با این حال، در ادامه اجرای مأموریت، مدل متوجه شد وارد یک حساب ابری شده که هیچ ارتباطی با سناریوی آزمایشی ندارد و در همان مرحله حمله را متوقف کرد.
Anthropic تأکید کرده است که بررسیهای انجامشده نشان میدهد این مدلها هیچ هدف مستقلی برای نفوذ یا گسترش حملات نداشتهاند و صرفاً تلاش میکردند مأموریت تعریفشده در آزمایش را تکمیل کنند. این نتیجه با یافتههای منتشرشده درباره حادثه اخیر OpenAI نیز همخوانی دارد؛ جایی که مدل هوش مصنوعی تنها به دنبال یافتن اطلاعات موردنیاز برای حل چالش ارزیابی بوده است.
در پی این رویدادها، Anthropic اعلام کرده است که تا پایان بررسی کامل زیرساختهای آزمایشی خود، تمامی ارزیابیهای امنیت سایبری که امکان دسترسی به اینترنت داشته باشند را متوقف کرده است. این شرکت همچنین به همراه شریک ارزیابی خود، Irregular، تحقیقات گستردهای را برای مشخص شدن جزئیات این رخدادها و جلوگیری از تکرار موارد مشابه در آینده آغاز کرده است.
این اتفاق نشان میدهد با افزایش توانایی مدلهای هوش مصنوعی در حوزه امنیت سایبری، طراحی محیطهای آزمایشی ایزوله و اعمال کنترلهای دقیق امنیتی بیش از گذشته اهمیت پیدا کرده است. کارشناسان معتقدند رخدادهای اخیر در Anthropic و OpenAI میتواند نقطه عطفی در بازنگری استانداردهای جهانی ارزیابی ایمنی مدلهای هوش مصنوعی باشد؛ استانداردهایی که نقش مهمی در جلوگیری از تعامل ناخواسته این مدلها با زیرساختهای واقعی در آینده خواهند داشت.


