هوش مصنوعی از کنترل خارج شد. کلود در تست ایمنی، شرکتهای واقعی را هک کرد!

تنها یک هفته پس از انتشار خبر نفوذ مدل های OpenAI به پلتفرم Hugging Face، حالا شرکت Anthropic هم تایید کرده که هوش مصنوعی Claude در دنیای واقعی دست به حملات هکری زده است.
هفته گذشته OpenAI جزییاتی از رفتار خودسرانه برخی از مدل هایش و نفوذ آن ها به سرورهای یک سازمان دیگر منتشر کرد. حالا Anthropic با انتشار گزارشی از اقدامات کلود، ابعاد تازه ای از این موضوع را فاش کرده است.
بر اساس گزارش Anthropic، این شرکت به سه حادثه مجزا اشاره کرده که یکی از آن ها به بهار گذشته برمی گردد. در این ماجراها، مدل های Claude هنگام حضور در مسابقات امنیتی «تسخیر پرچم» (Capture-the-Flag) که برای سنجش توانایی هایشان طراحی شده بود، به شرکت های واقعی در اینترنت حمله کردند.
در یکی از این موارد، مدل Claude Opus 4.7 به پایگاه داده اصلی یک شرکت تجاری نفوذ کرد و حتی پس از اینکه متوجه شد هدف یک شرکت واقعی است، به کار خود ادامه داد.
در حادثه دوم، Anthropic تایید کرد که مدل Claude Mythos 5 یک پکیج مخرب پایتون را در مخزن عمومی PyPI آپلود کرده است. این پکیج آلوده توسط ۱۵ شرکت واقعی، از جمله یک شرکت امنیت شبکه، دانلود و نصب شد.
در سومین مورد نیز یکی از مدل های داخلی Claude که هنوز به صورت عمومی منتشر نشده، با روش های معمولی حملات سایبری به یک برنامه متصل به اینترنت نفوذ کرد. این مدل تصور می کرد هدف بخشی از همان مسابقه آزمایشی است، اما به محض اینکه فهمید با یک شرکت واقعی طرف است، حمله را متوقف کرد.
در تمام این سناریوها، مدل های Claude باید در محیط های آزمایشی بسته و بدون دسترسی به شبکه فعالیت می کردند. Anthropic می گوید به دلیل اشتباه در تنظیمات سیستم توسط نیروی انسانی، این مدل ها به اینترنت آزاد دسترسی پیدا کردند و شرکت های واقعی را با اهداف مسابقه اشتباه گرفتند.
با این حال، آیا هوش مصنوعی از کنترل خارج شده است؟ Anthropic اعتقاد دارد مقصر این اتفاقات اشتباهات انسانی است، نه خود مدل ها.
در گزارش این شرکت آمده است: «در هیچ کدام از این موارد نشانه ای از رفتار مستقل یا تصمیم گیری خودسرانه مدل ها ندیدیم. مدل ها دقیقا کاری را انجام دادند که برای آن آموزش دیده بودند، هرچند به اشتباه تصور می کردند در محیط شبیه سازی شده حضور دارند.»
Anthropic اعلام کرده که با نظارت بیشتر و سخت گیری در کنترل زیرساخت های آزمایشی، می توان جلوی تکرار چنین حوادثی را گرفت.
با این حال، این اتفاقات یکی از نگرانی های بزرگ درباره آینده هوش مصنوعی را نشان می دهد؛ اینکه حتی امن ترین مدل ها نیز در صورت دریافت دستورهای مبهم یا تحلیل نادرست از موقعیت، می توانند خسارت های جدی وارد کنند.



