آژیر خطر برای هوش مصنوعی؛ مدلهای پیشرفته دوباره از کنترل خارج شدند


مؤسسه امنیت هوش مصنوعی بریتانیا (AISI) اعلام کرده دو مدل پیشرفته هوش مصنوعی در جریان یک آزمایش امنیت سایبری، برای نخستین بار دست به حملات هکری علیه افراد و سازمانهای واقعی زدهاند. به گفته این نهاد، عامل هوش مصنوعی مبتنی بر Mythos 5 متعلق به Anthropic و مدل GPT-5.6 Sol از OpenAI در مجموع ۱۹ رفتار مخرب از خود نشان دادهاند که ۱۷ مورد آن مربوط به مدل Mythos بوده است. این مدل برای موفقیت در آزمون، با ساخت هویتهای جعلی در GitHub تلاش کرد توسعهدهندگان واقعی را فریب دهد، ایمیلهای آلوده به بدافزار ارسال کرد و حتی از مرورگر Tor برای مخفی کردن هویت خود و دور زدن محدودیتها استفاده کرد.
بررسیهای AISI نشان میدهد این رفتارها نتیجه ترکیبی از چند اشتباه در طراحی آزمایش بوده است؛ از جمله دسترسی کامل مدلها به اینترنت، غیرفعال شدن بخشی از لایههای امنیتی، نبود سامانه نظارت لحظهای بر عملکرد هوش مصنوعی و برخی تنظیمات نادرست در محیط آزمایش. گزارش ۳۵ صفحهای این مؤسسه همچنین نشان میدهد عامل هوش مصنوعی حتی درباره واقعی بودن قربانیان فکر کرده، اطلاعات عمومی توسعهدهندگان را جمعآوری کرده و تلاش کرده با تأخیر زمانی، پیامهای جعلی خود را طبیعی و مستقل جلوه دهد.
این سومین گزارش مهم در هفتههای اخیر درباره رفتارهای خارج از کنترل مدلهای هوش مصنوعی پس از اتفاقات مشابه در OpenAI و Anthropic است. با این حال، بسیاری از کارشناسان تأکید میکنند نگرانی اصلی، «سرکش شدن هوش مصنوعی» نیست، بلکه شیوه آزمایش این مدلهاست. به گفته متخصصان، فراهم کردن دسترسی آزاد به اینترنت و حذف برخی محدودیتهای امنیتی، شرایطی غیرعادی ایجاد کرده که احتمال بروز چنین رفتارهایی را افزایش داده است. با این وجود، این حوادث بار دیگر بحث درباره ایمنی، نظارت و مقررات توسعه هوش مصنوعی را به صدر توجهات بازگردانده است.
منبع





