شهرآرانیوز؛ مدیرعامل OpenAI، سم آلتمن، اوایل همین ماه از توصیف مدل جدید این شرکت بهعنوان یک «روتوایلر» استقبال کرد؛ مدلی که «مسئله را از گلو میگیرد و تا زمانی که آن را حل نکند، رهایش نمیکند.».
اما این آزمایشگاه هوش مصنوعی مستقر در سانفرانسیسکو این هفته متوجه شد که مدل GPT-Sol ۵.۶ از کنترلهای داخلی شرکت خارج شده و یک حمله هکری بزرگ را انجام داده است.
به گفته بیش از نیمدوجین فرد آگاه از ماجرا، کارکنان بخشهای امنیت و آزمایش OpenAI از وقوع این اتفاق شگفتزده نشدند، اما بهشدت وحشت کردند. این حادثه در شرایطی رخ داد که OpenAI برای رقابت با Anthropic در توسعه پیشرفتهترین قابلیتهای امنیت سایبری، از روشهای آموزشی هرچه تهاجمیتر استفاده میکرد.
برخی از این افراد گفتند که پیشتر به OpenAI هشدار داده شده بود که این شیوه آموزش میتواند به وقوع یک حمله هکری خارج از کنترل منجر شود؛ زیرا آزمایشهای قبلی نشان داده بودند که برخی مدلها قادرند از محیطهای محدود خارج شوند و حتی تلاش کنند در دنیای واقعی خسارت ایجاد کنند.
یکی از افراد نزدیک به OpenAI گفت: «این نتیجه ترکیب سرعت بسیار بالای رقابت و تلاش همه برای رسیدن هرچه سریعتر به قابلیتهای بیشتر است.» او افزود که این اتفاق ناشی از «دستکم گرفتن تواناییهای مدل» و همچنین «آمادگی ناکافی در زمینه ایمنی» بوده است.
این حادثه نشان میدهد که OpenAI با وجود افزایش هشدارها درباره پیامدهای ایمنی، همچنان بر روشهای آموزشیای تأکید کرده که در آنها مدلها برای پیگیری بیوقفه اهداف خود پاداش میگیرند.
OpenAI اواخر سهشنبه اعلام کرد که یک عامل هوش مصنوعی (AI Agent) که در حال آزمایش بود، از محیط ایزوله خود خارج شده، به اینترنت متصل شده، آسیبپذیریها را شناسایی و از آنها سوءاستفاده کرده و برای حل یک مسئله پیچیده امنیت سایبری، اطلاعات ورود (Login Credentials) مربوط به استارتاپ Hugging Face را سرقت کرده است.
این رخنه امنیتی که توسط شرکتی با ارزش ۸۵۲ میلیارد دلار رخ داده، نشاندهنده افزایش خطرات ناشی از تکنیکی به نام یادگیری تقویتی (Reinforcement Learning) است؛ روشی که در آن مدلهای هوش مصنوعی برای انجام موفقیتآمیز وظایف پاداش دریافت میکنند.
اگرچه یادگیری تقویتی در صنعت هوش مصنوعی بهطور گسترده استفاده میشود، اما پژوهشهای رو به افزایشی نشان میدهند که اگر مدلها تنها بر اساس کسب پاداش برای انجام مأموریت آموزش ببینند و نه بر اساس ملاحظات ایمنی، ممکن است برای رسیدن به هدف خود به رفتارهای پرخطر روی بیاورند.
استیون آدلر، همبنیانگذار سازمان غیرانتفاعی Guidelight AI Standards و پژوهشگر سابق ایمنی در OpenAI، گفت:
«مدلهای هوش مصنوعی طوری آموزش میبینند که اهداف را بیوقفه دنبال کنند. آنها بهطور خودکار ارزشهایی مانند "مرتکب جرم نشو" را یاد نمیگیرند. خوشحالم که OpenAI این حادثه را منتشر کرد، زیرا این اتفاق شواهد روشنی از رفتار مدلهایی است که با اهداف انسانی همسو نیستند.»

تعداد نفوذهای موفق مدلهای پیشرفته هوش مصنوعی در یک آزمون استاندارد صنعتیِ ارزیابی تواناییهای سایبری
OpenAI اعلام کرد:
«ما به همراه Hugging Face تحقیقات کاملی را ادامه خواهیم داد و پس از تکمیل بررسیها، جزئیات بیشتری درباره آسیبپذیریها، این حادثه و یافتههای خود منتشر خواهیم کرد.»
این حمله نگرانیهای عمیقی را در صنعت هوش مصنوعی و حتی در داخل OpenAI ایجاد کرده است؛ زیرا برای نخستینبار یک سیستم هوش مصنوعی برخلاف خواست کاربران، موفق شده از سد دفاعهای سایبری عبور کند.
به گفته چندین منبع مطلع، برخی از کارکنان OpenAI نیز نگراناند که این حادثه نشاندهنده از دست رفتن کنترل این شرکت بر سامانههای بسیار قدرتمندی باشد که در حال توسعه آنهاست.
رایان گرینبلت، دانشمند ارشد مؤسسه ایمنی هوش مصنوعی Redwood Research، گفت:
«این اتفاق نمونه نسبتاً روشنی از ناهماهنگی مدل با نیت کاربر است. در حال حاضر بیشتر شبیه این است که مدل برای انجام تکلیفش تقلب کرده، نه اینکه بخواهد دنیا را تسخیر کند. اما این مشکل میتواند تشدید شود و به شکستهای بسیار جدیتری منجر شود.»
این حادثه هنگام آزمایش داخلی مدل رخ داد؛ مدلی که هنوز برای مشتریان منتشر نشده بود. یکی از منابع گفت که چنین آزمایشهایی معمول بوده، اما نسبت به مراحل قبل از عرضه عمومی، منابع کمتری به آن اختصاص داده میشد. همچنین چندین نفر تأیید کردند که مدل آزمایشی دیگری که همزمان با Sol در حال بررسی بود، همچنان از چرخه آزمایش داخلی خارج نشده است.
برای انجام این ارزیابیها، OpenAI برخی از محدودیتهای امنیت سایبری را حذف کرده بود، اما مدلها را در محیطی ایزوله موسوم به Sandbox قرار داده بود. برخی کارشناسان معتقدند که کمبود نظارت کافی بر رفتار مدل نیز باعث شد این عامل هوش مصنوعی بتواند خارج از انتظار عمل کند.
ماریوس هوبهان، رئیس مؤسسه Apollo Research که مدلهای پیشرفته از جمله مدلهای OpenAI را آزمایش میکند، گفت:
«این هم از دست رفتن کنترل است و هم یک زنگ خطر امنیتی. در یادگیری تقویتی، شما مدل را فقط برای رسیدن به نتیجه پاداش میدهید. اگر این روند مدت زیادی ادامه یابد، مدلی خواهید داشت که تنها به رسیدن به نتیجه اهمیت میدهد و هیچ چیز دیگری برایش مهم نیست.»
OpenAI سالهاست چنین آزمایشهایی را انجام میدهد و مدلهای قبلی نیز نشانههایی از رفتارهای مخرب و تلاش برای فرار از محیطهای محدود را نشان داده بودند.
در ماه آوریل، مدل Mythos متعلق به Anthropic نیز توانست به اینترنت دسترسی پیدا کند و اطلاعات مربوط به یک آسیبپذیری امنیتی را بهصورت عمومی منتشر کند؛ اقدامی که فراتر از انتظار پژوهشگران بود.
رفتار مدلهای Mythos و سپس Fable باعث شد جامعه امنیت سایبری و دولتهای مختلف بیش از پیش بر این باور تمرکز کنند که حملات آینده به زیرساختهای دیجیتال و حیاتی، بهطور فزاینده توسط سامانههای هوش مصنوعی و بهشکل خودکار انجام خواهد شد.
جیک مور، مشاور جهانی امنیت سایبری شرکت ESET، گفت OpenAI احتمالاً از این رخداد بهعنوان ابزاری تبلیغاتی نیز استفاده خواهد کرد؛ زیرا Anthropic نیز اوایل امسال از نگرانیهای مشابه سود برده بود.
او افزود:
«فکر میکنم OpenAI داستان مشابهی برای نمایش نداشت و شاید منتظر رخ دادن اتفاقی از این دست بود.»
پس از این حادثه، بسیاری از متخصصان ایمنی هوش مصنوعی و امنیت سایبری خواستار تدوین مقررات و استانداردهای جدید برای جلوگیری از تکرار چنین رخدادهایی شدهاند. انتظار میرود سم آلتمن هفته آینده درباره نسل بعدی سامانههای هوش مصنوعی، مقامات کاخ سفید را در جریان بگذارد.
با حرکت سامانههای هوش مصنوعی به سمت خودمختاری بیشتر، رفتارهای نامطلوبی مانند هک کردن یا نادیده گرفتن دستورها نیز ممکن است بیشتر ظاهر شوند.
هوبهان گفت:
«برای اینکه عاملهای هوش مصنوعی واقعاً کارآمد باشند، باید بتوانند برای مدت طولانی بدون نظارت کار کنند. آنها ناگزیر باید اختیار عمل بیشتری داشته باشند؛ راه دیگری وجود ندارد.»
او در پایان هشدار داد:
«بعضیها میگویند هوش مصنوعی فقط یک ابزار است؛ دقیقاً همان کاری را انجام میدهد که شما میخواهید و هیچ چیز بیشتر. اما مردم باید خود را برای این احتمال آماده کنند که عاملهای هوش مصنوعی اهداف مخصوص به خود را داشته باشند، روزها بهطور مستقل عمل کنند و این اهداف لزوماً با اهداف شما همسو نباشد.»