شهرآرانیوز، بحث درباره خطرات امنیتی هوش مصنوعی پس از چند رخداد غیرمنتظره در آزمایش مدلهای پیشرفته OpenAI و Anthropic شدت گرفته است. در حالی که مدیران این شرکتها این اتفاقات را نشانهای از ضرورت افزایش نظارت و ایجاد چارچوبهای ایمنی قویتر میدانند، گروهی از کارشناسان صنعت معتقدند آنچه رخ داده بیش از آنکه نشانه «طغیان هوش مصنوعی» باشد، نتیجه ضعف در طراحی محیطهای آزمایشی و محدودیتهای امنیتی بوده است.
«آخیل ورگیز»، بنیانگذار شرکت نرمافزاری Krazimo، معتقد است مدلهای درگیر در این حوادث برخلاف برخی روایتها از کنترل خارج نشده بودند، بلکه برای دستیابی به هدفی که برای آنها تعیین شده بود، از امکاناتی استفاده کردند که محیط آزمایشی در اختیارشان قرار داده بود.
به گفته او، اگر یک مدل مأمور شود بهترین نتیجه ممکن را در یک آزمون کسب کند، اما محدودیتهای کافی برای نحوه دستیابی به پاسخها وجود نداشته باشد، تلاش آن برای پیدا کردن راههای جایگزین لزوماً به معنای رفتار خودسرانه یا شورش علیه انسان نیست.
یکی از مهمترین مواردی که بحث درباره امنیت مدلهای هوش مصنوعی را تشدید کرد، به پلتفرم متنباز Hugging Face مربوط میشود؛ سایتی که به یکی از مراکز مهم میزبانی و اشتراکگذاری مدلها و ابزارهای هوش مصنوعی تبدیل شده است.
هاگینگ فیس در ۱۶ ژوئیه اعلام کرد عاملهای هوش مصنوعی توانستهاند بدون دخالت مستقیم انسان، برخی آسیبپذیریهای موجود در این پلتفرم را شناسایی و از آنها سوءاستفاده کنند.
OpenAI چند روز بعد جزئیات بیشتری از این حادثه منتشر کرد. براساس گزارش این شرکت، یک مدل پژوهشی داخلی با مقیاسی قابل مقایسه با GPT-۵.۶ Sol در جریان ارزیابیهای امنیت سایبری توانسته بود برخی محدودیتهای محیط آزمایشی را دور بزند و به بخشهایی از سامانههای هاگینگ فیس دسترسی پیدا کند. عاملهای مبتنی بر GPT-۵.۶ Sol نیز در ادامه توانستند بخشی از این مسیر سوءاستفاده را بازتولید کرده و به مقداری از دادههای خصوصی مربوط به ارزیابی دسترسی پیدا کنند.
این اتفاق در برخی روایتها بهعنوان «فرار مدل از سندباکس» توصیف شد؛ اما منتقدان چنین تعبیری را گمراهکننده میدانند.
«ابهی کومار»، همبنیانگذار Voice AI، میگوید وجود مسیر فعال برای دسترسی به اینترنت نشان میدهد محیط آزمایشی از ابتدا کاملاً ایزوله نبوده است. به اعتقاد او، مدل با مسئلهای روبهرو شده بود که امکان حل آن از مسیر عادی وجود نداشت و در نتیجه برای دستیابی به اطلاعات مورد نیاز به دنبال راه دیگری رفته است.
از این منظر، ماجرا نه نشانه «بیدار شدن» یا تصمیم مستقل هوش مصنوعی، بلکه نمونهای از اهمیت طراحی محدودیتهای دقیق برای عاملهای هوشمندی است که امکان استفاده از ابزارها، اجرای کد و دسترسی به شبکه را دارند.
مدتی بعد، Anthropic نیز از وقوع رفتارهای نگرانکننده در جریان ارزیابی امنیتی برخی مدلهای خود خبر داد.
براساس گزارش این شرکت، مدل Claude Opus ۴.۷ در جریان یک سناریوی آزمایشی با یک شرکت واقعی در اینترنت روبهرو شد که شباهت زیادی به شرکت فرضی تعریفشده در آزمون داشت. مدل با این تصور که دسترسی به این سامانه نیز بخشی از محدوده مجاز تمرین است، اقدامات تهاجمی خود را علیه آن ادامه داد.
در نمونهای دیگر، مدل Claude Mythos ۵ یک بسته نرمافزاری مخرب ایجاد و آن را در مخزن عمومی Python Package Index منتشر کرد. براساس گزارش Anthropic، این بسته پیش از شناسایی روی ۱۵ سامانه نصب شد.
این رخدادها اگرچه نگرانیهای جدی درباره نحوه محدودسازی دسترسی مدلهای عاملمحور ایجاد کردهاند، اما برخی متخصصان تأکید دارند میان «ضعف در کنترل یک مدل» و «سرکش شدن مستقل هوش مصنوعی» تفاوت مهمی وجود دارد.
در مقابل، مدیران شرکتهای پیشرو در حوزه هوش مصنوعی معتقدند همین اتفاقات نشان میدهند که خطرات آینده را نمیتوان نادیده گرفت.
«داریو آمودی»، مدیرعامل Anthropic، ماجرای هاگینگ فیس را یکی از مهمترین نگرانیهای خود درباره روند توسعه هوش مصنوعی دانسته است. او هشدار داده با افزایش سریع توانایی مدلها، ممکن است طی ۶ تا ۱۲ ماه آینده عاملهای هوش مصنوعی قادر به اجرای حملات سایبری بسیار گستردهتری شوند.
آمودی در بیان یکی از سناریوهای نگرانکننده احتمالی گفته است مجموعهای از عاملهای هوشمند در آینده ممکن است قادر به ایجاد یک باتنت پایدار و اجرای حملات گسترده اینترنتی شوند؛ سناریویی که به گفته او میتواند خسارتهای اقتصادی بسیار سنگینی به همراه داشته باشد.
این دیدگاه با مخالفت برخی فعالان صنعت مواجه شده است. آنها معتقدند چنین سناریوهایی نباید با رخدادهای آزمایشی اخیر یکسان تلقی شوند و لازم است میان خطرات بالقوه آینده و آنچه عملاً در آزمایشهای فعلی اتفاق افتاده، تفکیک صورت گیرد.
حوادث اخیر تنها به بحثهای فنی محدود نمانده و واکنش سیاستمداران آمریکایی را نیز به دنبال داشته است.
سناتور «جاش هاولی» تحقیقاتی درباره عملکرد OpenAI و جزئیات حادثه هاگینگ فیس آغاز کرده و از این شرکت خواسته است اسناد داخلی مرتبط با این پرونده را در اختیار قانونگذاران قرار دهد.
«برنی سندرز» نیز از ارائه طرحی برای ممنوعیت توسعه هوش فوقهوشمند و توقف موقت توسعه برخی سامانههای پیشرفته هوش مصنوعی تا زمان تدوین مقررات ایمنی خبر داده است. او ادامه توسعه این فناوریها بدون مشخص شدن سازوکارهای نظارتی و حفاظتی را مخاطرهآمیز میداند.
«الیزابت وارن» نیز خواستار توقف توسعه مدلهای پیشرفته تا زمان ایجاد چارچوبهای قانونی و حفاظتی قویتر شده است.
همزمان، OpenAI نیز از ایجاد مقررات ملی و الزامآور متناسب با سطح توانایی مدلهای پیشرفته حمایت کرده است. Anthropic نیز بارها بر ضرورت ایجاد سازوکارهای نظارتی برای آزمایشگاههای فعال در مرز توسعه هوش مصنوعی تأکید کرده است.
اما منتقدان موضوع را از زاویه دیگری بررسی میکنند. به باور برخی فعالان فناوری که با نیویورکپست گفتوگو کردهاند، شرکتهای بزرگ هوش مصنوعی ممکن است از برجستهشدن نگرانیهای امنیتی برای تقویت جایگاه خود در مذاکرات مربوط به قانونگذاری استفاده کنند.
استدلال آنها این است که رعایت مقررات بسیار پیچیده و پرهزینه برای شرکتهایی مانند OpenAI و Anthropic امکانپذیرتر است، در حالی که استارتاپها و شرکتهای کوچکتر ممکن است توان مالی و فنی لازم برای تطبیق با چنین الزاماتی را نداشته باشند.
به همین دلیل، این گروه هشدار میدهد مقرراتی که با هدف افزایش ایمنی هوش مصنوعی تدوین میشوند، در صورت طراحی نامناسب میتوانند به افزایش موانع ورود به بازار و تثبیت موقعیت بازیگران بزرگ منجر شوند.
با این حال، حتی منتقدان روایت «هوش مصنوعی سرکش» نیز اصل وجود چالشهای امنیتی را رد نمیکنند. رخدادهای OpenAI، Anthropic و هاگینگ فیس نشان دادهاند مدلهای عاملمحور، بهویژه زمانی که به اینترنت، اجرای کد و ابزارهای خارجی دسترسی دارند، به سازوکارهای حفاظتی و محیطهای آزمایشی دقیقتری نیاز دارند.
اختلاف اصلی اکنون بر سر تفسیر این اتفاقات است: آیا این حوادث نشانهای از افزایش خطر خروج مدلهای پیشرفته از محدوده مورد انتظار هستند یا بیش از هر چیز، ضعف در طراحی محیطهای آزمایشی و کنترل دسترسی آنها را آشکار کردهاند؟ پاسخ به این پرسش میتواند بر نحوه تنظیم مقررات و مسیر رقابت در صنعت هوش مصنوعی تأثیر قابلتوجهی بگذارد.