شهرآرانیوز؛ گوگل میگوید Gemini ۴ Argon برای حفظ استدلال عمیق در جریانهای کاری چندمرحلهای ساخته شده است؛ به همین دلیل برخلاف بسیاری از کاربردهای رایج چتباتها، هدف اصلی آن انجام پروژههایی است که ممکن است به بررسی حجم زیادی از اطلاعات و اجرای چندین مرحله پشت سر هم نیاز داشته باشند.
Gemini ۴ Argon نخستین مدل معرفیشده در نسل چهارم Gemini است و گوگل آن را یک مدل Frontier برای انجام وظایف پیچیده معرفی میکند. این مدل علاوه بر تواناییهای استدلالی، درک چندوجهی، برنامهنویسی و انجام وظایف طولانی را هدف گرفته است.
گوگل میگوید Argon در حال حاضر در برخی فرایندهای داخلی این شرکت نیز استفاده میشود و هزاران کارمند گوگل از آن برای کارهایی مانند اشکالزدایی، پژوهش و مهاجرت کدها استفاده کردهاند.
یکی از نمونههای اعلامشده توسط گوگل، استفاده از Argon برای مهاجرت کدهای C و C++ به Rust در پروژههای مختلف این شرکت است؛ این فرایند حتی در پروژههایی با صدها هزار خط کد دنبال شده است.
یکی از مهمترین ویژگیهای Gemini ۴ Argon افزایش چشمگیر سقف خروجی مدل است. گوگل سقف خروجی این مدل را از ۶۴ هزار توکن به یک میلیون توکن افزایش داده است. به گفته شرکت، این ظرفیت به Argon اجازه میدهد در یک فرایند واحد، حجم بسیار زیادی از اطلاعات و استدلال را پردازش و تولید کند و وظایف طولانیمدت را در یک مسیر واحد دنبال کند.
این قابلیت برای کارهایی مانند بررسی کدهای بسیار بزرگ، تحلیل اسناد طولانی، پژوهشهای چندمرحلهای و کار با مجموعههای بزرگ اطلاعاتی اهمیت ویژهای دارد.
در واقع، تفاوت Argon صرفاً در پاسخدادن به یک سؤال پیچیده نیست؛ هدف گوگل این است که مدل بتواند یک پروژه طولانی را از ابتدا تا انتها دنبال کند.
برنامهنویسی یکی از مهمترین حوزههایی است که گوگل برای Gemini ۴ Argon در نظر گرفته است. این مدل میتواند در کارهایی مانند اشکالزدایی نرمافزار، تحلیل کدهای بزرگ، مهاجرت کدها بین زبانهای برنامهنویسی، طراحی الگوریتم، انجام وظایف چندمرحلهای مهندسی نرمافزار، بررسی و بهینهسازی کد به کار گرفته شود.
گوگل اعلام کرده است که Argon در آزمون DeepSWE v۱.۱ به امتیاز ۷۷.۹ درصد رسیده و در این بنچمارک، عملکردی در سطح بالای مدلهای مورد مقایسه داشته است. همچنین در Vibe Code Bench امتیاز ۹۱.۹ درصد و در FrontierSWE v۲ امتیاز ۵۵ درصد ثبت کرده است.

البته نتایج بنچمارکها باید با توجه به روش اجرای هر آزمون و روش ارزیابی مدلها تفسیر شوند و بهتنهایی نشاندهنده عملکرد یک مدل در تمام کاربردهای واقعی نیستند.
گوگل Argon را فقط برای برنامهنویسی توسعه نداده است. این مدل برای Enterprise Knowledge Work یا همان کارهای دانشی سازمانی نیز طراحی شده و میتواند در حوزههایی مانند امور مالی، حقوقی و پژوهش مورد استفاده قرار گیرد.
در Vals Index که عملکرد مدلها را در کارهای دانشی حوزههایی مانند مالی، برنامهنویسی، حقوق و مالیات بررسی میکند، گوگل برای Gemini ۴ Argon امتیاز ۶۸.۹ درصد را اعلام کرده است.
همچنین این مدل در Vals Finance Agent v۲ امتیاز ۶۵.۴ درصد و در Harvey's Legal Agent Benchmark امتیاز ۱۹.۶ درصد کسب کرده است. این ارقام طبق دادههای منتشرشده توسط Google DeepMind هستند.
یکی دیگر از قابلیتهای مهم Argon، توانایی کار با اطلاعات چندوجهی است. گوگل میگوید این مدل میتواند نمودارهای حرفهای را تحلیل کند، اطلاعات موجود در ویدئوهای طولانی را استخراج کند و بر اساس مجموعهای از اسناد، اقدامات بعدی را انجام دهد.
در بنچمارک LVBench که برای سنجش درک ویدئوهای طولانی استفاده میشود، Google DeepMind امتیاز ۹۱.۷ درصد را برای Gemini ۴ Argon اعلام کرده است.
این قابلیت میتواند برای تحلیل اسناد تصویری، گزارشهای ویدئویی، دادههای بصری و فرایندهای سازمانی چندمرحلهای کاربرد داشته باشد.
شاید مهمترین تفاوت Argon با یک مدل هوش مصنوعی معمولی، تمرکز ویژه آن بر دفاع سایبری باشد. گوگل میگوید این مدل میتواند بهصورت خودکار آسیبپذیریهای نرمافزاری را پیدا کند، آنها را اعتبارسنجی کند و برای برطرفکردنشان اقدام کند.
در یکی از آزمایشهای اعلامشده توسط گوگل، Argon توانسته است یک آسیبپذیری مهم را در نرمافزارهای حوزه سلامت شناسایی کند که به اطلاعات حساس شخصی مربوط بوده است. این آزمایش با همکاری شرکت Wiz انجام شده است.

در CWE-bench v۱ نیز Google DeepMind امتیاز ۶۸ درصد را برای Argon اعلام کرده است؛ این مدل در این آزمون در رتبه نخست بهصورت مشترک قرار گرفته است.
به همین دلیل، نخستین گروهی که به Gemini ۴ Argon دسترسی پیدا میکنند، کاربران عادی نیستند؛ بلکه گروهی از متخصصان و سازمانهای مورد اعتماد حوزه امنیت سایبری هستند.
قدرت بالای Argon در حوزه امنیت سایبری در عین حال یک مسئله امنیتی ایجاد میکند. مدلی که میتواند آسیبپذیریهای نرمافزاری را پیدا و اصلاح کند، در صورت سوءاستفاده میتواند برای حملات سایبری نیز مورد استفاده قرار گیرد. به همین دلیل گوگل تصمیم گرفته است عرضه Argon را مرحلهای انجام دهد.
در مرحله نخست، Gemini ۴ Argon از طریق برنامه Fairwind در اختیار گروهی از مدافعان و متخصصان مورد اعتماد امنیت سایبری قرار میگیرد. گوگل همچنین اعلام کرده است که در فرایند پیش از عرضه مدل با دولت آمریکا همکاری میکند تا عملکرد و تدابیر حفاظتی آن ارزیابی شود.
گوگل برای Argon چند لایه حفاظتی در نظر گرفته است. یکی از مهمترین موارد، مقابله با Prompt Injection یا تزریق دستورهای مخرب است؛ حملهای که در آن محتوای آلوده تلاش میکند رفتار مدل را تغییر دهد یا آن را از هدف اصلی منحرف کند.

Google DeepMind میگوید Argon در برابر حملات موسوم به Indirect Prompt Injection مقاومترین مدل این شرکت تاکنون است.
گوگل همچنین سیستمی برای پایش رفتار و فرایندهای مدل در نظر گرفته که در صورت مشاهده نشانههایی از خروج مدل از محدوده مورد انتظار، میتواند اجرای آن را متوقف کند. محیطهای آزمایش نیز برای کاهش خطر، ایزوله و ایمنسازی شدهاند.
گوگل برای آغاز عرضه، قیمت ۲ دلار به ازای هر یک میلیون توکن ورودی و ۱۰ دلار به ازای هر یک میلیون توکن خروجی تعیین کرده است. توکنهای ورودی ذخیرهشده یا Cached نیز با ۹۵ درصد تخفیف نسبت به قیمت ورودی محاسبه میشوند.
پس از پایان دوره قیمتگذاری اولیه، قیمت به ۴ دلار برای هر یک میلیون توکن ورودی و ۲۰ دلار برای هر یک میلیون توکن خروجی افزایش خواهد یافت.
البته این قیمتها به معنی دسترسی عمومی فعلی به مدل نیستند؛ گوگل ابتدا مدل را در اختیار کاربران و سازمانهای منتخب قرار میدهد.
در حال حاضر تاریخ دقیق عرضه عمومی Gemini ۴ Argon اعلام نشده است.
گوگل میگوید پس از دریافت بازخورد از کاربران اولیه و تقویت تدابیر امنیتی، دسترسی را گسترش خواهد داد. این شرکت اعلام کرده است که عرضه عمومی از مشتریان پولی API و مشترکان Google AI Ultra آغاز خواهد شد و سپس دامنه دسترسی گستردهتر میشود؛ بنابراین در زمان انتشار این گزارش، Gemini ۴ Argon هنوز یک مدل عمومی در دسترس همه کاربران Gemini نیست.
Google DeepMind در صفحه رسمی مدل، عملکرد Argon را با مدلهایی از OpenAI و Anthropic مقایسه کرده است. در برخی آزمونها Argon امتیاز بالاتری دارد و در برخی دیگر مدلهای رقیب امتیاز بیشتری ثبت کردهاند.
برای مثال، طبق ارقام منتشرشده توسط گوگل، Argon در Vals Index امتیاز ۶۸.۹ درصد، در AutomationBench امتیاز ۵۱.۳ درصد و در DeepSWE v۱.۱ امتیاز ۷۷.۹ درصد گرفته است. در مقابل، در آزمونهایی مانند FrontierSWE v۲ و Terminal-Bench ۴.۰ برخی مدلهای رقیب امتیاز بالاتری داشتهاند.
این موضوع نشان میدهد که مقایسه مدلهای هوش مصنوعی را نمیتوان صرفاً با یک عدد یا یک بنچمارک انجام داد؛ نوع وظیفه، روش ارزیابی و کاربرد واقعی مدل اهمیت زیادی دارد.
تمرکز اصلی Argon بر پاسخهای کوتاه و مکالمات روزمره نیست. این مدل برای وظایف طولانی، پیچیده و چندمرحلهای ساخته شده است؛ وظایفی که ممکن است شامل تحلیل حجم زیادی از داده، برنامهریزی، اجرای چند مرحله و بررسی نتیجه هر مرحله باشند.
به همین دلیل، حوزههایی مانند مهندسی نرمافزار، پژوهش، تحلیل مالی، امور حقوقی و امنیت سایبری از مهمترین کاربردهای موردنظر گوگل برای آن هستند.
افزایش سقف خروجی به یک میلیون توکن نیز دقیقاً در همین راستا قرار دارد: Argon قرار است بتواند مسیر طولانیتری را در یک فرایند واحد دنبال کند.