1

گوگل تنها سه هفته پس از معرفی Gemini 3.7 Flash و در حالی که این سومین مدل Flash این شرکت طی شش هفته اخیر محسوب می‌شود، Gemini 3.8 را معرفی کرد. گوگل می‌گوید Gemini 3.8 قدرتمندترین مدل این شرکت برای استدلال و کدنویسی است و در عین حال، همان سرعت و هزینه پایین نسل قبلی را حفظ می‌کند. این خانواده در دو نسخه عرضه شده است:

  • Gemini 3.8 Flash: مدل کاری قدرتمند و همه‌کاره گوگل که در مقایسه با 3.7 Flash، در مهندسی نرم‌افزار، وظایف عامل‌محور و استدلال‌های پیچیده و چندمرحله‌ای در حوزه‌های تخصصی عملکرد بهتری دارد. این مدل با همان قیمت اولیه 1 نسل قبل عرضه می‌شود و هزینه آن 0.75 دلار به‌ازای هر یک میلیون توکن ورودی و 3.75 دلار به‌ازای هر یک میلیون توکن خروجی است.
  • Gemini 3.8 Flash Cyber: قدرتمندترین مدل گوگل برای امنیت سایبری که در شناسایی آسیب‌پذیری‌ها و وصله‌کردن خودکار آنها به عملکردی در سطح مدل‌های پیشرو رسیده است. این مدل از طریق برنامه جدید Fairwind در اختیار مدافعان مورداعتماد قرار می‌گیرد.

اگرچه این دو مدل برای محیط‌های مختلف طراحی شده‌اند، هر دو از یک هسته هوش مصنوعی مشترک بهره می‌برند. گوگل همچنین با استفاده از حلقه‌های عامل‌محور طولانی‌مدت، این مدل‌ها را قادر ساخته است تا نتایج خود را به‌صورت تکراری ارزیابی و اصلاح کنند. بخش قابل‌توجهی از پیشرفت Gemini 3.8 در زمینه کدنویسی و استدلال نیز حاصل همین هسته مشترک است؛ هسته‌ای که با آموزش‌های سخت‌گیرانه در حوزه پیچیده امنیت سایبری تقویت شده است.

Gemini 3.8 Flash؛ برای کدنویسی طولانی‌مدت و عامل‌های خودکار

Gemini 3.8 Flash در مقایسه با Gemini 3.7 Flash پیشرفت قابل‌توجهی داشته و در بسیاری از آزمون‌ها به عملکرد مدل‌های پیشروی گران‌تر نزدیک شده است. در بنچمارک DeepSWE v1.1 که برای ارزیابی مهندسی نرم‌افزار طولانی‌مدت طراحی شده، Gemini 3.8 Flash توانسته است در حل خودکار مسائل پیچیده مهندسی از ابتدا تا انتها، عملکرد بهتری از بیشتر مدل‌های پیشروی بزرگ‌تر داشته باشد؛ آن هم با هزینه‌ای بسیار کمتر.

Gemini 3.8 Flash همچنین در حوزه‌های تخصصی، قابلیت اطمینان لازم برای اجرای خودکار وظایف حساس سازمانی را ارائه می‌دهد. در حوزه‌های کمی و تخصصی که به تحلیل و گزارش‌دهی پیشرفته نیاز دارند، این مدل در بنچمارک‌هایی مانند Vals Finance Agent V2 و Harvey’s Legal Agent Benchmark از 3.7 Flash و برخی دیگر از مدل‌های پیشرو بهتر عمل کرده است. این مدل در بنچمارک HLE-Verified نیز به امتیاز 54.9 درصد رسیده است؛ نتیجه‌ای که توانایی آن در انجام استدلال‌های چندمرحله‌ای در حوزه‌های STEM، علوم انسانی و زمینه‌های تخصصی را نشان می‌دهد.

دلیل بخشی از این پیشرفت، رویکرد متفاوت Gemini 3.8 Flash در انجام وظایف پیچیده است. این مدل برای رسیدن به نتیجه بهتر، مراحل استدلال بیشتری انجام می‌دهد و ابزارها را به‌صورت تکراری فراخوانی می‌کند. در سطوح بالاتر تلاش، ممکن است مدل برای بهبود عملکرد از توکن‌های بیشتری استفاده کند. البته در برنامه‌هایی که کاهش هزینه محاسباتی اولویت اصلی است، توسعه‌دهندگان می‌توانند سطح تلاش مدل را پایین بیاورند تا مصرف توکن کاهش پیدا کند. استفاده از Gemini 3.7 Flash نیز همچنان برای وظایفی که بهره‌وری در آنها اولویت دارد، ادامه خواهد داشت.

Gemini 3.8 Flash Cyber؛ مدل تخصصی گوگل برای امنیت سایبری

Gemini 3.8 Flash Cyber از طریق برنامه Fairwind در اختیار گروهی از مدافعان مورداعتماد قرار می‌گیرد. این مدل با ترکیب سرعت بالای مدل‌های Flash و هزینه پایین آنها، امکان انجام سریع‌تر فرایندهای امنیتی و تکرار آزمایش‌ها را فراهم می‌کند.

کشف خودکار آسیب‌پذیری‌ها

در CyberGym، یکی از بنچمارک‌های استاندارد صنعت برای شناسایی آسیب‌پذیری‌ها، Gemini 3.8 Flash Cyber عملکردی در سطح مدل‌های پیشرو نشان داده است. این مدل هم از 3.5 Flash Cyber و هم از مدل‌های پیشروی بسیار بزرگ‌تر عملکرد بهتری داشته است. از آنجا که نیازهای امنیتی دنیای واقعی به کدهای C/C++ محدود نمی‌شوند، گوگل آزمایش دیگری را نیز با یک بنچمارک داخلی جامع انجام داده است. در این آزمون، مدل باید طیف گسترده‌ای از آسیب‌پذیری‌ها را در کدبیس‌های پیچیده‌ای که 20 زبان برنامه‌نویسی را شامل می‌شوند، شناسایی کند. Gemini 3.8 Flash Cyber در این آزمایش نیز پیشرفت قابل‌توجهی نسبت به مدل‌های قبلی گوگل نشان داده و به نرخ موفقیت بیش از 70درصد رسیده است.

وصله‌کردن خودکار آسیب‌پذیری‌ها

گوگل می‌گوید در توسعه Gemini 3.8 Flash Cyber، تمرکز اصلی را بر ارائه قابلیت‌های تخصصی به مدافعان سایبری گذاشته است تا بتوانند در برابر مهاجمان دست بالا را داشته باشند. به همین دلیل، این شرکت از ابتدا رفع آسیب‌پذیری‌ها را در اولویت قرار داده و آن را بر قابلیت‌های تهاجمی مانند بهره‌برداری از آسیب‌پذیری‌ها ترجیح داده است. در بنچمارک خارجی CWE-Bench که توسط Collinear اجرا می‌شود، Gemini 3.8 Flash Cyber در محدوده مرزی عملکرد و هزینه قرار گرفته است. این مدل به امتیاز Pass@1 معادل 47.2 درصد رسیده، در حالی که یک مدل پیشروی رقیب امتیاز 47.8 درصد کسب کرده است. بااین‌حال، هزینه استفاده از مدل گوگل به‌مراتب کمتر است.

استفاده از Gemini 3.8 Flash Cyber برای ایمن‌سازی کدهای گوگل

گوگل می‌گوید همین حالا از Gemini 3.8 Flash Cyber برای افزایش امنیت کدهای خود استفاده می‌کند. برای نمونه:

  • تیم امنیتی کروم دریافت که Gemini 3.8 Flash Cyber در مقایسه با بزرگ‌ترین مدل‌های تجاری، 2.6 برابر وصله صحیح بیشتری برای آسیب‌پذیری‌های کروم تولید کرده است.
  • شرکت Wiz اعلام کرده که Gemini 3.8 Flash Cyber در بنچمارک داخلی تست نفوذ این شرکت، 7.5 تا 9.7 درصد Recall بیشتری ارائه می‌دهد، در حالی که هزینه آن 2.3 تا 5.2 برابر کمتر از دیگر مدل‌های پیشرو است.
  • تیم Cloud Vulnerability Research گوگل با استفاده از Gemini 3.8 Flash Cyber توانست یک آسیب‌پذیری حیاتی در زیرساخت‌های پایه را در کمتر از 2 ساعت شناسایی کند؛ در حالی که تحقیق و کشف چنین آسیب‌پذیری‌هایی معمولاً ماه‌ها زمان می‌برد.

Gemini 3.8 با تمرکز بر ایمنی توسعه یافته است

Gemini 3.8 Flash با سازوکارهای حفاظتی در برابر سوءاستفاده در حوزه‌های شیمیایی، زیستی، پرتوزا و هسته‌ای (CBRN) و همچنین حملات سایبری تهاجمی عرضه شده است. این مدل در عین حال، مطابق با Frontier Safety Framework گوگل، امکان استفاده در کاربردهای مفید را حفظ می‌کند. Gemini 3.8 Flash Cyber محدودیت‌های حفاظتی سهل‌گیرانه‌تری برای کاربردهای امنیت سایبری دارد و به همین دلیل، تنها در اختیار مدافعان مورداعتماد قرار می‌گیرد که به مجموعه گسترده‌تری از قابلیت‌های امنیت سایبری نیاز دارند. مدل‌های Gemini 3.8 همچنین در زمینه مقاومت در برابر تزریق پرامپت پیشرفت چشمگیری داشته‌اند. طبق ارزیابی‌های Gray Swan، این مدل‌ها مقاومت بیشتری در برابر حملات مخربی دارند که از طریق تزریق پرامپت انجام می‌شوند و می‌توانند از کاربران Gemini در برابر چنین حملاتی محافظت کنند.