گوگل تنها سه هفته پس از معرفی Gemini 3.7 Flash و در حالی که این سومین مدل Flash این شرکت طی شش هفته اخیر محسوب میشود، Gemini 3.8 را معرفی کرد. گوگل میگوید Gemini 3.8 قدرتمندترین مدل این شرکت برای استدلال و کدنویسی است و در عین حال، همان سرعت و هزینه پایین نسل قبلی را حفظ میکند. این خانواده در دو نسخه عرضه شده است:
- Gemini 3.8 Flash: مدل کاری قدرتمند و همهکاره گوگل که در مقایسه با 3.7 Flash، در مهندسی نرمافزار، وظایف عاملمحور و استدلالهای پیچیده و چندمرحلهای در حوزههای تخصصی عملکرد بهتری دارد. این مدل با همان قیمت اولیه 1 نسل قبل عرضه میشود و هزینه آن 0.75 دلار بهازای هر یک میلیون توکن ورودی و 3.75 دلار بهازای هر یک میلیون توکن خروجی است.
- Gemini 3.8 Flash Cyber: قدرتمندترین مدل گوگل برای امنیت سایبری که در شناسایی آسیبپذیریها و وصلهکردن خودکار آنها به عملکردی در سطح مدلهای پیشرو رسیده است. این مدل از طریق برنامه جدید Fairwind در اختیار مدافعان مورداعتماد قرار میگیرد.
اگرچه این دو مدل برای محیطهای مختلف طراحی شدهاند، هر دو از یک هسته هوش مصنوعی مشترک بهره میبرند. گوگل همچنین با استفاده از حلقههای عاملمحور طولانیمدت، این مدلها را قادر ساخته است تا نتایج خود را بهصورت تکراری ارزیابی و اصلاح کنند. بخش قابلتوجهی از پیشرفت Gemini 3.8 در زمینه کدنویسی و استدلال نیز حاصل همین هسته مشترک است؛ هستهای که با آموزشهای سختگیرانه در حوزه پیچیده امنیت سایبری تقویت شده است.
Gemini 3.8 Flash؛ برای کدنویسی طولانیمدت و عاملهای خودکار
Gemini 3.8 Flash در مقایسه با Gemini 3.7 Flash پیشرفت قابلتوجهی داشته و در بسیاری از آزمونها به عملکرد مدلهای پیشروی گرانتر نزدیک شده است. در بنچمارک DeepSWE v1.1 که برای ارزیابی مهندسی نرمافزار طولانیمدت طراحی شده، Gemini 3.8 Flash توانسته است در حل خودکار مسائل پیچیده مهندسی از ابتدا تا انتها، عملکرد بهتری از بیشتر مدلهای پیشروی بزرگتر داشته باشد؛ آن هم با هزینهای بسیار کمتر.

Gemini 3.8 Flash همچنین در حوزههای تخصصی، قابلیت اطمینان لازم برای اجرای خودکار وظایف حساس سازمانی را ارائه میدهد. در حوزههای کمی و تخصصی که به تحلیل و گزارشدهی پیشرفته نیاز دارند، این مدل در بنچمارکهایی مانند Vals Finance Agent V2 و Harvey’s Legal Agent Benchmark از 3.7 Flash و برخی دیگر از مدلهای پیشرو بهتر عمل کرده است. این مدل در بنچمارک HLE-Verified نیز به امتیاز 54.9 درصد رسیده است؛ نتیجهای که توانایی آن در انجام استدلالهای چندمرحلهای در حوزههای STEM، علوم انسانی و زمینههای تخصصی را نشان میدهد.
دلیل بخشی از این پیشرفت، رویکرد متفاوت Gemini 3.8 Flash در انجام وظایف پیچیده است. این مدل برای رسیدن به نتیجه بهتر، مراحل استدلال بیشتری انجام میدهد و ابزارها را بهصورت تکراری فراخوانی میکند. در سطوح بالاتر تلاش، ممکن است مدل برای بهبود عملکرد از توکنهای بیشتری استفاده کند. البته در برنامههایی که کاهش هزینه محاسباتی اولویت اصلی است، توسعهدهندگان میتوانند سطح تلاش مدل را پایین بیاورند تا مصرف توکن کاهش پیدا کند. استفاده از Gemini 3.7 Flash نیز همچنان برای وظایفی که بهرهوری در آنها اولویت دارد، ادامه خواهد داشت.
Gemini 3.8 Flash Cyber؛ مدل تخصصی گوگل برای امنیت سایبری
Gemini 3.8 Flash Cyber از طریق برنامه Fairwind در اختیار گروهی از مدافعان مورداعتماد قرار میگیرد. این مدل با ترکیب سرعت بالای مدلهای Flash و هزینه پایین آنها، امکان انجام سریعتر فرایندهای امنیتی و تکرار آزمایشها را فراهم میکند.
کشف خودکار آسیبپذیریها
در CyberGym، یکی از بنچمارکهای استاندارد صنعت برای شناسایی آسیبپذیریها، Gemini 3.8 Flash Cyber عملکردی در سطح مدلهای پیشرو نشان داده است. این مدل هم از 3.5 Flash Cyber و هم از مدلهای پیشروی بسیار بزرگتر عملکرد بهتری داشته است. از آنجا که نیازهای امنیتی دنیای واقعی به کدهای C/C++ محدود نمیشوند، گوگل آزمایش دیگری را نیز با یک بنچمارک داخلی جامع انجام داده است. در این آزمون، مدل باید طیف گستردهای از آسیبپذیریها را در کدبیسهای پیچیدهای که 20 زبان برنامهنویسی را شامل میشوند، شناسایی کند. Gemini 3.8 Flash Cyber در این آزمایش نیز پیشرفت قابلتوجهی نسبت به مدلهای قبلی گوگل نشان داده و به نرخ موفقیت بیش از 70درصد رسیده است.

وصلهکردن خودکار آسیبپذیریها
گوگل میگوید در توسعه Gemini 3.8 Flash Cyber، تمرکز اصلی را بر ارائه قابلیتهای تخصصی به مدافعان سایبری گذاشته است تا بتوانند در برابر مهاجمان دست بالا را داشته باشند. به همین دلیل، این شرکت از ابتدا رفع آسیبپذیریها را در اولویت قرار داده و آن را بر قابلیتهای تهاجمی مانند بهرهبرداری از آسیبپذیریها ترجیح داده است. در بنچمارک خارجی CWE-Bench که توسط Collinear اجرا میشود، Gemini 3.8 Flash Cyber در محدوده مرزی عملکرد و هزینه قرار گرفته است. این مدل به امتیاز Pass@1 معادل 47.2 درصد رسیده، در حالی که یک مدل پیشروی رقیب امتیاز 47.8 درصد کسب کرده است. بااینحال، هزینه استفاده از مدل گوگل بهمراتب کمتر است.
استفاده از Gemini 3.8 Flash Cyber برای ایمنسازی کدهای گوگل
گوگل میگوید همین حالا از Gemini 3.8 Flash Cyber برای افزایش امنیت کدهای خود استفاده میکند. برای نمونه:
- تیم امنیتی کروم دریافت که Gemini 3.8 Flash Cyber در مقایسه با بزرگترین مدلهای تجاری، 2.6 برابر وصله صحیح بیشتری برای آسیبپذیریهای کروم تولید کرده است.
- شرکت Wiz اعلام کرده که Gemini 3.8 Flash Cyber در بنچمارک داخلی تست نفوذ این شرکت، 7.5 تا 9.7 درصد Recall بیشتری ارائه میدهد، در حالی که هزینه آن 2.3 تا 5.2 برابر کمتر از دیگر مدلهای پیشرو است.
- تیم Cloud Vulnerability Research گوگل با استفاده از Gemini 3.8 Flash Cyber توانست یک آسیبپذیری حیاتی در زیرساختهای پایه را در کمتر از 2 ساعت شناسایی کند؛ در حالی که تحقیق و کشف چنین آسیبپذیریهایی معمولاً ماهها زمان میبرد.
Gemini 3.8 با تمرکز بر ایمنی توسعه یافته است
Gemini 3.8 Flash با سازوکارهای حفاظتی در برابر سوءاستفاده در حوزههای شیمیایی، زیستی، پرتوزا و هستهای (CBRN) و همچنین حملات سایبری تهاجمی عرضه شده است. این مدل در عین حال، مطابق با Frontier Safety Framework گوگل، امکان استفاده در کاربردهای مفید را حفظ میکند. Gemini 3.8 Flash Cyber محدودیتهای حفاظتی سهلگیرانهتری برای کاربردهای امنیت سایبری دارد و به همین دلیل، تنها در اختیار مدافعان مورداعتماد قرار میگیرد که به مجموعه گستردهتری از قابلیتهای امنیت سایبری نیاز دارند. مدلهای Gemini 3.8 همچنین در زمینه مقاومت در برابر تزریق پرامپت پیشرفت چشمگیری داشتهاند. طبق ارزیابیهای Gray Swan، این مدلها مقاومت بیشتری در برابر حملات مخربی دارند که از طریق تزریق پرامپت انجام میشوند و میتوانند از کاربران Gemini در برابر چنین حملاتی محافظت کنند.
هنوز نظری ثبت نشده
نظرات شما درباره «گوگل از مدل های Gemini 3.8...»اولین نفری باشید که نظر میدهید!
نظرات شما میتواند به بهبود محتوا و کمک به دیگران کمک کند.
ثبت اولین نظر