1

شرکت علی‌بابا از جدیدترین و قدرتمندترین مدل هوش مصنوعی خود با نام Qwen3.8-Max رونمایی کرد؛ مدلی که به گفته این شرکت، در بسیاری از بنچمارک‌های هوش مصنوعی عملکردی هم‌سطح یا حتی بهتر از مدل‌های پیشرفته‌ای مانند GPT-5.6 Sol از OpenAI و Claude Fable 5 از Anthropic ارائه می‌دهد. Qwen3.8-Max با معماری Mixture of Experts (MoE) توسعه یافته و در مجموع از 2.4 تریلیون پارامتر بهره می‌برد، اما برای هر درخواست تنها حدود 95 میلیارد پارامتر را فعال می‌کند.

این طراحی باعث کاهش هزینه پردازش و افزایش سرعت پاسخ‌گویی، بدون افت محسوس عملکرد، می‌شود. همچنین این مدل از پنجره متنی (Context Window) یک میلیون توکنی پشتیبانی می‌کند که امکان پردازش اسناد بسیار طولانی و پروژه‌های پیچیده را فراهم می‌سازد. به گفته علی‌بابا، Qwen3.8-Max در ارزیابی‌های مرتبط با برنامه‌نویسی، استدلال، درک چندرسانه‌ای و وظایف عمومی هوش مصنوعی نتایج بسیار رقابتی کسب کرده و در برخی آزمون‌ها از GPT-5.6 Sol و Claude Fable 5 پیشی گرفته است.

جدول بنچمارک های کامل مدل Qwen3.8-Max:

Opus4.8 Fable5 GPT5.6 Sol (max) Qwen3.7-Max Qwen3.8-Max
ایجنت کدنویسی
Terminal Bench 2.1 84.6 84.6 88.8 74.5 86.6
SWE-bench Pro 69.2 80.0 64.6 60.6 67.7
DeepSWE 1.1 59.0 70.0 73.0 21.6 56.6
NL2Repo-Bench 69.4 47.2 55.9
FrontierSWE 70.0 88.8 40.7 73.5
MLS-Bench-Lite 42.8 49.9 46.2 31.7 41.0
PaperBench 80.3 88.8 90.5 64.8 93.0
AndroidBench 69.8 84.5 74.0 56.5 70.2
QwenSWEBench 84.0 86.3 73.5 63.4 80.7
QwenQoderBench 62.7 63.1 53.8 36.8 58.4
QwenReactBench 1694 1770 1564 1538 1724
QwenSVGBench 1648 1690 1758 1499 1713
ایجنت عمومی
CoWorkBench 72.3 75.9 71.5 64.6 74.8
WorkSpaceBench 66.8 68.7 65.6 61.4 67.7
JobBench 48.4 57.4 45.4 31.3 53.4
SkillsBench 65.1 70.9 73.5 61.2 70.2
Agents’ Last Exam (Pass / Score) 27.0 / 45.1 — / — 30.6 / 53.6 11.8 / 31.1 27.0 / 52.4
Automation-Bench (Pass@1) 27.2 29.1 29.7 14.2 27.3
Toolathlon Verified (Pass@1) 76.2 77.9 74.9 49.7 72.5
WideSearch 72.9 81.2 75.2 81.9
HLE w/ tools 57.9 64.5 58.0 53.5 56.2
قابلیت های عمومی
GPQA Diamond 92.0 92.6 94.1 92.4 92.6
HLE 45.7 53.3 47.2 41.4 43.6
IFBench 62.2 63.5 72.7 79.1 82.8
$OneMillion-Bench (expert score) 41.8 55.9 53.8 44.4 52.5
HealthBench 52.4 55.3 54.5 60.2
PLawBench 69.6 70.2 72.3 58.9 73.2
PRBench-Legal 52.7 57.6 57.6 48.5 57.6
PRBench-Finance 51.9 55.8 55.5 46.8 58.3
MRCR v2 256K (8-needle) 83.2 93.8 86.7 92.9
LongBench v2 69.1 67.1 65.3 66.3

البته این نتایج بر اساس بنچمارک‌های منتشرشده از سوی خود شرکت ارائه شده‌اند و هنوز ارزیابی‌های مستقل و گسترده برای تأیید این ادعاها در دسترس نیست. این مدل به‌صورت چندرسانه‌ای (Multimodal) طراحی شده و توانایی پردازش متن، تصویر و ویدئو را دارد. علی‌بابا اعلام کرده که Qwen3.8-Max برای کاربردهایی مانند توسعه نرم‌افزار، تحلیل اسناد، پژوهش، تولید محتوا و اجرای وظایف پیچیده مبتنی بر عامل‌های هوش مصنوعی (AI Agents) بهینه‌سازی شده است.

رونمایی از Qwen3.8-Max در حالی انجام می‌شود که رقابت میان شرکت‌های بزرگ فناوری در حوزه مدل‌های زبانی پیشرفته شدت گرفته است. علی‌بابا با انتشار این مدل، تلاش دارد جایگاه خود را در بازار جهانی هوش مصنوعی تقویت کرده و با رقبایی مانند OpenAI، Anthropic و گوگل وارد رقابت مستقیم شود.