شرکت علیبابا از جدیدترین و قدرتمندترین مدل هوش مصنوعی خود با نام Qwen3.8-Max رونمایی کرد؛ مدلی که به گفته این شرکت، در بسیاری از بنچمارکهای هوش مصنوعی عملکردی همسطح یا حتی بهتر از مدلهای پیشرفتهای مانند GPT-5.6 Sol از OpenAI و Claude Fable 5 از Anthropic ارائه میدهد. Qwen3.8-Max با معماری Mixture of Experts (MoE) توسعه یافته و در مجموع از 2.4 تریلیون پارامتر بهره میبرد، اما برای هر درخواست تنها حدود 95 میلیارد پارامتر را فعال میکند.
این طراحی باعث کاهش هزینه پردازش و افزایش سرعت پاسخگویی، بدون افت محسوس عملکرد، میشود. همچنین این مدل از پنجره متنی (Context Window) یک میلیون توکنی پشتیبانی میکند که امکان پردازش اسناد بسیار طولانی و پروژههای پیچیده را فراهم میسازد. به گفته علیبابا، Qwen3.8-Max در ارزیابیهای مرتبط با برنامهنویسی، استدلال، درک چندرسانهای و وظایف عمومی هوش مصنوعی نتایج بسیار رقابتی کسب کرده و در برخی آزمونها از GPT-5.6 Sol و Claude Fable 5 پیشی گرفته است.
جدول بنچمارک های کامل مدل Qwen3.8-Max:
| Opus4.8 | Fable5 | GPT5.6 Sol (max) | Qwen3.7-Max | Qwen3.8-Max | |
|---|---|---|---|---|---|
| ایجنت کدنویسی | |||||
| Terminal Bench 2.1 | 84.6 | 84.6 | 88.8 | 74.5 | 86.6 |
| SWE-bench Pro | 69.2 | 80.0 | 64.6 | 60.6 | 67.7 |
| DeepSWE 1.1 | 59.0 | 70.0 | 73.0 | 21.6 | 56.6 |
| NL2Repo-Bench | 69.4 | — | — | 47.2 | 55.9 |
| FrontierSWE | 70.0 | 88.8 | — | 40.7 | 73.5 |
| MLS-Bench-Lite | 42.8 | 49.9 | 46.2 | 31.7 | 41.0 |
| PaperBench | 80.3 | 88.8 | 90.5 | 64.8 | 93.0 |
| AndroidBench | 69.8 | 84.5 | 74.0 | 56.5 | 70.2 |
| QwenSWEBench | 84.0 | 86.3 | 73.5 | 63.4 | 80.7 |
| QwenQoderBench | 62.7 | 63.1 | 53.8 | 36.8 | 58.4 |
| QwenReactBench | 1694 | 1770 | 1564 | 1538 | 1724 |
| QwenSVGBench | 1648 | 1690 | 1758 | 1499 | 1713 |
| ایجنت عمومی | |||||
| CoWorkBench | 72.3 | 75.9 | 71.5 | 64.6 | 74.8 |
| WorkSpaceBench | 66.8 | 68.7 | 65.6 | 61.4 | 67.7 |
| JobBench | 48.4 | 57.4 | 45.4 | 31.3 | 53.4 |
| SkillsBench | 65.1 | 70.9 | 73.5 | 61.2 | 70.2 |
| Agents’ Last Exam (Pass / Score) | 27.0 / 45.1 | — / — | 30.6 / 53.6 | 11.8 / 31.1 | 27.0 / 52.4 |
| Automation-Bench (Pass@1) | 27.2 | 29.1 | 29.7 | 14.2 | 27.3 |
| Toolathlon Verified (Pass@1) | 76.2 | 77.9 | 74.9 | 49.7 | 72.5 |
| WideSearch | 72.9 | 81.2 | — | 75.2 | 81.9 |
| HLE w/ tools | 57.9 | 64.5 | 58.0 | 53.5 | 56.2 |
| قابلیت های عمومی | |||||
| GPQA Diamond | 92.0 | 92.6 | 94.1 | 92.4 | 92.6 |
| HLE | 45.7 | 53.3 | 47.2 | 41.4 | 43.6 |
| IFBench | 62.2 | 63.5 | 72.7 | 79.1 | 82.8 |
| $OneMillion-Bench (expert score) | 41.8 | 55.9 | 53.8 | 44.4 | 52.5 |
| HealthBench | 52.4 | — | 55.3 | 54.5 | 60.2 |
| PLawBench | 69.6 | 70.2 | 72.3 | 58.9 | 73.2 |
| PRBench-Legal | 52.7 | 57.6 | 57.6 | 48.5 | 57.6 |
| PRBench-Finance | 51.9 | 55.8 | 55.5 | 46.8 | 58.3 |
| MRCR v2 256K (8-needle) | 83.2 | — | 93.8 | 86.7 | 92.9 |
| LongBench v2 | 69.1 | — | 67.1 | 65.3 | 66.3 |
البته این نتایج بر اساس بنچمارکهای منتشرشده از سوی خود شرکت ارائه شدهاند و هنوز ارزیابیهای مستقل و گسترده برای تأیید این ادعاها در دسترس نیست. این مدل بهصورت چندرسانهای (Multimodal) طراحی شده و توانایی پردازش متن، تصویر و ویدئو را دارد. علیبابا اعلام کرده که Qwen3.8-Max برای کاربردهایی مانند توسعه نرمافزار، تحلیل اسناد، پژوهش، تولید محتوا و اجرای وظایف پیچیده مبتنی بر عاملهای هوش مصنوعی (AI Agents) بهینهسازی شده است.
رونمایی از Qwen3.8-Max در حالی انجام میشود که رقابت میان شرکتهای بزرگ فناوری در حوزه مدلهای زبانی پیشرفته شدت گرفته است. علیبابا با انتشار این مدل، تلاش دارد جایگاه خود را در بازار جهانی هوش مصنوعی تقویت کرده و با رقبایی مانند OpenAI، Anthropic و گوگل وارد رقابت مستقیم شود.
هنوز نظری ثبت نشده
نظرات شما درباره «علیبابا از مدل هوش مصنوعی Qwen3.8-Max...»اولین نفری باشید که نظر میدهید!
نظرات شما میتواند به بهبود محتوا و کمک به دیگران کمک کند.
ثبت اولین نظر