در ماه ژوئیه، SpaceXAI مدل Grok 4.5 را عرضه کرد که با همکاری Cursor آموزش داده شده بود. این مدل که با استفاده از دهها هزار پردازنده گرافیکی NVIDIA GB300 آموزش دیده است، نتایج قدرتمندی در بنچمارکها به ثبت رساند و تنها پس از مدل Fable 5 شرکت Anthropic و GPT-5.6 Sol شرکت OpenAI قرار گرفت؛ آن هم در حالی که هزینه بسیار کمتری داشت.
SpaceXAI امروز و در ادامه عرضه موفق Grok 4.5، مدل Grok 4.6 را معرفی کرد که تمرکز ویژهای بر انجام وظایف طولانیمدت دارد و با استفاده از دادههای منتخب تولیدشده توسط مدل، برای استدلال، مفاهیم فنی پیشرفته و دادههای مهندسی باکیفیت آموزش دیده است. این مدل همچنین با طیف گستردهای از وظایف یادگیری تقویتی عاملمحور (Agentic RL) آموزش داده شده که شامل کارهای دانشی، برنامهنویسی عمومی و چندین محیط تخصصی میشود.
به گفته این شرکت، در مقایسه با Grok 4.5، مدل جدید میتواند در نخستین تلاش برای ایجاد برنامههای بصری و تعاملی، نتایج قدرتمندتری ارائه دهد. در شاخص هوش مصنوعی Artificial Analysis که امتیاز 9 بنچمارک محبوب هوش مصنوعی را نشان میدهد، Grok 4.6 توانست با GPT-5.6 Sol برابری کند و تنها پایینتر از مدلهای Opus 5 و Fable 5 Max قرار گرفت. این مدل در بنچمارک GDPval-AA v2 امتیاز Elo برابر با 1753 به دست آورد و تنها پس از Claude Opus 5 قرار گرفت.
| معیار | Grok 4.6 | Grok 4.5 | GPT-5.6 Sol | Fable 5 |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54% | 73% | 70% |
| FrontierCode v1.1 (Extended) | 61.3% | 56.6% | 60.6% | 63.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% | 34.1% |
| APEX-SWE | 56.4% | 53.6% | — | 58.8% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15.8% | 12.9% | 2.5% | 11.3% |
در بنچمارک AA-Briefcase نیز که یک بنچمارک خصوصی از وظایف عاملمحور و بلندمدت در حوزه کارهای دانشی متعلق به Artificial Analysis است، Grok 4.6 امتیاز Elo برابر با 1577 کسب کرد و پس از Claude Opus 5 قرار گرفت. با وجود این بهبود عملکرد، Grok 4.6 با سرعت 80TPS ارائه میشود و قیمتگذاری رقابتی دارد. هزینه Grok 4.6 برای هر 1 میلیون توکن ورودی 2 دلار و برای هر 1 میلیون توکن خروجی 6 دلار است، در حالیکه نسخه سریع این مدل به ازای هر 1 میلیون توکن ورودی 4 دلار و به ازای هر 1 میلیون توکن خروجی $12 هزینه دارد. کاربران Cursor و Grok Build اکنون میتوانند از مدل Grok 4.6 استفاده کنند.
این مدل از طریق API نیز در اختیار توسعهدهندگان قرار دارد. SpaceXAI بهعنوان یک پیشنهاد تبلیغاتی محدود، در هفته نخست 2 برابر میزان استفاده شاملشده از این مدل را در Grok Build و Cursor ارائه میکند.
هنوز نظری ثبت نشده
نظرات شما درباره «SpaceXAI از مدل Grok 4.6 رونمایی...»اولین نفری باشید که نظر میدهید!
نظرات شما میتواند به بهبود محتوا و کمک به دیگران کمک کند.
ثبت اولین نظر