1

آنتروپیک به‌تازگی از Claude Opus 5.5، مدل هوش مصنوعی جدید خود، رونمایی کرده که می‌تواند در بیشتر مواقع، کارهایی در سطح Claude Fable 5.1 را با کسری از قیمت Opus 5 انجام دهد. برخلاف مدل‌های قدیمی‌تر این خانواده، این مدل با رسیدن مستقیم به اصل مطلب و اجتناب از عادت‌های آزاردهنده معمول مدل‌های زبانی بزرگ (LLM)، مانند مقدمه‌چینی‌های غیرضروری و تملق‌گویی، متن را طبیعی‌تر می‌نویسد.

Opus 5.5 به یکی از آزمایش‌کنندگان کمک کرد 680 هزار خط کد را در کمتر از یک روز منتقل کند؛ کاری که به گفته Anthropic، انجام آن برای یک تیم مهندسی انسانی چندین هفته زمان می‌برد. در آزمون Terminal-Bench 4.0، مدل Opus 5.5امتیاز 66.4 درصد را کسب کرد و بالاتر از GPT-6 Astra شرکت OpenAI با امتیاز 57.9 درصد قرار گرفت. این مدل در آزمون FrontierCode v1.1 نیز عملکرد بهتری داشت و با کسب امتیاز 54.4 درصد، بالاتر از Astra با 53.3 درصد و Fable 5.1 با 50.3 درصد قرار گرفت.

از نظر هزینه، Opus 5.5 حدود 40 درصد ارزان‌تر از Opus 5 است؛ به‌طوری‌که هزینه آن برای هر 1 میلیون توکن ورودی 4 دلار و برای هر 1 میلیون توکن خروجی 20 دلار است. هزینه خواندن توکن‌های ذخیره‌شده (cached tokens) نیز 0.20 دلار به ازای هر میلیون توکن خواهد بود. Opus 5.5 از نظر عملکرد، بهترین مدل منتشرشده Anthropic در سامانه داخلی ایمنی این شرکت محسوب می‌شود؛ سامانه‌ای که مدل‌های هوش مصنوعی را در معرض هزاران موقعیت شبیه‌سازی‌شده و چالش‌برانگیز قرار می‌دهد تا پیش از عرضه، به‌صورت خودکار بررسی کند که آیا مدل در این شرایط رفتار نامناسبی خواهد داشت، دروغ می‌گوید یا قوانین ایمنی را نقض می‌کند.

تیم Anthropic هنگام آزمایش این مدل در نزدیک به 2 هزار سناریوی شبیه‌سازی‌شده هم‌راستایی (alignment) دریافت که Opus 5.5 در مقایسه با Claude Opus 5 یا Claude Mythos 5.1، حدود 85 درصد کمتر برای عبور از مرزهای محصورسازی (containment boundaries) تلاش کرده است. این مدل همچنین در ارزیابی‌های صداقت، در میان مدل‌های جدید Claude بالاترین امتیاز را کسب کرد و در معیارهای Gray Swan با Claude Fable 5.1 به‌طور مشترک به پایین‌ترین نرخ موفقیت در برابر حملات تزریق پرامپت (prompt injection) دست یافت؛ آن هم در تمامی محیط‌های ارزیابی‌شده، شامل کدنویسی، استفاده از رایانه و مرور وب.

Opus 5.5 هم‌اکنون در Amazon Web Services، Google Cloud، Microsoft Azure و Claude.ai در دسترس است. آزمایشگاه هوش مصنوعی Anthropic قصد دارد Sonnet 5.5 و Claude Haiku 5.5 را نیز طی هفته‌های آینده عرضه کند.