1

آنتروپیک مدل جدید Claude Sonnet 5.5 را معرفی کرده است؛ نسخه‌ای سریع‌تر و کارآمدتر از مدل میان‌رده این شرکت که برای کارهای روزمره و حرفه‌ای طراحی شده است. این مدل در حالی عرضه می‌شود که بازار مدل‌های هوش مصنوعی در رده قیمتی پایین‌تر از مدل‌های پرچم‌دار به‌شدت رقابتی شده است. آنتروپیک می‌گوید Sonnet 5.5 بیش از 30 درصد سریع‌تر از Claude Sonnet 5 خروجی تولید می‌کند و می‌تواند هزینه کلی انجام یک کار را تا 30 درصد کاهش دهد.

این کاهش هزینه به‌دلیل پایین‌تر بودن قیمت هر توکن نیست، بلکه عمدتاً از مصرف توکن کمتر و تعداد کمتر فراخوانی ابزارها ناشی می‌شود. قیمت API این مدل بدون تغییر نسبت به Sonnet 5 باقی مانده است: 2 دلار به‌ازای هر 1 میلیون توکن ورودی و 10 دلار به‌ازای هر 1 میلیون توکن خروجی. این دقیقاً همان قیمت فعلی GPT-6 Sol از OpenAI است که آن نیز با قیمت 2 دلار برای هر 1 میلیون توکن ورودی و 10 دلار برای هر 1 میلیون توکن خروجی عرضه می‌شود.

آنتروپیک برای نشان دادن توانایی‌های Sonnet 5.5، نتایج چندین بنچمارک را با Sonnet 5، مدل پرچم‌دار Opus 5.5 و GPT-6 Sol مقایسه کرده است. در GDPval-AA v2.1، Sonnet 5.5 امتیاز 1,844 را به دست آورده که تنها 2 امتیاز کمتر از Opus 5.5 است و بالاتر از امتیاز 1,487 مربوط به GPT-6 Sol قرار می‌گیرد. در FrontierCode 1.1 نیز Sonnet 5.5 در حالت Xhigh به امتیاز 52.1 درصد رسیده، در حالی که GPT-6 Sol امتیاز 49.3 درصد را ثبت کرده است. البته در حالت Max، امتیاز Sonnet 5.5 به 46.2 درصد کاهش می‌یابد.

آنتروپیک توضیح داده است که در حالت Max، مدل در برخی موارد بیشتر از قابلیت بررسی کد Claude Code استفاده کرده و این فرایند در چند مورد باعث پایان یافتن زمان اجرا یا ایجاد تغییرات خارج از محدوده وظیفه شده است. در Terminal-Bench 4.0، Sonnet 5.5 امتیاز 70.6 درصد را کسب کرده است؛ با این حال، آنتروپیک برای GPT-6 Sol در جدول خود عددی ارائه نکرده است. همین وضعیت درباره چند بنچمارک دیگر، از جمله CursorBench 4.0، Humanity’s Last Exam و OSWorld 2.1 نیز وجود دارد.

بنابراین مقایسه مستقیم در همه آزمون‌ها امکان‌پذیر نیست. Sonnet 5.5 همچنین در AA-Briefcase v1.1 امتیاز 1,811 و در Chartography امتیاز 61.6 درصد به دست آورده است. در Chartography، امتیاز گزارش‌شده برای GPT-6 Sol برابر با 53.6 درصد است. آنتروپیک همچنین می‌گوید Sonnet 5.5 در برخی بنچمارک‌ها با سطح تلاش پایین یا متوسط می‌تواند به نتایج Sonnet 5 با هزینه‌ای بسیار کمتر برای هر کار دست پیدا کند.

با این حال، این ادعا درباره کاهش هزینه به ازای انجام یک کار با قیمت فهرستی توکن‌ها متفاوت است و مقایسه مستقیمی از هزینه واقعی انجام یک کار بین Sonnet 5.5 و GPT-6 Sol هنوز منتشر نشده است. Sonnet 5.5 دومین عضو خانواده Claude 5.5 پس از Opus 5.5 است که در 22 سپتامبر معرفی شد. آنتروپیک اعلام کرده بود که Sonnet 5.5 و Claude Haiku 5.5 در هفته‌های بعد عرضه خواهند شد.

به این ترتیب، Sonnet 5.5 با همان قیمت API، سرعت بالاتر و ادعای کاهش هزینه به ازای انجام کار وارد بازار شده است؛ بازاری که اکنون مدل‌هایی مانند GPT-6 Sol نیز با قیمت مشابه در آن حضور دارند. با این حال، قیمت یکسان هر توکن لزوماً به معنای هزینه یکسان برای تکمیل یک کار نیست، زیرا تعداد توکن‌های مصرف‌شده و فراخوانی ابزارها می‌تواند هزینه نهایی را تغییر دهد.