1

گوگل امروز از Nano Banana 2.1 نسخه ارتقایافته مدل هوش مصنوعی برای تولید و ویرایش تصاویر را معرفی کرد. گوگل تأکید کرده که مدل جدید Nano Banana 2.1 در تمام زمینه‌ها بهبود یافته است. این پیشرفت‌ها به‌ویژه در طراحی بصری، ویرایش مبتنی بر ماسک و حفظ یکپارچگی سوژه‌ها محسوس هستند. گوگل اوایل امسال Nano Banana 2 را معرفی کرد که با نام Gemini 3.1 Flash Image نیز شناخته می‌شود.

Nano Banana 2 کیفیت تصاویر Nano Banana Pro را ارائه می‌کرد، اما سرعت مدل‌های Flash گوگل را حفظ کرده بود. این مدل همچنین چندین قابلیت نسخه Pro از جمله دانش مربوط به دنیای واقعی، رندر بهتر متن و حفظ بهتر یکپارچگی شخصیت‌ها و اشیا را به مدلی ارزان‌تر آورد. Nano Banana 2.1 این قابلیت‌ها را با بهبودهای عمده در 3 حوزه توسعه می‌دهد:

  • طراحی بصری: Nano Banana 2.1 می‌تواند ترکیب‌بندی‌های زیباتر و عناصر بصری صیقل‌خورده‌تری تولید کند.
  • ویرایش مبتنی بر ماسک: کاربران می‌توانند بخش‌های مشخصی از یک تصویر موجود را با دقت بیشتری انتخاب و ویرایش کنند، بدون اینکه کل صحنه از نو تولید شود.
  • حفظ یکپارچگی سوژه: مدل در هنگام ویرایش یا تولید چند تصویر مرتبط، بهتر می‌تواند ظاهر و هویت سوژه‌ها را حفظ کند.

بهبود حفظ یکپارچگی سوژه‌ها می‌تواند برای کاربران Gemini بسیار کاربردی باشد. این قابلیت باعث می‌شود یک فرد یا شیء مشخص در تصاویر تولیدشده مختلف، ظاهر یکسانی داشته باشد. گوگل عرضه Nano Banana 2.1 را در اپلیکیشن Gemini، حالت AI در Google Search، Google AI Studio، Google Flow، Stitch، Google Ads و Gemini Enterprise Platform آغاز کرده است.

برای توسعه‌دهندگان، Nano Banana 2.1 اکنون به‌صورت عمومی با شناسه مدل gemini-nano-banana-2.1 در دسترس است. این مدل از ورودی‌های متنی، تصویری، صوتی و ویدیویی پشتیبانی می‌کند و امکان تولید تصاویر با وضوح 1K، 2K و 4K را نیز دارد. در حال حاضر، ChatGPT Images 2.5 شرکت OpenAI همچنان برترین مدل تولید و ویرایش تصویر در جهان است. Images 2.5 هنگام ادامه فرایند ویرایش یک تصویر، تغییرات قبلی را بهتر حفظ می‌کند.

این مدل برخلاف برخی رقبا، بخش‌هایی را که تغییری در آن‌ها ایجاد نشده است دست‌کاری نمی‌کند و با گذشت زمان باعث افت کیفیت تصویر اصلی نمی‌شود. پس از مدل OpenAI، مدل MAI-Image-2.6 شرکت Microsoft AI قرار دارد که در ماه آگوست امسال عرضه شد.