گوگل به‌تازگی از دو مدل جدید هوش مصنوعی مولد خود رونمایی کرده است. این مدل‌ها شامل Nano Banana 2 Lite برای تولید سریع تصاویر در عرض 4 ثانیه و Gemini Omni Flash برای تولید و ویرایش ویدیو با استفاده از دستورات متنی است.

مدل Nano Banana 2 Lite که با نام gemini-3.1-flash-lite-image شناخته می‌شود، برای تولید انبوه و سریع تصویر طراحی شده است. این مدل می‌تواند تصاویر 1K را تنها در حدود 4 ثانیه تولید کند.

هزینه هر تصویر نیز حدود 0.034 دلار اعلام شده که آن را به یکی از اقتصادی‌ترین مدل‌ها گوگل تبدیل می‌کند. در مقایسه با نسخه‌های بالاتر خانواده Nano Banana، یعنی Nano Banana 2 و Nano Banana Pro، این مدل تمرکز بیشتری روی سرعت دارد.

گوگل اعلام کرده با وجود تمرکز روی سرعت، این مدل همچنان در اجرای دستورات متنی، حفظ یکپارچگی شخصیت‌ها و تولید متن خوانا در تصاویر عملکرد قابل قبولی دارد. با این حال در پردازش متن‌های بسیار ریز یا سناریوهای پیچیده تصویری، محدودیت‌هایی دیده می‌شود.

nanob-2.jpg

این مدل همچنین جایگزین نسخه اولیه Nano Banana مبتنی بر Gemini 2.5 شده و به‌تدریج در سرویس‌هایی مثل AI Mode در Google Search و اپلیکیشن Gemini و NotebookLM و Google Photos و Stitch و Google Flow و Google Ads در حال عرضه است.

ساخت ویدیو با مدل Gemini Omni Flash

در کنار آن، مدل Gemini Omni Flash برای اولین بار قابلیت تولید و ویرایش ویدیو را از طریق Gemini API و Google AI Studio در اختیار توسعه‌دهندگان قرار داده است. این مدل از قابلیت‌های چندوجهی Gemini استفاده می‌کند و می‌تواند با ترکیب متن، تصویر و ویدیو، خروجی ویدیویی تولید کند.

هزینه استفاده از آن حدود 0.10 دلار به ازای هر ثانیه ویدیو اعلام شده و در حال حاضر ویدیوهایی تا سقف 10 ثانیه تولید می‌کند. گوگل همچنین محدودیت‌هایی برای این مدل مطرح کرده است. از جمله اینکه پشتیبانی کامل از مرجع صوتی، ادامه صحنه‌ها، یا ثبات کامل شخصیت‌ها در تغییر زاویه دوربین هنوز به‌طور کامل فراهم نشده است.

نکته مهم این است که گوگل استفاده ترکیبی از این دو مدل را پیشنهاد می‌دهد. در این سناریو، ابتدا تصاویر با Nano Banana 2 Lite تولید می‌شوند و سپس همان تصاویر به Gemini Omni Flash داده می‌شوند تا به ویدیو تبدیل شوند.

نمونه‌های کاربردی این رویکرد شامل ساخت ویدیوهای تبلیغاتی، طراحی داخلی و حتی شبیه‌سازی حضور افراد در مکان‌های مختلف است. هر دو مدل از فناوری SynthID برای واترمارک‌گذاری محتوای تولیدشده استفاده می‌کنند تا امکان تشخیص ماهیت هوش مصنوعی حتی پس از ویرایش نیز وجود داشته باشد.

نظر خود را اضافه کنید.

ارسال نظر بدون عضویت در سایت

0
نظر شما پس از تایید مدیر منتشر خواهد شد.
  • هیچ نظری یافت نشد

ورود به شهرسخت‌افزار

ثبت نام در شهر سخت افزار
ورود به شهر سخت افزار

ثبت نام در شهر سخت افزار

نام و نام خانوادگی(*)
لطفا نام خود را وارد کنید

ایمیل(*)
لطفا ایمیل خود را به درستی وارد کنید

رمز عبور(*)
لطفا رمز عبور خود را وارد کنید

شماره موبایل
Invalid Input

جزو کدام دسته از اشخاص هستید؟(*)

لطفا یکی از موارد را انتخاب کنید