Open AI از نسل جدید مدل هوش مصنوعی GPT-Live-1 رونمایی کرد. این مدل‌ با بهره‌گیری از معماری جدید گفتگوی صوتی با هوش مصنوعی را بیش از هر زمان دیگری به مکالمه واقعی انسان نزدیک می‌کند. قابلیت‌هایی مانند شنیدن و صحبت کردن هم‌زمان، ترجمه زنده و پاسخ‌های طبیعی‌تر از مهم‌ترین ویژگی‌های این مدل هستند.

در نسخه‌های قبلی، حالت صوتی ChatGPT به‌صورت نوبتی عمل می‌کرد و برای پاسخ دادن باید منتظر پایان صحبت کاربر می‌ماند. این موضوع گاهی باعث می‌شد مکث‌های کوتاه کاربر به اشتباه پایان جمله تلقی شده و هوش مصنوعی وسط صحبت او پاسخ دهد.

اما معماری جدید GPT-Live این محدودیت را برطرف کرده و مدل می‌تواند به‌صورت هم‌زمان صدای کاربر را دریافت، پردازش و پاسخ تولید کند؛ در نتیجه مکالمات روان‌تر شده و تأخیر میان صحبت کاربر و پاسخ هوش مصنوعی به شکل محسوسی کاهش یافته است.

live-2.jpg

قابلیت‌های هیجان‌انگیز GPT-Live-1 در مکالمه با کاربران

GPT-Live-1 هوشمندترین مدل صوتی این شرکت تاکنون محسوب می‌شود. این مدل هنگام نیاز به استدلال عمیق یا جستجوی وب، درخواست کاربر را در پس‌زمینه به مدل‌های متنی پیشرفته‌تر مانند GPT-5.5 واگذار می‌کند، اما گفت‌وگوی صوتی بدون وقفه ادامه پیدا می‌کند و پس از پایان پردازش، نتیجه به‌صورت طبیعی در جریان مکالمه ارائه می‌شود.

یکی از مهم‌ترین قابلیت‌های GPT-Live، ترجمه زنده با تأخیر بسیار کم است. برخلاف گذشته، دیگر نیازی نیست کاربر ابتدا صحبت خود را به پایان برساند تا ترجمه آغاز شود؛ هوش مصنوعی می‌تواند هنگام صحبت کاربر، ترجمه را تقریباً به‌صورت هم‌زمان انجام دهد.

این ویژگی برای سفر، جلسات کاری و ارتباط با افراد مختلف به زبان‌های گوناگون کاربرد فراوانی خواهد داشت. مدل جدید همچنین رفتار طبیعی‌تری از خود نشان می‌دهد. GPT-Live می‌تواند تشخیص دهد چه زمانی باید صحبت کند، چه زمانی فقط گوش دهد یا منتظر ادامه صحبت کاربر بماند.

حتی هنگام گوش دادن، با عباراتی مانند «اوهوم»، «آره» یا «متوجه شدم» نشان می‌دهد که همچنان در حال دنبال کردن مکالمه است. علاوه بر این، کاربران اکنون می‌توانند با تأخیر بسیار کمتر صحبت هوش مصنوعی را قطع کرده و مسیر گفت‌وگو را تغییر دهند.

اوپن‌ای‌آی قابلیت‌های بصری جدیدی نیز به حالت صوتی اضافه کرده است. در موضوعاتی مانند آب‌وهوا، نتایج مسابقات ورزشی، قیمت سهام یا برخی اطلاعات دیگر، ChatGPT به‌جای ارائه صرفاً پاسخ صوتی، کارت‌ها و تصاویر گرافیکی مرتبط را نیز روی صفحه نمایش می‌دهد. امکان بررسی فایل‌ها و تصاویر در کنار مکالمه صوتی نیز همچنان در دسترس کاربران باقی مانده است.

live-2.jpg

البته اوپن‌ای‌آی تأیید کرده که این فناوری هنوز بی‌نقص نیست. برای مثال، در نمایش قابلیت ترجمه زنده به زبان هندی، مدل با لهجه‌ای آمریکایی و لحنی نسبتاً غیرطبیعی صحبت کرد. این شرکت اعلام کرده است که GPT-Live در حال حاضر برای زبان‌های پرکاربرد بهینه‌تر شده و کیفیت آن برای سایر زبان‌ها نیز به‌تدریج بهبود خواهد یافت.

در همین رابطه بخوانید:

- هوش مصنوعی Grok 4.5 معرفی شد؛ سریع‌تر و ارزان‌تر برای رقابت با ChatGPT و Claude

فرآیند انتشار GPT-Live از امروز برای نسخه‌های وب، iOS و اندروید آغاز شده است. کاربران طرح‌های Plus، Pro و Go به مدل قدرتمند GPT-Live-1 دسترسی خواهند داشت، در حالی که کاربران رایگان به‌صورت پیش‌فرض از GPT-Live-1 استفاده می‌کنند.

اوپن‌ای‌آی همچنین اعلام کرده فایل‌های صوتی تا 30 روز ذخیره می‌شوند و کاربران امکان حذف آن‌ها را خواهند داشت. علاوه بر این، حالت صوتی به‌طور پیش‌فرض برای آموزش مدل‌های هوش مصنوعی مورد استفاده قرار نمی‌گیرد.

نظر خود را اضافه کنید.

ارسال نظر بدون عضویت در سایت

0
نظر شما پس از تایید مدیر منتشر خواهد شد.

نظرات (1)

  • مهمان - Kazatar

    ای جانم پیشرفت تکنولوژی به به بریم برای مهندسی معکوس ???

ورود به شهرسخت‌افزار

ثبت نام در شهر سخت افزار
ورود به شهر سخت افزار

ثبت نام در شهر سخت افزار

نام و نام خانوادگی(*)
لطفا نام خود را وارد کنید

ایمیل(*)
لطفا ایمیل خود را به درستی وارد کنید

رمز عبور(*)
لطفا رمز عبور خود را وارد کنید

شماره موبایل
Invalid Input

جزو کدام دسته از اشخاص هستید؟(*)

لطفا یکی از موارد را انتخاب کنید