Open AI از نسل جدید مدل هوش مصنوعی GPT-Live-1 رونمایی کرد. این مدل با بهرهگیری از معماری جدید گفتگوی صوتی با هوش مصنوعی را بیش از هر زمان دیگری به مکالمه واقعی انسان نزدیک میکند. قابلیتهایی مانند شنیدن و صحبت کردن همزمان، ترجمه زنده و پاسخهای طبیعیتر از مهمترین ویژگیهای این مدل هستند.
در نسخههای قبلی، حالت صوتی ChatGPT بهصورت نوبتی عمل میکرد و برای پاسخ دادن باید منتظر پایان صحبت کاربر میماند. این موضوع گاهی باعث میشد مکثهای کوتاه کاربر به اشتباه پایان جمله تلقی شده و هوش مصنوعی وسط صحبت او پاسخ دهد.
اما معماری جدید GPT-Live این محدودیت را برطرف کرده و مدل میتواند بهصورت همزمان صدای کاربر را دریافت، پردازش و پاسخ تولید کند؛ در نتیجه مکالمات روانتر شده و تأخیر میان صحبت کاربر و پاسخ هوش مصنوعی به شکل محسوسی کاهش یافته است.

قابلیتهای هیجانانگیز GPT-Live-1 در مکالمه با کاربران
GPT-Live-1 هوشمندترین مدل صوتی این شرکت تاکنون محسوب میشود. این مدل هنگام نیاز به استدلال عمیق یا جستجوی وب، درخواست کاربر را در پسزمینه به مدلهای متنی پیشرفتهتر مانند GPT-5.5 واگذار میکند، اما گفتوگوی صوتی بدون وقفه ادامه پیدا میکند و پس از پایان پردازش، نتیجه بهصورت طبیعی در جریان مکالمه ارائه میشود.
یکی از مهمترین قابلیتهای GPT-Live، ترجمه زنده با تأخیر بسیار کم است. برخلاف گذشته، دیگر نیازی نیست کاربر ابتدا صحبت خود را به پایان برساند تا ترجمه آغاز شود؛ هوش مصنوعی میتواند هنگام صحبت کاربر، ترجمه را تقریباً بهصورت همزمان انجام دهد.
این ویژگی برای سفر، جلسات کاری و ارتباط با افراد مختلف به زبانهای گوناگون کاربرد فراوانی خواهد داشت. مدل جدید همچنین رفتار طبیعیتری از خود نشان میدهد. GPT-Live میتواند تشخیص دهد چه زمانی باید صحبت کند، چه زمانی فقط گوش دهد یا منتظر ادامه صحبت کاربر بماند.
حتی هنگام گوش دادن، با عباراتی مانند «اوهوم»، «آره» یا «متوجه شدم» نشان میدهد که همچنان در حال دنبال کردن مکالمه است. علاوه بر این، کاربران اکنون میتوانند با تأخیر بسیار کمتر صحبت هوش مصنوعی را قطع کرده و مسیر گفتوگو را تغییر دهند.
اوپنایآی قابلیتهای بصری جدیدی نیز به حالت صوتی اضافه کرده است. در موضوعاتی مانند آبوهوا، نتایج مسابقات ورزشی، قیمت سهام یا برخی اطلاعات دیگر، ChatGPT بهجای ارائه صرفاً پاسخ صوتی، کارتها و تصاویر گرافیکی مرتبط را نیز روی صفحه نمایش میدهد. امکان بررسی فایلها و تصاویر در کنار مکالمه صوتی نیز همچنان در دسترس کاربران باقی مانده است.

البته اوپنایآی تأیید کرده که این فناوری هنوز بینقص نیست. برای مثال، در نمایش قابلیت ترجمه زنده به زبان هندی، مدل با لهجهای آمریکایی و لحنی نسبتاً غیرطبیعی صحبت کرد. این شرکت اعلام کرده است که GPT-Live در حال حاضر برای زبانهای پرکاربرد بهینهتر شده و کیفیت آن برای سایر زبانها نیز بهتدریج بهبود خواهد یافت.
در همین رابطه بخوانید:
- هوش مصنوعی Grok 4.5 معرفی شد؛ سریعتر و ارزانتر برای رقابت با ChatGPT و Claude
فرآیند انتشار GPT-Live از امروز برای نسخههای وب، iOS و اندروید آغاز شده است. کاربران طرحهای Plus، Pro و Go به مدل قدرتمند GPT-Live-1 دسترسی خواهند داشت، در حالی که کاربران رایگان بهصورت پیشفرض از GPT-Live-1 استفاده میکنند.
اوپنایآی همچنین اعلام کرده فایلهای صوتی تا 30 روز ذخیره میشوند و کاربران امکان حذف آنها را خواهند داشت. علاوه بر این، حالت صوتی بهطور پیشفرض برای آموزش مدلهای هوش مصنوعی مورد استفاده قرار نمیگیرد.













نظر خود را اضافه کنید.
برای ارسال نظر وارد شوید
ارسال نظر بدون عضویت در سایت