شرکت OpenAI از مدل صوتی GPT-Live-۱ برای مکالمات طبیعیتر رونمایی کرد
اوپنایآی از نسل جدید مدلهای صوتی خود با نام GPT-Live-۱ و نسخه مینی آن رونمایی کرد. این مدلهای جدید با معماری «دوطرفه» طراحی شدهاند و به کاربران امکان میدهند مکالماتی بسیار طبیعیتر و روانتر را با هوش مصنوعی تجربه کنند. ویژگی برجسته این فناوری جدید، توانایی گوشدادن و صحبتکردن به صورت همزمان است که امکان قطعکردن حرف بات و ترجمه زنده را فراهم میکند. پیشازاین، حالت صوتی در ChatGPT براساس یک مدل نوبتی کار میکرد؛ به این معنا که هوش مصنوعی برای پاسخدادن باید منتظر سکوت کامل کاربر میماند. این وقفه ساختاری اغلب باعث میشد تا مکثهای کوتاه انسان برای فکرکردن، به اشتباه به عنوان پایان جمله برداشت شود و چتبات با یک پاسخ بیموقع حرف کاربر را قطع کند. اکنون با معرفی معماری دوطرفه در خانواده GPT-Live-۱، این سیستم میتواند در کسری از ثانیه تصمیم بگیرد که صحبت کند، به گوشدادن ادامه دهد یا ساکت بماند. این دستیار هوش مصنوعی حتی در زمان گوشدادن با بیان کلماتی مانند «بله» یا «متوجه شدم»، توجه خود را به کاربر نشان میدهد و در محیطهای پر سروصدا مانند خیابان، تمرکز بسیار بهتری روی صدای انسان دارد.