OpenAI เปิดตัว GPT-Live-1 โมเดลเสียง AI รุ่นใหม่ ฟังและพูดได้พร้อมกัน แปลภาษาได้เรียลไทม์

OpenAI เปิดตัว GPT-Live-1

OpenAI เปิดตัวโมเดล AI เสียงรุ่นใหม่ GPT-Live-1 และ GPT-Live-1 mini ที่ออกแบบมาให้การพูดคุยกับ AI เป็นธรรมชาติมากขึ้น โดยสามารถฟังและพูดได้พร้อมกัน ทำให้ผู้ใช้พูดแทรกได้เหมือนคุยกับคนจริง อีกทั้งยังรองรับฟีเจอร์อย่างการแปลภาษาแบบเรียลไทม์ และเชื่อมต่อกับโมเดลภาษาอย่าง GPT-5.5 เพื่อช่วยตอบคำถามที่ซับซ้อนมากขึ้น

ฟังและพูดได้พร้อมกัน 

จุดเด่นของ GPT-Live คือการเป็นโมเดลแบบ Full-Duplex ที่สามารถฟังและพูดได้ในเวลาเดียวกันต่างจากระบบเดิมที่ต้องรอให้ผู้ใช้พูดจบก่อนจึงเริ่มตอบ ทำให้การสนทนาลื่นไหลขึ้น ผู้ใช้สามารถพูดแทรก เปลี่ยนเรื่อง หรือหยุด AI ระหว่างพูดได้ตามธรรมชาติ

OpenAI ระบุว่าโมเดลใหม่นี้จะช่วยแก้ปัญหาที่พบในระบบเดิม อย่างเช่น AI พูดแทรกขณะที่ผู้ใช้ยังพูดไม่จบหรือมีความสามารถในการตอบคำถามที่ยังไม่เพียงพอ

สามารถเชื่อม GPT-5.5 เพื่อช่วยตอบคำถามที่ซับซ้อน

เมื่อผู้ใช้ถามคำถามที่ต้องอาศัยการค้นหาข้อมูล การใช้เหตุผล หรือความสามารถแบบ AI Agent ระบบจะส่งคำขอไปยังโมเดลภาษาอย่าง GPT-5.5 แล้วนำคำตอบกลับมาสนทนาต่อโดยไม่ทำให้บทสนทนาสะดุด ซึ่งได้สาธิตว่า GPT-Live สามารถเงียบเพื่อฟังผู้ใช้ต่อเนื่องเป็นเวลานานจนกว่าจะถึงจังหวะที่เหมาะสมในการตอบ 

ChatGPT จะเปลี่ยนมาใช้ GPT-Live เป็นค่าเริ่มต้น

OpenAI จะเปลี่ยนโหมดเสียงของ ChatGPT จาก Advanced Voice Mode มาใช้ GPT-Live-1 mini เป็นค่าเริ่มต้น ส่วนผู้ใช้แพ็กเกจแบบชำระเงินจะสามารถใช้งาน GPT-Live-1 ซึ่งเป็นโมเดลขนาดใหญ่กว่า

ก่อนหน้านี้ Advanced Voice Mode ทำงานผ่านระบบที่แยกโมเดลสำหรับแปลงเสียงเป็นข้อความ ประมวลผลภาษาและแปลงข้อความกลับเป็นเสียง ขณะที่ GPT-Live เป็นโมเดลรุ่นใหม่ที่ออกแบบมาให้การสนทนาตอบโต้เป็นธรรมชาติ

OpenAI ยังระบุว่า GPT-Live ถูกออกแบบมาให้รองรับการสนทนาที่นานขึ้น พร้อมมองว่าอนาคตเสียงจะกลายเป็นช่องทางหลักในการสั่งการคอมพิวเตอร์และทำงานร่วมกับ AI โดยเฉพาะในงานที่มีความซับซ้อนสูง 

การแข่งขันด้าน AI Voice เริ่มร้อนแรง

OpenAI ไม่ใช่รายเดียวที่กำลังพัฒนาผู้ช่วย AI ให้สนทนาได้เป็นธรรมชาติยิ่งขึ้น

ทั้ง Apple และ Amazon ต่างอัปเดตเครื่องมือของตัวเองให้เข้าใจบริบทการพูดคุยได้ดีขึ้น ขณะเดียวกันกลุ่มธุรกิจสตาร์ทอัพก็เริ่มส่งนวัตกรรมใหม่ ๆ เข้ามาแข่งขัน เช่น Monogram ที่กำลังพัฒนา AI ให้สามารถตอบกลับและแสดงผลในรูปแบบภาพเพื่อให้ผู้ใช้เข้าใจง่ายขึ้นหรือ Sesame ที่เปิดตัวผู้ช่วย AI ซึ่งสามารถสนทนาได้อย่างลื่นไหลควบคู่ไปกับการประมวลผลทำงานอื่น ๆ อยู่เบื้องหลังพร้อมกัน 

OpenAI ระบุว่า โมเดลใหม่นี้ได้รับการปรับแต่งให้รองรับภาษาที่มีผู้ใช้งานจำนวนมาก แต่ยังไม่ได้ระบุว่าครอบคลุมภาษาใดบ้าง

บริษัทยังย้ำว่า เป้าหมายของ GPT-Live ไม่ใช่การพัฒนา AI ให้เป็นเพื่อนคุย (AI Companion) พร้อมเพิ่มมาตรการด้านความปลอดภัย เช่น การตอบคำถามให้เหมาะสมกับช่วงวัยของผู้ใช้ และการแนะนำแหล่งความช่วยเหลือเมื่อบทสนทนาเกี่ยวข้องกับการทำร้ายตัวเอง

อ้างอิง: techcrunch

ลงทะเบียนเข้าสู่ระบบ เพื่ออ่านบทความฟรีไม่จำกัด

No comment

RELATED ARTICLE

Responsive image

15 ปีบนเส้นทาง AI ของ Apple: จากวันที่ Steve Jobs โทรหา Siri สู่ชิป M7 ที่เกิดจากซากโปรเจกต์รถหมื่นล้าน

ย้อนเส้นทาง AI ของ Apple 15 ปี ตั้งแต่ดีลซื้อ Siri ของ Steve Jobs เช็กข่าวลือ Siri ผลงานคนไทยกับคดีสิทธิบัตร 24.9 ล้านดอลลาร์ โปรเจกต์ Apple Car ที่ถูกพับ ดีล Gemini กับ Google จนถ...

Responsive image

เกาหลีใต้เตรียมโกยภาษีจาก AI เยอะที่สุดตั้งแต่ตั้งประเทศขึ้นมา กวาด 5 แสนล้านล้านวอน

เมื่ออนาคตของเกาหลีใต้แขวนอยู่กับ Samsung และ SK Hynix: เจาะลึกเบื้องหลังกำไร 600 ล้านล้านวอนจากชิป AI และยุทธศาสตร์การใช้งบประมาณครั้งใหญ่ที่สุดในประวัติศาสตร์ชาติ เพื่อเดิมพันอนา...

Responsive image

‘จมูกอิเล็กทรอนิกส์’ รุ่นใหม่ ดมกลิ่นเก่งเหมือนจมูกคน ให้ AI ถอดรหัสว่ากลิ่นอะไร ดมโรค ก๊าซพิษ และความสดของอาหารได้

ทีมวิจัย DGIST เกาหลีใต้ วางแผนที่พัฒนา 'จมูกอิเล็กทรอนิกส์' ที่ดมกลิ่นเหมือนจมูกคนแล้ววิเคราะห์ด้วย AI ใช้วัสดุพรุน MOF ที่ดัดแปลงได้ตามใจ ทำงานที่อุณหภูมิห้อง กินไฟต่ำ แยกกลิ่นได...