OpenAI เปิดตัว GPT-Live-1 โมเดลเสียง AI รุ่นใหม่ ฟังและพูดได้พร้อมกัน แปลภาษาได้เรียลไทม์

OpenAI เปิดตัว GPT-Live-1

OpenAI เปิดตัวโมเดล AI เสียงรุ่นใหม่ GPT-Live-1 และ GPT-Live-1 mini ที่ออกแบบมาให้การพูดคุยกับ AI เป็นธรรมชาติมากขึ้น โดยสามารถฟังและพูดได้พร้อมกัน ทำให้ผู้ใช้พูดแทรกได้เหมือนคุยกับคนจริง อีกทั้งยังรองรับฟีเจอร์อย่างการแปลภาษาแบบเรียลไทม์ และเชื่อมต่อกับโมเดลภาษาอย่าง GPT-5.5 เพื่อช่วยตอบคำถามที่ซับซ้อนมากขึ้น

ฟังและพูดได้พร้อมกัน 

จุดเด่นของ GPT-Live คือการเป็นโมเดลแบบ Full-Duplex ที่สามารถฟังและพูดได้ในเวลาเดียวกันต่างจากระบบเดิมที่ต้องรอให้ผู้ใช้พูดจบก่อนจึงเริ่มตอบ ทำให้การสนทนาลื่นไหลขึ้น ผู้ใช้สามารถพูดแทรก เปลี่ยนเรื่อง หรือหยุด AI ระหว่างพูดได้ตามธรรมชาติ

OpenAI ระบุว่าโมเดลใหม่นี้จะช่วยแก้ปัญหาที่พบในระบบเดิม อย่างเช่น AI พูดแทรกขณะที่ผู้ใช้ยังพูดไม่จบหรือมีความสามารถในการตอบคำถามที่ยังไม่เพียงพอ

สามารถเชื่อม GPT-5.5 เพื่อช่วยตอบคำถามที่ซับซ้อน

เมื่อผู้ใช้ถามคำถามที่ต้องอาศัยการค้นหาข้อมูล การใช้เหตุผล หรือความสามารถแบบ AI Agent ระบบจะส่งคำขอไปยังโมเดลภาษาอย่าง GPT-5.5 แล้วนำคำตอบกลับมาสนทนาต่อโดยไม่ทำให้บทสนทนาสะดุด ซึ่งได้สาธิตว่า GPT-Live สามารถเงียบเพื่อฟังผู้ใช้ต่อเนื่องเป็นเวลานานจนกว่าจะถึงจังหวะที่เหมาะสมในการตอบ 

ChatGPT จะเปลี่ยนมาใช้ GPT-Live เป็นค่าเริ่มต้น

OpenAI จะเปลี่ยนโหมดเสียงของ ChatGPT จาก Advanced Voice Mode มาใช้ GPT-Live-1 mini เป็นค่าเริ่มต้น ส่วนผู้ใช้แพ็กเกจแบบชำระเงินจะสามารถใช้งาน GPT-Live-1 ซึ่งเป็นโมเดลขนาดใหญ่กว่า

ก่อนหน้านี้ Advanced Voice Mode ทำงานผ่านระบบที่แยกโมเดลสำหรับแปลงเสียงเป็นข้อความ ประมวลผลภาษาและแปลงข้อความกลับเป็นเสียง ขณะที่ GPT-Live เป็นโมเดลรุ่นใหม่ที่ออกแบบมาให้การสนทนาตอบโต้เป็นธรรมชาติ

OpenAI ยังระบุว่า GPT-Live ถูกออกแบบมาให้รองรับการสนทนาที่นานขึ้น พร้อมมองว่าอนาคตเสียงจะกลายเป็นช่องทางหลักในการสั่งการคอมพิวเตอร์และทำงานร่วมกับ AI โดยเฉพาะในงานที่มีความซับซ้อนสูง 

การแข่งขันด้าน AI Voice เริ่มร้อนแรง

OpenAI ไม่ใช่รายเดียวที่กำลังพัฒนาผู้ช่วย AI ให้สนทนาได้เป็นธรรมชาติยิ่งขึ้น

ทั้ง Apple และ Amazon ต่างอัปเดตเครื่องมือของตัวเองให้เข้าใจบริบทการพูดคุยได้ดีขึ้น ขณะเดียวกันกลุ่มธุรกิจสตาร์ทอัพก็เริ่มส่งนวัตกรรมใหม่ ๆ เข้ามาแข่งขัน เช่น Monogram ที่กำลังพัฒนา AI ให้สามารถตอบกลับและแสดงผลในรูปแบบภาพเพื่อให้ผู้ใช้เข้าใจง่ายขึ้นหรือ Sesame ที่เปิดตัวผู้ช่วย AI ซึ่งสามารถสนทนาได้อย่างลื่นไหลควบคู่ไปกับการประมวลผลทำงานอื่น ๆ อยู่เบื้องหลังพร้อมกัน 

OpenAI ระบุว่า โมเดลใหม่นี้ได้รับการปรับแต่งให้รองรับภาษาที่มีผู้ใช้งานจำนวนมาก แต่ยังไม่ได้ระบุว่าครอบคลุมภาษาใดบ้าง

บริษัทยังย้ำว่า เป้าหมายของ GPT-Live ไม่ใช่การพัฒนา AI ให้เป็นเพื่อนคุย (AI Companion) พร้อมเพิ่มมาตรการด้านความปลอดภัย เช่น การตอบคำถามให้เหมาะสมกับช่วงวัยของผู้ใช้ และการแนะนำแหล่งความช่วยเหลือเมื่อบทสนทนาเกี่ยวข้องกับการทำร้ายตัวเอง

อ้างอิง: techcrunch

ลงทะเบียนเข้าสู่ระบบ เพื่ออ่านบทความฟรีไม่จำกัด

No comment

RELATED ARTICLE

Responsive image

Dario ชี้ คนไม่ได้กลัว AI แต่เริ่มไม่ไว้ใจ สะท้อน ‘วิกฤตความเชื่อมั่น’ ต่อเทคโนโลยี

กระแสต่อต้าน AI ในสหรัฐอเมริกากำลังกลายเป็นโจทย์ใหญ่ที่บริษัทเทคโนโลยีหลีกเลี่ยงไม่ได้ มีตั้งแต่การออกมาประท้วงไม่ให้สร้าง Data Center ไปจนถึงการเรียกร้องให้รัฐบาลเข้ามาคุมเข้มเทคโ...

Responsive image

4 ทักษะ AI Engineering ที่คนสายเทคต้องมี สรุปจาก Andrew Ng

สรุป 4 ทักษะสำคัญในแผนที่ AI Engineering Skills Map จาก Andrew Ng วิเคราะห์จากประกาศงาน 10,000+ ตำแหน่ง โปรแกรมเมอร์และนักพัฒนาสายเทคยุคใหม่ต้องมี...

Responsive image

Cursor เปิดตัว ‘Origin’ แพลตฟอร์มโฮสต์โค้ดยุค AI Agent เก็บโค้ด รีวิว รวมงาน ครบในที่เดียว

Cursor เปิดตัว Origin แพลตฟอร์มโฮสต์โค้ดที่สร้างมาเพื่อยุค AI Agent หลังปิดดีล SpaceX 6 หมื่นล้านดอลลาร์เพียง 3 วัน รองรับคลังโค้ด คำขอรวมโค้ด และซิงก์สองทางกับ GitHub เปิดให้ใช้แล...