OpenAI เปิดตัว GPT-Live-1 โมเดลเสียง AI รุ่นใหม่ ฟังและพูดได้พร้อมกัน แปลภาษาได้เรียลไทม์

OpenAI เปิดตัว GPT-Live-1

OpenAI เปิดตัวโมเดล AI เสียงรุ่นใหม่ GPT-Live-1 และ GPT-Live-1 mini ที่ออกแบบมาให้การพูดคุยกับ AI เป็นธรรมชาติมากขึ้น โดยสามารถฟังและพูดได้พร้อมกัน ทำให้ผู้ใช้พูดแทรกได้เหมือนคุยกับคนจริง อีกทั้งยังรองรับฟีเจอร์อย่างการแปลภาษาแบบเรียลไทม์ และเชื่อมต่อกับโมเดลภาษาอย่าง GPT-5.5 เพื่อช่วยตอบคำถามที่ซับซ้อนมากขึ้น

ฟังและพูดได้พร้อมกัน 

จุดเด่นของ GPT-Live คือการเป็นโมเดลแบบ Full-Duplex ที่สามารถฟังและพูดได้ในเวลาเดียวกันต่างจากระบบเดิมที่ต้องรอให้ผู้ใช้พูดจบก่อนจึงเริ่มตอบ ทำให้การสนทนาลื่นไหลขึ้น ผู้ใช้สามารถพูดแทรก เปลี่ยนเรื่อง หรือหยุด AI ระหว่างพูดได้ตามธรรมชาติ

OpenAI ระบุว่าโมเดลใหม่นี้จะช่วยแก้ปัญหาที่พบในระบบเดิม อย่างเช่น AI พูดแทรกขณะที่ผู้ใช้ยังพูดไม่จบหรือมีความสามารถในการตอบคำถามที่ยังไม่เพียงพอ

สามารถเชื่อม GPT-5.5 เพื่อช่วยตอบคำถามที่ซับซ้อน

เมื่อผู้ใช้ถามคำถามที่ต้องอาศัยการค้นหาข้อมูล การใช้เหตุผล หรือความสามารถแบบ AI Agent ระบบจะส่งคำขอไปยังโมเดลภาษาอย่าง GPT-5.5 แล้วนำคำตอบกลับมาสนทนาต่อโดยไม่ทำให้บทสนทนาสะดุด ซึ่งได้สาธิตว่า GPT-Live สามารถเงียบเพื่อฟังผู้ใช้ต่อเนื่องเป็นเวลานานจนกว่าจะถึงจังหวะที่เหมาะสมในการตอบ 

ChatGPT จะเปลี่ยนมาใช้ GPT-Live เป็นค่าเริ่มต้น

OpenAI จะเปลี่ยนโหมดเสียงของ ChatGPT จาก Advanced Voice Mode มาใช้ GPT-Live-1 mini เป็นค่าเริ่มต้น ส่วนผู้ใช้แพ็กเกจแบบชำระเงินจะสามารถใช้งาน GPT-Live-1 ซึ่งเป็นโมเดลขนาดใหญ่กว่า

ก่อนหน้านี้ Advanced Voice Mode ทำงานผ่านระบบที่แยกโมเดลสำหรับแปลงเสียงเป็นข้อความ ประมวลผลภาษาและแปลงข้อความกลับเป็นเสียง ขณะที่ GPT-Live เป็นโมเดลรุ่นใหม่ที่ออกแบบมาให้การสนทนาตอบโต้เป็นธรรมชาติ

OpenAI ยังระบุว่า GPT-Live ถูกออกแบบมาให้รองรับการสนทนาที่นานขึ้น พร้อมมองว่าอนาคตเสียงจะกลายเป็นช่องทางหลักในการสั่งการคอมพิวเตอร์และทำงานร่วมกับ AI โดยเฉพาะในงานที่มีความซับซ้อนสูง 

การแข่งขันด้าน AI Voice เริ่มร้อนแรง

OpenAI ไม่ใช่รายเดียวที่กำลังพัฒนาผู้ช่วย AI ให้สนทนาได้เป็นธรรมชาติยิ่งขึ้น

ทั้ง Apple และ Amazon ต่างอัปเดตเครื่องมือของตัวเองให้เข้าใจบริบทการพูดคุยได้ดีขึ้น ขณะเดียวกันกลุ่มธุรกิจสตาร์ทอัพก็เริ่มส่งนวัตกรรมใหม่ ๆ เข้ามาแข่งขัน เช่น Monogram ที่กำลังพัฒนา AI ให้สามารถตอบกลับและแสดงผลในรูปแบบภาพเพื่อให้ผู้ใช้เข้าใจง่ายขึ้นหรือ Sesame ที่เปิดตัวผู้ช่วย AI ซึ่งสามารถสนทนาได้อย่างลื่นไหลควบคู่ไปกับการประมวลผลทำงานอื่น ๆ อยู่เบื้องหลังพร้อมกัน 

OpenAI ระบุว่า โมเดลใหม่นี้ได้รับการปรับแต่งให้รองรับภาษาที่มีผู้ใช้งานจำนวนมาก แต่ยังไม่ได้ระบุว่าครอบคลุมภาษาใดบ้าง

บริษัทยังย้ำว่า เป้าหมายของ GPT-Live ไม่ใช่การพัฒนา AI ให้เป็นเพื่อนคุย (AI Companion) พร้อมเพิ่มมาตรการด้านความปลอดภัย เช่น การตอบคำถามให้เหมาะสมกับช่วงวัยของผู้ใช้ และการแนะนำแหล่งความช่วยเหลือเมื่อบทสนทนาเกี่ยวข้องกับการทำร้ายตัวเอง

อ้างอิง: techcrunch

ลงทะเบียนเข้าสู่ระบบ เพื่ออ่านบทความฟรีไม่จำกัด

No comment

RELATED ARTICLE

Responsive image

จีนทำสหรัฐฯ แบ่งเป็น ศึกสามก๊ก AI อเมริกา หลังปล่อย Kimi K3 ก๊อปเกรด A จนทำเนียบขาวตื่นตระหนก

สรุปดราม่า AI เมื่อจีนใช้เทคนิค Distillation ดึงความฉลาดจากโมเดลอเมริกัน จนกลายเป็นชนวนเหตุจุดศึกสามก๊กในสหรัฐฯ ระหว่างทำเนียบขาว ค่ายชิป และแล็บ AI...

Responsive image

1,319 คนในบริษัท AI ระดับโลก ร่วมลงนาม Pacing the Frontier เรียกร้องชะลอการพัฒนา AI

พนักงานจากบริษัท AI แนวหน้าของโลกกว่า 1,293 คน ทั้งจาก OpenAI, Google, Meta, Anthropic, Microsoft, Amazon และอีกหลายบริษัท ร่วมลงชื่อในแถลงการณ์ ‘Pacing the Frontier’...

Responsive image

Thinking Machines Lab เปิดตัว ‘Inkling-Small‘ Open-Weight 276 พันล้านพารามิเตอร์ ให้เหตุผล + เขียนโค้ดเก่งแซงรุ่นพี่ Inkling

Thinking Machines Lab ของ Mira Murati เปิดตัว Inkling-Small โมเดล Open-weight ขนาด 276 พันล้านพารามิเตอร์ ที่เล็กลง 4 เท่าแต่ทำเหตุผลและเขียนโค้ดแซงรุ่นพี่ Inkling พร้อมความสามารถ ...