Google เปิดตัวโมเดลแปลงเสียง ‘Gemini 3.1 Flash TTS’ สั่ง AI กระซิบ ตะโกน เปลี่ยนอารมณ์ได้ทันที ด้วยแท็กเสียงกว่า 200 แบบ และ 70 ภาษา

นึกภาพว่าคุณกำลังสร้างแอปพลิเคชันที่ต้องใช้เสียง AI พากย์ ไม่ว่าจะเป็นหนังสือเสียง ระบบธนาคารอัตโนมัติ หรือเกมที่ต้องการเสียงบรรยายหลายอารมณ์ ปัญหาที่เจอมาตลอดคือเสียง AI มักฟังดู 'แบน' ควบคุมโทนได้จำกัด และเปลี่ยนอารมณ์กลางประโยคไม่ได้ Google กำลังจะเปลี่ยนเรื่องนี้

Google เปิดตัว Gemini 3.1 Flash TTS โมเดลแปลงข้อความเป็นเสียงพูด (Text-to-Speech) รุ่นล่าสุดบน Google AI Studio และ Vertex AI โดยจุดขายหลักไม่ใช่แค่เสียงที่เนียนขึ้น แต่คือระดับการควบคุมที่ละเอียดกว่าเดิมมาก ด้วยแท็กเสียง (Audio Tags) มากกว่า 200 แบบที่นักพัฒนาสามารถฝังลงไปในข้อความโดยตรงเพื่อกำหนดจังหวะ อารมณ์ และวิธีการพูดได้แบบทันที

เสียงที่ 'กำกับ' ได้เหมือนผู้กำกับหนัง

หัวใจของ Gemini 3.1 Flash TTS อยู่ที่ระบบแท็กเสียง (Audio Tags) ซึ่งทำงานคล้ายการเขียนบทให้นักพากย์ AI นักพัฒนาสามารถแทรกคำสั่งอย่าง [whispers], [happy] หรือ [slow] ลงไปตรงจุดที่ต้องการเปลี่ยนโทนเสียงได้เลย โดยสูตรการใช้งานคือ [pacing tag] + ข้อความ + [expressive tag] + ข้อความ + [pause tag] + ข้อความ เรียงต่อกันไปตามธรรมชาติของบทพูด

นอกจากแท็กเสียงแล้ว โมเดลยังรองรับเสียงสำเร็จรูป 30 แบบ ภาษามากกว่า 70 ภาษาพร้อมสำเนียงท้องถิ่น และสามารถใช้คำสั่งภาษาธรรมชาติ (Natural Language Instructions) กำหนดสไตล์เพิ่มเติมได้ เช่น สั่งให้พูดแบบผู้ประกาศข่าวมืออาชีพ หรือคุยแบบเพื่อนสนิท ทั้งหมดนี้ทำผ่านพรอมต์โดยไม่ต้องเขียนโค้ดเพิ่ม

เสียงที่สร้างจาก Gemini 3.1 Flash TTS จะถูกฝังลายน้ำดิจิทัล (SynthID) ซึ่งถักทอลงไปในไฟล์เสียงโดยตรง เพื่อให้สามารถระบุได้ว่าเสียงนั้นถูกสร้างโดย AI ถือเป็นการตอบโจทย์ด้าน AI ที่รับผิดชอบ (Responsible AI) ที่ Google พยายามผลักดันมาตลอด

ใครได้ประโยชน์

Google วางตำแหน่งโมเดลนี้ครอบคลุมหลายกรณีใช้งาน ตั้งแต่ฝั่งการเข้าถึง (Accessibility) เช่น การสร้างเสียงบรรยายสำหรับผู้พิการทางสายตาที่ต้องการโทนเสียงหลากหลาย ไปจนถึงฝั่งสร้างสรรค์อย่างหนังสือเสียงและเกม รวมถึงระบบองค์กรเช่น ศูนย์บริการลูกค้า (Contact Center) หรือระบบธนาคารที่ต้องการเสียงตอบรับอัตโนมัติแบบเป็นธรรมชาติ

สิ่งที่น่าจับตาคือ Google กำลังเปลี่ยนเกมการแปลงข้อความเป็นเสียงจาก 'เลือกเสียงแล้วปล่อยให้ AI พูด' ไปเป็น 'กำกับการแสดงของ AI ได้ทุกจังหวะ' การมีแท็กเสียงมากกว่า 200 แบบทำให้นักพัฒนามีอิสระในการออกแบบประสบการณ์เสียงที่ซับซ้อนได้มากขึ้น โดยไม่ต้องพึ่งการตัดต่อเสียงภายหลัง

แต่คำถามสำคัญคือ ในสนามที่ ElevenLabs, OpenAI และ Amazon Polly ต่างก็เร่งพัฒนาเทคโนโลยีแปลงข้อความเป็นเสียงอยู่เช่นกัน Gemini 3.1 Flash TTS จะสร้างความแตกต่างได้มากแค่ไหนในแง่คุณภาพเสียงจริง ไม่ใช่แค่ฟีเจอร์บนกระดาษ สิ่งที่ต้องรอดูคือเสียงตอบรับจากนักพัฒนาที่เอาไปใช้งานจริงในภาษาที่ไม่ใช่ภาษาอังกฤษ โดยเฉพาะภาษาไทยที่มีระบบวรรณยุกต์ซับซ้อน ซึ่งเป็นจุดที่เทคโนโลยีแปลงข้อความเป็นเสียงหลายเจ้ายังทำได้ไม่ดีนัก

ปัจจุบัน Gemini 3.1 Flash TTS เปิดให้ใช้งานแบบตัวอย่างสาธารณะ (Public Preview) บน Google AI Studio และ Vertex AI แล้ว

ที่มา: Google Cloud Blog

ลงทะเบียนเข้าสู่ระบบ เพื่ออ่านบทความฟรีไม่จำกัด

No comment

RELATED ARTICLE

Responsive image

สรุป Layoffs สัปดาห์นี้ Snap ปลด 1,000 คนเพราะ AI, Disney ปลดพัน, BBC ลด 2,000 ตำแหน่ง

Snap ปลด 1,000 คน อ้าง AI เขียนโค้ดแทนได้ 65% Disney CEO ใหม่ปลดพันตำแหน่งเดือนแรก BBC ลดคน 2,000 ครั้งใหญ่สุดรอบ 15 ปี สรุปครบทุกรายละเอียด...

Responsive image

รู้จัก Hermes Agent เมื่อ AI ยิ่งใช้ยิ่งฉลาด ปรับปรุง Skills ได้เอง คู่แข่งคนใหม่ OpenClaw

ลองนึกภาพผู้ช่วย AI ที่ทุกครั้งที่เราสั่งงาน มันไม่ได้แค่ทำแล้วจบ แต่จดจำวิธีการทำงานนั้นไว้ สร้างเป็น 'skill' ที่เรียกใช้ได้ทันที และครั้งต่อไปมันจะทำได้ดีกว่าเดิม นี่คือสิ่งที...

Responsive image

อ.เชน เปิด 8 ยุทธศาสตร์ อว. พลิกไทยสู่ประเทศรายได้สูง

กระทรวงการอุดมศึกษา วิทยาศาสตร์ วิจัยและนวัตกรรม (อว.) เปิดฉากแถลงนโยบายอย่างเป็นทางการครั้งแรก โดยมี ศ.ดร.ยศชนัน วงศ์สวัสดิ์ รองนายกรัฐมนตรีและรัฐมนตรีว่าการกระทรวง อว. เป็นประธาน...