Google เปิดตัวโมเดลแปลงเสียง ‘Gemini 3.1 Flash TTS’ สั่ง AI กระซิบ ตะโกน เปลี่ยนอารมณ์ได้ทันที ด้วยแท็กเสียงกว่า 200 แบบ และ 70 ภาษา

นึกภาพว่าคุณกำลังสร้างแอปพลิเคชันที่ต้องใช้เสียง AI พากย์ ไม่ว่าจะเป็นหนังสือเสียง ระบบธนาคารอัตโนมัติ หรือเกมที่ต้องการเสียงบรรยายหลายอารมณ์ ปัญหาที่เจอมาตลอดคือเสียง AI มักฟังดู 'แบน' ควบคุมโทนได้จำกัด และเปลี่ยนอารมณ์กลางประโยคไม่ได้ Google กำลังจะเปลี่ยนเรื่องนี้

Google เปิดตัว Gemini 3.1 Flash TTS โมเดลแปลงข้อความเป็นเสียงพูด (Text-to-Speech) รุ่นล่าสุดบน Google AI Studio และ Vertex AI โดยจุดขายหลักไม่ใช่แค่เสียงที่เนียนขึ้น แต่คือระดับการควบคุมที่ละเอียดกว่าเดิมมาก ด้วยแท็กเสียง (Audio Tags) มากกว่า 200 แบบที่นักพัฒนาสามารถฝังลงไปในข้อความโดยตรงเพื่อกำหนดจังหวะ อารมณ์ และวิธีการพูดได้แบบทันที

เสียงที่ 'กำกับ' ได้เหมือนผู้กำกับหนัง

หัวใจของ Gemini 3.1 Flash TTS อยู่ที่ระบบแท็กเสียง (Audio Tags) ซึ่งทำงานคล้ายการเขียนบทให้นักพากย์ AI นักพัฒนาสามารถแทรกคำสั่งอย่าง [whispers], [happy] หรือ [slow] ลงไปตรงจุดที่ต้องการเปลี่ยนโทนเสียงได้เลย โดยสูตรการใช้งานคือ [pacing tag] + ข้อความ + [expressive tag] + ข้อความ + [pause tag] + ข้อความ เรียงต่อกันไปตามธรรมชาติของบทพูด

นอกจากแท็กเสียงแล้ว โมเดลยังรองรับเสียงสำเร็จรูป 30 แบบ ภาษามากกว่า 70 ภาษาพร้อมสำเนียงท้องถิ่น และสามารถใช้คำสั่งภาษาธรรมชาติ (Natural Language Instructions) กำหนดสไตล์เพิ่มเติมได้ เช่น สั่งให้พูดแบบผู้ประกาศข่าวมืออาชีพ หรือคุยแบบเพื่อนสนิท ทั้งหมดนี้ทำผ่านพรอมต์โดยไม่ต้องเขียนโค้ดเพิ่ม

เสียงที่สร้างจาก Gemini 3.1 Flash TTS จะถูกฝังลายน้ำดิจิทัล (SynthID) ซึ่งถักทอลงไปในไฟล์เสียงโดยตรง เพื่อให้สามารถระบุได้ว่าเสียงนั้นถูกสร้างโดย AI ถือเป็นการตอบโจทย์ด้าน AI ที่รับผิดชอบ (Responsible AI) ที่ Google พยายามผลักดันมาตลอด

ใครได้ประโยชน์

Google วางตำแหน่งโมเดลนี้ครอบคลุมหลายกรณีใช้งาน ตั้งแต่ฝั่งการเข้าถึง (Accessibility) เช่น การสร้างเสียงบรรยายสำหรับผู้พิการทางสายตาที่ต้องการโทนเสียงหลากหลาย ไปจนถึงฝั่งสร้างสรรค์อย่างหนังสือเสียงและเกม รวมถึงระบบองค์กรเช่น ศูนย์บริการลูกค้า (Contact Center) หรือระบบธนาคารที่ต้องการเสียงตอบรับอัตโนมัติแบบเป็นธรรมชาติ

สิ่งที่น่าจับตาคือ Google กำลังเปลี่ยนเกมการแปลงข้อความเป็นเสียงจาก 'เลือกเสียงแล้วปล่อยให้ AI พูด' ไปเป็น 'กำกับการแสดงของ AI ได้ทุกจังหวะ' การมีแท็กเสียงมากกว่า 200 แบบทำให้นักพัฒนามีอิสระในการออกแบบประสบการณ์เสียงที่ซับซ้อนได้มากขึ้น โดยไม่ต้องพึ่งการตัดต่อเสียงภายหลัง

แต่คำถามสำคัญคือ ในสนามที่ ElevenLabs, OpenAI และ Amazon Polly ต่างก็เร่งพัฒนาเทคโนโลยีแปลงข้อความเป็นเสียงอยู่เช่นกัน Gemini 3.1 Flash TTS จะสร้างความแตกต่างได้มากแค่ไหนในแง่คุณภาพเสียงจริง ไม่ใช่แค่ฟีเจอร์บนกระดาษ สิ่งที่ต้องรอดูคือเสียงตอบรับจากนักพัฒนาที่เอาไปใช้งานจริงในภาษาที่ไม่ใช่ภาษาอังกฤษ โดยเฉพาะภาษาไทยที่มีระบบวรรณยุกต์ซับซ้อน ซึ่งเป็นจุดที่เทคโนโลยีแปลงข้อความเป็นเสียงหลายเจ้ายังทำได้ไม่ดีนัก

ปัจจุบัน Gemini 3.1 Flash TTS เปิดให้ใช้งานแบบตัวอย่างสาธารณะ (Public Preview) บน Google AI Studio และ Vertex AI แล้ว

ที่มา: Google Cloud Blog

ลงทะเบียนเข้าสู่ระบบ เพื่ออ่านบทความฟรีไม่จำกัด

No comment

RELATED ARTICLE

Responsive image

CLICX ธนาคารไร้สาขาแห่งแรกของไทยเปิดแล้ว ประกาศดอกเบี้ยสูงสุด 4%

CLICX ธนาคารไร้สาขาแห่งแรกของไทยเปิดตัวอย่างเป็นทางการ! ชวนเปิดพ็อกเก็ต CLICX Save Max 4%...

Responsive image

เปิดฉาก Manufacturing Expo 2026 ส่องนวัตกรรมอัจฉริยะ ลดต้นทุน-เพิ่มผลผลิต

อาร์เอ็กซ์ ไบเทค เปิดงานแสดงเทคโนโลยีและเครื่องจักรกลอุตสาหกรรม Manufacturing Expo 2026 ระหว่างวันที่ 17–20 มิถุนายน 2569 ณ ศูนย์นิทรรศการและการประชุมไบเทค บางนา โดยรวบรวมเครื่องจั...

Responsive image

20 อินไซต์สำคัญ คนทำธุรกิจบน IG ต้องรู้ ไม่มีคลิป Reels = ไวรัลยาก สรุปจาก Instagram Press Luncheon 2026

สรุป 20 อินไซต์จาก Meta ล่าสุด ทำไม Instagram ถึงเป็นเครื่องจักรปั๊มยอดขาย ไม่ใช่แค่แอปของเด็กวัยรุ่นอีกต่อไป SME ต้องรู้อัปเดตเทรนด์ IG 2026 ด่วนก่อนโดนคู่แข่งแย่งลูกค้า...