Google DeepMind เปิดตัว SL2T โมเดล AI แปลภาษามือเป็นข้อความ

Google DeepMind เปิดตัว SL2T โมเดล AI ที่แปลภาษามือออกมาเป็นข้อความได้โดยตรง พร้อมพาเทคโนโลยีสายนี้ออกจากห้องทดลองมาอยู่ในมือผู้ใช้จริงเป็นครั้งแรก ผ่านฟีเจอร์ป้อนข้อความด้วยภาษามือบนคีย์บอร์ด Gboard และแอปพลิเคชันถอดข้อความแบบเรียลไทม์ Live Transcribe เริ่มต้นบนมือถือตระกูล Pixel 11 โดยรองรับการแปลภาษามืออเมริกัน (American Sign Language หรือ ASL) เป็นภาษาอังกฤษ และไม่มีค่าใช้จ่ายเพิ่ม ตามที่ Google DeepMind ประกาศบนบล็อกของทีมวิจัย

SL2T ย่อมาจาก Sign-Language-to-Text หมายถึงโมเดลที่รับภาษามือเป็นอินพุตแล้วส่งข้อความออกมาแบบต่อเนื่อง หลักการใช้งานคล้ายกับที่คนทั่วไปกดปุ่มไมโครโฟนแล้วพูดแทนการพิมพ์ ต่างกันตรงที่ผู้ใช้ยกมือทำภาษามือใส่กล้องหน้าแทน จากนั้นข้อความจะไปโผล่ในช่องพิมพ์ที่เปิดค้างไว้ ไม่ว่าจะเป็นช่องค้นหาบนเว็บ ช่องแชต เอกสาร หรือช่องสั่งงาน Gemini ส่วนใน Live Transcribe ผู้ใช้ที่หูหนวกสามารถทำภาษามือตอบกลับคู่สนทนาได้ทันที แทนที่จะต้องสลับไปพิมพ์กลับไปกลับมา ซึ่งกลุ่มผู้ทดสอบให้ความเห็นตรงกันว่าการทำภาษามือเร็วกว่า เป็นธรรมชาติกว่า และรู้สึกดีกว่าการพิมพ์เป็นภาษาอังกฤษ

ความสำคัญของก้าวนี้อยู่ตรงที่ AI เรียนรู้ภาษาพูดจนเก่งขึ้นมหาศาลตลอดหลายสิบปีที่ผ่านมา ทั้งการแปลอัตโนมัติ การถอดเสียงเป็นข้อความ และผู้ช่วยสนทนาที่ลื่นไหลจนแทบไม่รู้สึกถึงเทคโนโลยี แต่คลื่นความก้าวหน้าลูกนี้กลับไปไม่ถึงภาษามือกว่า 200 ภาษาทั่วโลก และไปไม่ถึงคนหูหนวกกับผู้ที่มีความบกพร่องทางการได้ยินราว 70 ล้านคนที่ใช้ภาษาเหล่านั้นเป็นภาษาหลัก ตัวเลขนี้ยังเป็นเพียงส่วนหนึ่งของภาพใหญ่ เพราะข้อมูลจาก องค์การอนามัยโลก (World Health Organization หรือ WHO) ชี้ว่ามีประชากรโลกกว่า 1,500 ล้านคนที่มีภาวะสูญเสียการได้ยินในระดับใดระดับหนึ่ง

ทำไมภาษามือถึงเป็นโจทย์ที่ AI แก้ไม่ตกมานาน

ภาษามือคือภาษาหลักของชุมชนคนหูหนวกทั่วโลก และเป็นแกนกลางของอัตลักษณ์ทางวัฒนธรรมของคนกลุ่มนี้ ความเข้าใจผิดที่พบบ่อยที่สุดคือการมองว่าภาษามือเป็นเพียงการเอาคำในภาษาพูดมาแปลงเป็นท่ามือทีละคำ ซึ่งไม่จริง เพราะภาษามือแต่ละภาษาเป็นภาษาธรรมชาติที่มีไวยากรณ์และคลังคำของตัวเอง แยกขาดจากภาษาพูดในประเทศนั้นโดยสิ้นเชิง

จุดนี้ทำให้โจทย์ของ SL2T ต่างจากการถอดเสียงพูดเป็นข้อความอย่างชัดเจน การถอดเสียงคือการจับคู่เสียงกับตัวอักษรในภาษาเดียวกันตามลำดับเวลา แต่ภาษามือต้องอาศัยการแปลภาษาด้วยเครื่อง (Machine Translation) แบบเต็มรูปแบบ ไม่ใช่การไล่แปลงท่ามือเป็นคำทีละท่า

โจทย์ข้อที่สองหนักกว่านั้น เพราะโมเดลต้องเรียนรู้ที่จะมองเห็นและเข้าใจการเคลื่อนไหวของร่างกายจริงๆ ภาษามือสื่อความหมายผ่านการขยับมือ แขน ลำตัว ศีรษะ และสีหน้าไปพร้อมกันในเวลาเดียว การติดตามทุกองค์ประกอบเหล่านี้ที่อัตราเฟรมสูงจึงเป็นงานด้านการมองเห็นของคอมพิวเตอร์ (Computer Vision) ที่ยากและกินทรัพยากรประมวลผลมหาศาล

เมื่อเห็นภาพนี้แล้วก็เข้าใจได้ไม่ยากว่าทำไมความพยายามยุคแรกอย่างถุงมือแปลภาษามือถึงไปไม่ถึงฝัน เพราะอุปกรณ์เหล่านั้นตั้งอยู่บนสมมติฐานที่ผิดตั้งแต่ต้นว่าภาษามือคือภาษาอังกฤษที่ย้ายไปอยู่บนมือ ทั้งที่ของจริงต้องการทั้งการรับรู้ภาพระดับละเอียดทั่วทั้งร่างกายและการแปลภาษาเต็มขั้น ซึ่งเป็นสองอย่างที่ SL2T ถูกออกแบบมาให้ทำพร้อมกัน

100,000 ชั่วโมง 50 ภาษา เบื้องหลังการฝึกโมเดล

ทีมวิจัยฝึก SL2T ด้วยข้อมูลภาษามือมากกว่า 100,000 ชั่วโมง ครอบคลุมภาษามือกว่า 50 ภาษา โดยราวหนึ่งในสี่ของข้อมูลทั้งหมดเป็นภาษามืออเมริกัน ตามรายละเอียดที่ SiliconANGLE รายงาน

สิ่งที่น่าสนใจคือการฝึกรวมหลายภาษา หลายสำเนียงถิ่น และหลายระดับความคล่องเข้าด้วยกัน กลับให้ผลดีกว่าการฝึกแยกทีละภาษา เพราะโมเดลได้เรียนรู้โครงสร้างร่วมที่ซ่อนอยู่เบื้องหลังภาษามือเหล่านั้น ผลการทดลองของทีมยืนยันว่าโมเดลหลายภาษาทำคะแนนชนะโมเดลภาษาเดียวอย่างชัดเจน

อีกการตัดสินใจที่เปลี่ยนเกมคือการเลิกใช้คำกำกับความหมาย (Glosses) ซึ่งเป็นการเขียนคำกำกับท่ามือแต่ละท่าเอาไว้เป็นขั้นกลางก่อนแปลเป็นประโยค วิธีนี้ถูกใช้กันแพร่หลายในงานวิจัยยุคก่อน แต่มีข้อจำกัดตรงที่เก็บรายละเอียดสำคัญของภาษามือไม่ได้ ทั้งสัญญาณที่ไม่ได้ใช้มือ (Non-manual Markers) อย่างสีหน้าและการเอียงศีรษะ และการใช้พื้นที่รอบตัวสื่อความหมาย (Spatial Constructions) SL2T จึงเลือกแปลจากพิกัดจุดบนร่างกายไปเป็นข้อความโดยตรง ผลที่ตามมาคือไม่มีเพดานคลังคำที่ถูกกำหนดไว้ล่วงหน้าอีกต่อไป และคุณภาพงานแปลจะดีขึ้นตามปริมาณข้อมูลที่ป้อนเข้าไป

วิดีโอไม่ออกจากเครื่อง ความเป็นส่วนตัวที่ออกแบบมาตั้งแต่ต้น

ประเด็นที่หลายคนน่าจะกังวลที่สุดเมื่อได้ยินคำว่ากล้องหน้ากับคลาวด์อยู่ในประโยคเดียวกัน คือภาพวิดีโอของตัวเองจะถูกส่งไปไหน คำตอบของ Google DeepMind คือ SL2T ไม่เคยเห็นภาพวิดีโอดิบเลยแม้แต่เฟรมเดียว

กลไกที่ทำให้เป็นแบบนั้นคือโมเดลที่ทำงานบนเครื่องชื่อ MediaPipe Holistic ซึ่งทำหน้าที่ติดตามจุดอ้างอิงบนร่างกาย (Pose Landmark) ของผู้ใช้ ทั้งบนใบหน้า มือ แขน และลำตัว แล้วส่งเฉพาะพิกัดเชิงเรขาคณิตของจุดเหล่านั้นขึ้นไปให้เซิร์ฟเวอร์แปล ส่วนวิดีโอต้นฉบับถูกทิ้งทันทีตั้งแต่บนเครื่อง เว็บไซต์ Interesting Engineering อธิบายว่าแนวทางนี้ให้ผลดีสองต่อ คือทั้งลดความเสี่ยงด้านความเป็นส่วนตัวและลดปริมาณข้อมูลที่ต้องส่งผ่านเครือข่าย ทำให้ระบบตอบสนองได้เร็วขึ้นด้วย

70 คะแนน BLEURT สถิติใหม่ที่ยังต้องผ่านด่านโลกจริง

ในเชิงตัวเลข SL2T คือโมเดลแปลภาษามือที่เก่งที่สุดเท่าที่มีมา วัดจากชุดทดสอบมาตรฐานอย่าง FLEURS-ASL ที่ใช้ประเมินคุณภาพการแปลภาษามืออเมริกันเป็นภาษาอังกฤษ โดยทำคะแนนได้ 70 BLEURT ซึ่งเป็นมาตรวัดคุณภาพงานแปลที่ให้ AI ประเมินความใกล้เคียงทางความหมายกับคำแปลอ้างอิง ตัวเลขนี้สูงกว่าสถิติที่เคยมีรายงานมาก่อนอย่างมีนัยสำคัญ และเป็นคะแนนแบบ Zero-shot คือได้มาโดยที่โมเดลไม่เคยฝึกกับชุดข้อมูลทดสอบนั้นมาก่อน

แต่ทีมวิจัยเองก็ยอมรับว่าคะแนนสอบในสนามวิชาการไม่ได้แปลว่าใช้งานจริงแล้วจะดี งานหนักอีกส่วนจึงไปลงที่โจทย์เชิงปฏิบัติ ทั้งการลดความหน่วงของการแปลแบบต่อเนื่อง การป้องกันอาการหลอนที่โมเดลสร้างข้อความขึ้นมาเองทั้งที่ผู้ใช้ไม่ได้ทำภาษามือ การดูแลความเป็นธรรมให้ผู้ใช้ถนัดซ้ายซึ่งมีอยู่ราว 10% ของผู้ใช้ภาษามือทั้งหมด ไปจนถึงการรีดประสิทธิภาพสำหรับการทำภาษามือด้วยมือข้างเดียว ซึ่งเป็นสถานการณ์ที่เกิดขึ้นจริงตลอดเวลาเมื่ออีกมือกำลังถือโทรศัพท์อยู่

ข้อจำกัดที่เหลืออยู่ก็ถูกเปิดเผยตรงไปตรงมา จากตัวอย่างในชุดทดสอบ FLEURS-ASL โมเดลแปลประโยคยาวที่มีเนื้อหาซับซ้อนออกมาเป็นภาษาอังกฤษที่ลื่นไหลได้ดี แต่ยังพลาดในบางกรณี เช่น ท่ามือที่พบไม่บ่อย การสะกดนิ้วมือ (Fingerspelling) ที่ทำเร็วมากจนคำเพี้ยน ประโยคที่ใช้โครงสร้างแบบถูกกระทำ การบรรยายรูปร่างสิ่งของด้วยมือที่บางรายละเอียดหล่นหาย และการเดารูปกาลเวลาผิดเมื่อไม่มีบริบทมากพอ

สร้างเทคโนโลยีร่วมกับชุมชนคนหูหนวก ไม่ใช่สร้างให้

แนวคิดที่ทีมย้ำตลอดทั้งโครงการคือการสร้างร่วมกับชุมชนคนหูหนวก ไม่ใช่สร้างให้เฉยๆ มุมมองของคนหูหนวกเข้ามามีบทบาทตั้งแต่ขั้นตั้งไข่ไอเดีย ซึ่งมาจาก Sam Sepah พนักงาน Google ที่หูหนวก ต่อเนื่องไปถึงการเก็บข้อมูลร่วมกับพันธมิตรที่เป็นคนหูหนวก การประเมินผลผ่านการศึกษาผู้ใช้ที่หูหนวก และการประเมินผลกระทบของเทคโนโลยีร่วมกับผู้เชี่ยวชาญที่หูหนวก

เพื่อวางกรอบการนำไปใช้จริงอย่างรับผิดชอบ Google DeepMind ยังตั้งคณะกรรมการที่ปรึกษาด้าน AI สำหรับภาษามือ (AI Sign Language Advisory Committee หรือ AISLAC) ที่รวมองค์กรคนหูหนวกระดับโลกและผู้เชี่ยวชาญเฉพาะทางเข้าไว้ด้วยกัน โมเดลการกำกับดูแลแบบมีส่วนร่วมนี้ทำให้ชุมชนที่ได้รับผลกระทบมากที่สุดมีอิทธิพลโดยตรงต่อลำดับความสำคัญในการพัฒนา และทั้งสองฝ่ายยังร่วมกันจัดทำรายงานประเมินผลกระทบสำหรับการเปิดตัว SL2T เวอร์ชัน 1.0 ใน Gboard และ Live Transcribe ที่เปิดเผยทั้งขีดความสามารถและข้อจำกัดในปัจจุบันอย่างโปร่งใส ซึ่งทีมประกาศว่าจะใช้แนวทางนี้กับการเปิดตัวด้านภาษามือครั้งสำคัญทุกครั้งต่อจากนี้

ก้าวต่อไปคือภาษามือทั่วโลกและ AI ที่ทำภาษามือได้เอง

การนำภาษามืออเมริกันขึ้นไปอยู่บนมือถือเป็นเพียงจุดเริ่มต้น เพราะเป้าหมายที่ทีมวางไว้คือการทำให้ภาษามือเข้าถึงได้เทียบเท่าภาษาพูดและภาษาเขียนอย่างแท้จริง ทิศทางต่อจากนี้จึงมีทั้งการขยายไปยังภาษามืออื่นๆ การสร้างภาษามือขึ้นมาเอง (Sign Language Generation) ซึ่งเป็นการทำงานย้อนทางจาก SL2T คือแปลงข้อความกลับไปเป็นภาษามือ และการต่อยอดกับความสามารถ AI ระดับแนวหน้าด้านอื่น

สำหรับสถานะปัจจุบัน ฟีเจอร์นี้เปิดให้ใช้แล้วบน Gboard และ Live Transcribe เฉพาะบนมือถือตระกูล Pixel 11 เป็นรุ่นแรก โดยไม่มีค่าใช้จ่ายเพิ่มเติม และ Engadget รายงานว่าจะทยอยขยายไปยังอุปกรณ์รุ่นอื่นและภาษามืออื่นในลำดับถัดไป ความน่าสนใจของการเปิดตัวครั้งนี้จึงไม่ได้อยู่ที่คะแนนในชุดทดสอบมาตรฐานที่ทำลายสถิติเพียงอย่างเดียว แต่อยู่ที่การที่ AI ภาษามือเดินออกจากงานประชุมวิชาการมายืนอยู่บนหน้าจอที่คนหยิบขึ้นมาใช้ทุกวันได้สำเร็จเป็นครั้งแรก และเปิดประตูให้บทสนทนาระหว่างคนหูหนวกกับคนที่ได้ยินเกิดขึ้นได้โดยไม่ต้องรอล่ามหรือรอให้ใครสักคนยอมพิมพ์

ที่มา: Google DeepMind, Engadget, SiliconANGLE, Interesting Engineering, World Health Organization

ลงทะเบียนเข้าสู่ระบบ เพื่ออ่านบทความฟรีไม่จำกัด

No comment

RELATED ARTICLE

Responsive image

เศรษฐกิจปี 2030 ใน 3 ฉากทัศน์ AI: Anthropic ไล่เรียงอนาคตผ่าน 4 อาชีพ พยาบาล โปรแกรมเมอร์ คอลเซ็นเตอร์ และช่างไฟฟ้า

The Anthropic Institute เปิดรายงานและเครื่องมือจำลองเศรษฐกิจสหรัฐฯ ถึงปี 2030 ใน 3 ฉากทัศน์ AI พร้อมไล่เรียงอนาคต 4 อาชีพ พยาบาล โปรแกรมเมอร์ คอลเซ็นเตอร์ และช่างไฟฟ้า ว่าใครถูกเสร...

Responsive image

Anthropic เดือดจนออก Report แฉโมเดลจีนลอกวิชา Claude ผ่านแชทกว่า 200 ล้านชุดในไม่กี่เดือน Alibaba ทำไป 151 ล้านครั้ง หนักสุดในทุกค่าย

สรุปรายงานช็อกวงการ AI เมื่อ Anthropic แฉหลักฐาน Claude โดนแอบ "รีดสมอง" ไปฝึกโมเดลจีนกว่า 200 ล้านครั้ง เจาะลึกเทคนิคหลอกแปลภาษา และเปิดสถิติการยิง API จากค่ายยักษ์ใหญ่อย่าง Aliba...

Responsive image

ฟีเจอร์ใหม่ Apple Watch เพิ่ม Siri Recap บันทึกเสียงรอบตัว และใช้ AI ประมวลผล ส่งไปเก็บในแอป Siri

Apple เปิดตัวฟีเจอร์ AI ใหม่บน Apple Watch อย่าง Siri Recap และ Live Rewind ช่วยดักฟังและสรุปบทสนทนาประชุมให้อัตโนมัติ ปลุกกระแส Productivity คนทำงาน พร้อมจุดประเด็นความกังวลด้าน P...