ใน

Google DeepMind เปิดตัว SL2T แปลภาษามือบน Pixel 11

Google DeepMind เปิดตัวโมเดล SL2T ช่วยแปลภาษามือเป็นข้อความแบบเรียลไทม์บน Pixel 11 เพื่อให้ผู้พิการทางการได้ยินสื่อสารได้สะดวกยิ่งขึ้น

Google DeepMind เปิดตัว SL2T แปลภาษามือบน Pixel 11

ในช่วงหลายทศวรรษที่ผ่านมา ความสามารถของ AI ในการประมวลผลภาษาพูด มีความก้าวหน้าอย่างรวดเร็ว ทำให้เกิดการแปลอัตโนมัติ การพิมพ์ด้วยเสียง และอินเทอร์เฟซการสนทนาที่ให้ความรู้สึกสะดวกสบายสำหรับผู้ที่ได้ยิน แต่การปฏิวัติทางเทคโนโลยีนี้ยังเข้าไม่ถึงโลกของภาษามือที่มีมากกว่า 200 ภาษา และผู้พิการทางการได้ยิน ที่คาดว่ามีถึง 70 ล้านคนทั่วโลกที่ใช้ภาษามือเหล่านี้

Google Deepmind จึงได้เปิดตัวโมเดลการแปลภาษามือเป็นข้อความ (SL2T) ที่รองรับหลายภาษาระดับมหาศาล ซึ่งถือเป็นจุดเปลี่ยนในด้านคุณภาพและความครอบคลุม โดยนำ AI ภาษามือออกจากห้องปฏิบัติการสู่ผลิตภัณฑ์สำหรับผู้บริโภคเป็นครั้งแรก โดย SL2T จะขับเคลื่อนการพิมพ์ด้วยภาษามือใน Gboard และ Live Transcribe บน Pixel 11 โดยเริ่มจาก ASL (ภาษามืออเมริกัน) เและจะมีอุปกรณ์อื่น ๆ ตามมาในเร็ว ๆ นี้ รวมถึงภาษาเพิ่มเติมในอนาคต

ในลักษณะเดียวกับที่ผู้ที่ได้ยินสามารถใช้การพิมพ์ด้วยเสียงแทนการพิมพ์ด้วยมือ ฟีเจอร์นี้ช่วยให้ผู้พิการทางการได้ยินสามารถใช้ภาษามือกับโทรศัพท์ได้ในทุกที่ที่ปกติจะต้องพิมพ์ คุณสามารถใช้ภาษามือเพื่อค้นหาเว็บ ร่างข้อความหรือเอกสาร และขอให้ Gemini ช่วยแก้ปัญหาหรือทำงานต่าง ๆ ส่วนใน Live Transcribe คุณสามารถใช้ภาษามือเพื่อตอบโต้ในการสนทนาแทนการต้องพิมพ์โต้ตอบไปมา ซึ่งจากการทดสอบของผู้ใช้งานพบว่า การใช้ภาษามือ ASL นั้นรวดเร็ว เป็นธรรมชาติ และน่าประทับใจกว่าการพิมพ์ภาษาอังกฤษ

ทำไมภาษามือถึงมีความสำคัญ

ภาษามือเป็นภาษาหลักของชุมชนผู้พิการทางการได้ยินทั่วโลก และเป็นรากฐานของอัตลักษณ์ทางวัฒนธรรมของผู้พิการทางการได้ยิน เนื่องจากมีความหลากหลายในกลุ่มผู้พิการทางการได้ยิน ทั้งในด้านระดับความเชี่ยวชาญในการใช้ภาษามือ การพูด การอ่าน และการเขียน ดังนั้นการสนับสนุนการเข้าถึงในทุกรูปแบบ จึงเป็นสิ่งสำคัญ ผู้พิการทางการได้ยินสามารถได้รับประโยชน์จากการประมวลผลภาษามือในแบบเดียวกับที่ผู้ที่ได้ยินได้รับประโยชน์จากการประมวลผลภาษาพูด นอกจากนี้ เทคโนโลยีนี้ยังเปิดโอกาสใหม่ ๆ ในการเชื่อมช่องว่างการสื่อสารระหว่างชุมชนผู้พิการทางการได้ยินและผู้ที่ได้ยิน แม้จะมีโอกาสในการสร้างผลกระทบเชิงบวกต่อสังคม แต่ความก้าวหน้าของ AI ภาษามือเป็นไปอย่างล่าช้า ทั้งเนื่องจากความซับซ้อนในการสร้าง AI สำหรับภาษามือ และความเข้าใจผิดที่แพร่หลาย เกี่ยวกับวิธีการทำงานของภาษาเหล่านี้

เมื่อเทียบกับการถอดความภาษาพูด การแปลภาษามือมีความท้าทายหลักสองประการ

  1. การถอดความเสียงเป็นเรื่องของการทำ mapping ตามลำดับจากเสียงเป็นข้อความในภาษาเดียวกัน ในขณะที่ภาษามือเป็นภาษาธรรมชาติที่เป็นอิสระ มีไวยากรณ์และคำศัพท์ที่แตกต่างกันโดยสิ้นเชิง ส่งผลให้ต้องใช้การแปลด้วยเครื่อง (machine translation) อย่างแท้จริง มากกว่าจะเป็นกระบวนการเปลี่ยนภาษามือเป็นคำทีละคำ
  2. โมเดลต้องเรียนรู้ที่จะ “มองเห็น” และเข้าใจการเคลื่อนไหวทางกายภาพ ภาษามือสื่อความหมายผ่านการเคลื่อนไหวพร้อมกันของมือ แขน ลำตัว ศีรษะ และใบหน้า การติดตามสิ่งเหล่านี้ด้วยอัตราเฟรมที่สูงเป็นงานคอมพิวเตอร์วิทัศน์ที่ยากและต้องใช้ทรัพยากรคำนวณสูง

จากพื้นฐานนี้ จึงไม่แปลกที่ความพยายามในช่วงแรกของเทคโนโลยีภาษามือ เช่น ถุงมือภาษามือ จะมีข้อจำกัดอย่างมาก เพราะภาษามือไม่ใช่เพียงแค่ “ภาษาอังกฤษที่ย้ายมาไว้บนมือ” แต่ต้องใช้การรับรู้ทางสายตาที่ซับซ้อนของการเคลื่อนไหวร่างกายทั้งหมดอย่างละเอียด และการแปลภาษาที่สมบูรณ์ ซึ่ง SL2T ถูกออกแบบมาเพื่อให้ตอบโจทย์ทั้งสองด้าน

การทำงานของ SL2T

การสร้าง SL2T คือการผสมผสานแนวทางที่เน้นผู้ใช้เป็นศูนย์กลางและคำนึงถึงวัฒนธรรม เข้ากับการขยายขนาดข้อมูลมหาศาล โมเดลนี้ได้รับการฝึกฝนด้วยข้อมูลมากกว่า 100,000 ชั่วโมง ในภาษามือมากกว่า 50 ภาษา โดยประมาณหนึ่งในสี่ของข้อมูลเป็นภาษา ASL การฝึกฝนร่วมกันในภาษา สำเนียง และระดับความเชี่ยวชาญที่หลากหลาย ทำให้โมเดลเรียนรู้โครงสร้างพื้นฐานที่ใช้ร่วมกัน ซึ่งให้ผลลัพธ์ที่ดีกว่าโมเดลภาษาเดียวในการทดลองของเรา

เพื่อปกป้องความเป็นส่วนตัวของผู้ใช้ SL2T จะมองเห็นภาษามือเป็นลำดับของตำแหน่งจุดอ้างอิงบนร่างกาย (pose landmark locations) แทนที่จะเป็นฟีดวิดีโอแบบดิบ โดยมีโมเดลบนอุปกรณ์ (MediaPipe Holistic) ทำหน้าที่ติดตามตำแหน่งของจุดบนตัวผู้ใช้งาน และส่งเพียงพิกัดทางเรขาคณิตเหล่านี้ไปยังเซิร์ฟเวอร์เพื่อการแปล ทำให้สามารถลบวิดีโอต้นฉบับทิ้งได้ทันที

SL2T แปลลำดับพิกัดนี้เป็นข้อความโดยตรง โดยข้ามขั้นตอนการใส่คำอธิบายขั้นกลางที่เรียกว่า “glosses” ซึ่งมักใช้ในงานแปลภาษามือรุ่นก่อน ๆ เนื่องจาก glosses ไม่สามารถจับรายละเอียดที่ซับซ้อนและไม่เป็นเส้นตรงของภาษามือได้ เช่น เครื่องหมายที่ไม่ใช่การเคลื่อนไหวของมือ (non-manual markers) และโครงสร้างทางพื้นที่ การแปลจากจุดอ้างอิงโดยตรงจึงช่วยขจัดข้อจำกัดของคำศัพท์ที่ถูกสร้างขึ้น และทำให้คุณภาพการแปลเพิ่มขึ้นตามปริมาณข้อมูล

SL2T เป็นโมเดลแปลภาษามือที่มีความสามารถสูงสุดจนถึงปัจจุบัน ตามเกณฑ์มาตรฐานสำคัญอย่าง FLEURS-ASL (sd-test) ซึ่งประเมินคุณภาพการแปลจาก ASL เป็นภาษาอังกฤษ โดย SL2T ทำคะแนน zero-shot ได้สูงถึง 70 BLEURT ซึ่งสูงกว่าคะแนนใด ๆ ที่เคยมีการรายงานมาก่อนหน้า แต่การปรับปรุงเพียงเพื่อให้ได้คะแนนทางวิชาการไม่สามารถรับประกันการใช้งานได้จริงในโลกแห่งความเป็นจริง เราจึงให้ความสำคัญกับปัญหาเชิงปฏิบัติ เช่น การลดความหน่วงในการส่งข้อมูล (streaming latency), การป้องกันการหลอน (hallucination) เมื่อไม่มีการใช้ภาษามือ, การสร้างความเท่าเทียมสำหรับผู้ใช้มือซ้ายซึ่งมีประมาณ 10% และการปรับปรุงประสิทธิภาพสำหรับการใช้ภาษามือด้วยมือเดียวในขณะที่ถือสมาร์ตโฟนด้วยมืออีกข้างหนึ่ง

สร้างสรรค์ร่วมกับชุมชน

Deepmind เชื่อในการสร้างเทคโนโลยีร่วมกับชุมชนผู้พิการทางการได้ยิน ไม่ใช่แค่สร้าง “เพื่อ” พวกเขา มุมมองของผู้พิการทางการได้ยินได้เข้ามามีส่วนร่วมในทุกขั้นตอนของโครงการนี้ ตั้งแต่การกำหนดแนวคิดโดย Sam Sepah ซึ่งเป็นพนักงาน Google ที่เป็นผู้พิการทางการได้ยิน, การเก็บข้อมูลร่วมกับพันธมิตรผู้พิการทางการได้ยิน, การประเมินผลในการศึกษาผู้ใช้งาน และการประเมินผลกระทบของเทคโนโลยีร่วมกับผู้เชี่ยวชาญ

เพื่อนำทางไปสู่การปรับใช้งานจริงอย่างรับผิดชอบ เราได้จัดตั้งคณะกรรมการที่ปรึกษาด้าน AI สำหรับภาษามือ (AI Sign Language Advisory Committee หรือ AISLAC) ซึ่งเป็นการรวมตัวกันขององค์กรผู้พิการทางการได้ยินระดับโลกและผู้เชี่ยวชาญในสาขานี้ ภายใต้รูปแบบการกำกับดูแลแบบมีส่วนร่วม ชุมชนที่ได้รับผลกระทบจากเทคโนโลยีของเรามากที่สุดสามารถส่งอิทธิพลต่อลำดับความสำคัญในการพัฒนาได้โดยตรง เราได้ร่วมกันเขียนรายงานผลกระทบสำหรับการปล่อย SL2T 1.0 ใน Gboard และ Live Transcribe โดยระบุความสามารถและข้อจำกัดปัจจุบันของเทคโนโลยีอย่างโปร่งใส ซึ่งเป็นแนวทางความร่วมมือที่เราตั้งใจจะทำต่อไปสำหรับการเปิดตัวภาษามือสำคัญ ๆ ทั้งหมด

ทิศทางในอนาคต

SL2T ต่อยอดจากการวิจัยพื้นฐานหลายทศวรรษทั้งในภาควิชาการและอุตสาหกรรม แต่การนำข้อมูล ASL มาสู่โทรศัพท์ของผู้ใช้งานเป็นเพียงจุดเริ่มต้น ภารกิจของ Google คือการจัดระเบียบข้อมูลของโลกและทำให้ทุกคนเข้าถึงและใช้ประโยชน์ได้ในระดับสากล ซึ่งหมายถึงการทำให้ภาษามือมีความเท่าเทียมกับภาษาพูดและภาษาเขียน Google Deepmind กำลังทำงานเพื่อขยายเทคโนโลยีนี้ไปยังภาษามืออื่น ๆ การสร้างภาษามือ (sign language generation) และความสามารถของ AI ระดับแนวหน้า เราตั้งตารอที่จะแบ่งปันความก้าวหน้าของเราอย่างรับผิดชอบ เพื่อทำให้การเข้าถึงผ่านภาษามือกลายเป็นมาตรฐานในโลกดิจิทัล

ผู้ใช้สามารถสัมผัสประสบการณ์ SL2T ได้ใน Gboard และ Live Transcribe เริ่มต้นบน Pixel 11 และจะรองรับอุปกรณ์อื่น ๆ ในเร็ว ๆ นี้ โดยไม่มีค่าใช้จ่ายเพิ่มเติม

ที่มา: Google DeepMind

ความคิดเห็น - Like เพจ iPhoneMod.net

เขียนโดย Krongkwun Rithiwong

Love exploring new technology. Decoding the future, one gadget at a time.