AI & MACHINE LEARNING

Google DeepMind เปิดตัวโมเดล SL2T แปลภาษามือเป็นข้อความแบบเรียลไทม์บนสมาร์ทโฟน

Google DeepMind Blog12 Aug 2026
1 min read
Key Takeaways
  • SL2T คือก้าวสำคัญของ AI ด้านภาษาที่สามารถทำความเข้าใจโครงสร้างทางภาษาและท่าทางที่ซับซ้อนของภาษามือ และนำมาใช้งานได้จริงบนอุปกรณ์พกพา

ทำไมเรื่องนี้ถึงสำคัญ

เทคโนโลยีนี้ช่วยลดช่องว่างในการสื่อสารของคนหูหนวกและผู้ที่มีปัญหาทางการได้ยินกว่า 70 ล้านคนทั่วโลก ให้สามารถเข้าถึงเครื่องมือดิจิทัลและการสื่อสารในชีวิตประจำวันได้รวดเร็วและเป็นธรรมชาติกว่าการพิมพ์ปกติ

Google DeepMind ประกาศความสำเร็จในการพัฒนาโมเดล Sign-Language-to-Text (SL2T) ซึ่งเป็นโมเดลปัญญาประดิษฐ์ที่แปลภาษามือออกมาเป็นข้อความ (Text) ได้โดยตรง โดยนำมาประยุกต์ใช้จริงในฟีเจอร์การพิมพ์ด้วยภาษามือ (Sign-to-text dictation) บน Gboard และแอป Live Transcribe สำหรับผู้ใช้ Pixel 11 เริ่มต้นด้วยภาษามืออเมริกัน (ASL) เป็นภาษาอังกฤษ

โมเดลนี้มีความโดดเด่นในด้านความเป็นส่วนตัว โดยจะประมวลผลวิดีโอเป็นเพียงจุดพิกัดบนร่างกาย (Landmarks) ผ่าน MediaPipe Holistic บนตัวเครื่อง ก่อนจะส่งเพียงค่าพิกัดนั้นไปแปลเป็นภาษาบนเซิร์ฟเวอร์ ทำให้ไม่ต้องเก็บไฟล์วิดีโอต้นฉบับ นอกจากนี้ยังก้าวข้ามขีดจำกัดเดิมที่ต้องแปลผ่านคำศัพท์กลาง (Glosses) มาเป็นการแปลจากท่าทางเป็นประโยคโดยตรง ซึ่งช่วยให้ผลลัพธ์มีความเป็นธรรมชาติและถูกต้องตามหลักไวยากรณ์มากขึ้น

สรุปประเด็นหลัก

รองรับการแปลภาษามือโดยตรงจากพิกัดร่างกาย (Pose Landmarks) เพื่อรักษาความเป็นส่วนตัว

ฝึกฝนด้วยข้อมูลภาษามือกว่า 50 ภาษา รวมกว่า 100,000 ชั่วโมง

เริ่มเปิดใช้งานบน Pixel 11 รองรับ ASL และเตรียมขยายไปยังภาษาอื่นๆ

นวัตกรรมและเทคโนโลยี

models

SL2T Model

โมเดลแปลภาษามือเป็นข้อความที่ใช้การประมวลผลแบบ End-to-end จากพิกัดร่างกาย

creative ai

Sign-to-Text Dictation

ฟีเจอร์การป้อนข้อมูลด้วยภาษามือแทนการพิมพ์ใน Gboard และแอปต่างๆ

Developer Impact
นักพัฒนาด้าน AI และ Accessibility สามารถศึกษาแนวทางการใช้ Pose Estimation (MediaPipe) ร่วมกับโมเดลแปลภาษาเพื่อสร้างแอปพลิเคชันสำหรับผู้พิการที่ทำงานได้แบบเรียลไทม์
Keywords
#google deepmind #sign language #sl2t #machine translation #pixel 11
Original Source

อ่านข้อมูลเพิ่มเติมจากแหล่งข่าวหลัก

Google DeepMind Blog