AI & MACHINE LEARNING

Google เปิดตัว EmbeddingGemma 2 โมเดล Multimodal Embedding ขนาดเล็กประสิทธิภาพสูงสำหรับอุปกรณ์พกพา

Google DeepMind06 Oct 2026
1 min read
Key Takeaways
  • EmbeddingGemma 2 คือโมเดลฝังตัวแบบ Multimodal ขนาดไม่ถึง 1B ที่มีประสิทธิภาพสูงที่สุดในปัจจุบัน รองรับการประมวลผลบนอุปกรณ์พกพาและใช้งานได้ฟรีภายใต้ Apache 2

ทำไมเรื่องนี้ถึงสำคัญ

โมเดลนี้ช่วยแก้ปัญหาเรื่องความเป็นส่วนตัวและ latency โดยการย้ายการประมวลผล AI ซับซ้อนมาไว้บนอุปกรณ์ (On-device) โดยเฉพาะงานด้านการค้นหาเชิงความหมาย (Semantic Search) และระบบ RAG ที่ต้องจัดการกับข้อมูลหลายประเภทพร้อมกัน

Google DeepMind ประกาศเปิดตัว EmbeddingGemma 2 ซึ่งเป็นรุ่นต่อยอดจากโมเดลเดิม โดยเปลี่ยนมาใช้สถาปัตยกรรม Gemma 4 และรองรับการทำงานแบบ Multimodal อย่างเต็มรูปแบบ โมเดลนี้ถูกออกแบบมาเพื่อทำงานบนฮาร์ดแวร์ทั่วไปและอุปกรณ์พกพาได้อย่างมีประสิทธิภาพผ่านใบอนุญาตแบบ Apache 2.0 ที่เปิดกว้างสำหรับการใช้งานเชิงพาณิชย์

หัวใจสำคัญของโมเดลนี้คือการรวมข้อมูลหลายรูปแบบ (Multi-modal) ทั้งข้อความ โค้ด รูปภาพ เสียง และวิดีโอ เข้าไปอยู่ในพื้นที่เวกเตอร์เดียวกัน ทำให้นักพัฒนาสามารถสร้างระบบค้นหาข้ามรูปแบบได้ เช่น การใช้คำสั่งเสียงเพื่อค้นหาฉากในวิดีโอ หรือการใช้ข้อความค้นหาไฟล์เสียง นอกจากนี้ยังมาพร้อมเทคโนโลยี Matryoshka Representation Learning (MRL) ที่ช่วยให้ปรับขนาดเวกเตอร์ได้ตามความเหมาะสมของหน่วยความจำ ช่วยลดการใช้พื้นที่จัดเก็บฐานข้อมูลเวกเตอร์ลงได้ถึง 6 เท่า

สรุปประเด็นหลัก

โมเดลขนาด 740 ล้านพารามิเตอร์ รองรับข้อความ ภาพ เสียง และวิดีโอแบบ Native

ใช้เทคโนโลยี MRL ช่วยลดขนาดเวกเตอร์และประหยัดพื้นที่จัดเก็บข้อมูลบนเครื่อง

หน้าต่างบริบท (Context Window) กว้างถึง 8K token รองรับข้อมูลเสียงและวิดีโอที่มีความยาวมากขึ้น

นวัตกรรมและเทคโนโลยี

models

Native Multimodal Embedding

ความสามารถในการรวมข้อมูลข้อความ ภาพ เสียง และวิดีโอ เข้าสู่เวกเตอร์ชุดเดียวกันเพื่อการค้นหาข้ามรูปแบบ

tools

Matryoshka Representation Learning (MRL)

ฟีเจอร์ที่เปิดให้นักพัฒนาลดขนาดมิติของเวกเตอร์จาก 768 เหลือเพียง 128 มิติ เพื่อประหยัดพื้นที่จัดเก็บและหน่วยความจำ

infrastructure

8K Token Context Window

ขยายหน้าต่างบริบทให้กว้างขึ้น 4 เท่าจากรุ่นก่อนหน้า รองรับการประมวลผลวิดีโอและเสียงที่ยาวขึ้นบนฮาร์ดแวร์ท้องถิ่น

Developer Impact
นักพัฒนาสามารถสร้างระบบ RAG และการค้นหาข้ามสื่อ (Cross-modal search) ที่ทำงานแบบออฟไลน์ได้โดยสมบูรณ์บนอุปกรณ์อย่างสมาร์ทโฟน โดยใช้หน่วยความจำ RAM ต่ำเพียง 191MB - 567MB เท่านั้น
Keywords
#embeddinggemma 2 #multimodal #on-device ai #gemma 4 #vector search
Original Source

อ่านข้อมูลเพิ่มเติมจากแหล่งข่าวหลัก

Google DeepMind