Gemini 3.5 Transcribe เป็นโมเดล Speech-to-Text รุ่นล่าสุดที่ Google พัฒนาขึ้นเพื่อแก้ปัญหาที่โมเดลทั่วไปมักทำไม่ได้ เช่น การจัดการกับเสียงรบกวนหลังบ้าน ศัพท์เฉพาะทาง และการตัดคำเติม (filler words) อย่าง 'เอิ่ม' หรือ 'อา' ออกจากข้อความโดยอัตโนมัติ ทำให้ได้ข้อความที่ขัดเกลาและพร้อมใช้งานทันที
โมเดลนี้มาพร้อมกับความสามารถหลักสองด้าน คือ การสตรีมแบบเรียลไทม์ที่มีความหน่วงต่ำ (Latency) ต่ำกว่าหนึ่งวินาที และการประมวลผลไฟล์เสียงที่บันทึกไว้ล่วงหน้าพร้อมฟีเจอร์ระบุตัวตนผู้พูด (Speaker Attribution) และการบันทึกเวลาเป็นรายคำ จากการทดสอบพบว่ามีความผิดพลาดของคำ (WER) เพียง 4.0% สำหรับการสตรีม และ 2.6% สำหรับไฟล์บันทึก นอกจากนี้ยังรองรับมากกว่า 85 ภาษาทั่วโลก และสามารถทำงานร่วมกับ Gemini API เพื่อเรียกใช้ฟังก์ชันอื่นๆ เช่น การสรุปไฟล์หรือสร้างภาพผ่านคำสั่งเสียงได้อีกด้วย