AI ngôn ngữ ký hiệu trong tầm tay: SL2T của Google làm được gì?
💡 Ngày 12 tháng 8 năm 2026, Google DeepMind ra mắt SL2T, mô hình AI nhận dạng ngôn ngữ ký hiệu đầu tiên trên điện thoại thông thường. Người khiếm thính trên Pixel 11 có thể ra hiệu vào Gboard hoặc Live Transcribe thay vì gõ phím. Đây là lần đầu tiên, dù hiện chỉ hỗ trợ Ngôn ngữ Ký hiệu Mỹ và còn mắc lỗi với ký hiệu hiếm.
- SL2T ra mắt ngày 12/8/2026 trên Google Pixel 11, chuyển đổi Ngôn ngữ Ký hiệu Mỹ (ASL) sang văn bản tiếng Anh theo thời gian thực.
- Người dùng có thể ra hiệu trực tiếp vào Gboard (nhắn tin, tìm kiếm, hỏi Gemini) và Live Transcribe, không cần gõ phím.
- Mô hình theo dõi 130 điểm mốc cơ thể qua MediaPipe ngay trên thiết bị và loại bỏ video thô ngay lập tức, bảo vệ quyền riêng tư.
- Đạt 70 điểm BLEURT trên bộ kiểm thử FLEURS-ASL, cao nhất từng được báo cáo, nhưng đây là số liệu tự công bố của Google, chưa được xác minh độc lập.
- Lưu ý trung thực: hiện chỉ hỗ trợ ASL, còn lỗi trong ánh sáng yếu và với ký hiệu hiếm, và tuyệt đối không thể thay thế phiên dịch viên có chứng chỉ trong các tình huống y tế hay pháp lý.

Mô hình SL2T của Google thực sự làm được gì
Trong nhiều thập kỷ, AI nhận dạng ngôn ngữ ký hiệu chủ yếu tồn tại trong các bài báo nghiên cứu và thử nghiệm phòng thí nghiệm. Ngày 12 tháng 8 năm 2026, Google DeepMind thay đổi điều đó khi tích hợp công nghệ này vào hai ứng dụng Android phổ thông: Gboard (bàn phím) và Live Transcribe (ứng dụng hỗ trợ tiếp cận).
Công nghệ có tên SL2T, viết tắt của sign-language-to-text (ngôn ngữ ký hiệu sang văn bản). Trên Pixel 11, người dùng khiếm thính có thể giơ điện thoại, ra hiệu bằng Ngôn ngữ Ký hiệu Mỹ và xem nội dung xuất hiện dưới dạng văn bản tiếng Anh theo thời gian thực.
Đây là lần đầu tiên tính năng này có mặt trên điện thoại thông thường, không phải thiết bị chuyên dụng hay nguyên mẫu nghiên cứu.
Cơ chế hoạt động có bảo vệ quyền riêng tư không?
SL2T không ghi lại video và gửi lên máy chủ. Thay vào đó, một lớp xử lý ngay trên thiết bị gọi là MediaPipe Holistic ánh xạ 130 điểm mốc chính trên khuôn mặt, bàn tay và cơ thể: vị trí, góc độ, chuyển động, theo từng khung hình. Chỉ có các tọa độ hình học đó được gửi đến máy chủ của Google. Video thô được loại bỏ ngay lập tức.
Sau đó mô hình chuyển đổi luồng tọa độ đó trực tiếp sang văn bản tiếng Anh, bỏ qua bước gloss trung gian. Gloss là nhãn cố định cho từng ký hiệu riêng lẻ. Các hệ thống trước đây phụ thuộc vào từ điển gloss lớn, đồng nghĩa với việc chúng không thể xử lý các ký hiệu ngoài từ điển và không thể biểu diễn ngữ pháp không gian hay biểu cảm khuôn mặt của ASL.
Mô hình được huấn luyện trên hơn 100.000 giờ video ký hiệu trong hơn 50 ngôn ngữ ký hiệu, trong đó khoảng 25% là ASL. Google cho biết việc huấn luyện đa ngôn ngữ đã cải thiện độ chính xác ASL so với huấn luyện chỉ trên ASL.
Điều này thay đổi gì cho người khiếm thính?
Nhận dạng giọng nói đã là tính năng mặc định trên điện thoại cho người nghe bình thường từ hơn một thập kỷ. Người khiếm thính chưa từng có tính năng tương đương: họ luôn phải gõ phím. SL2T lấp một phần khoảng trống đó, ít nhất là cho người dùng ASL trên Pixel 11.
Các trường hợp sử dụng thực tế là những thứ mà người nghe bình thường coi là hiển nhiên: soạn tin nhắn, tìm kiếm trên web, hỏi Gemini, ghi chú. Trong Live Transcribe, người dùng khiếm thính có thể ra hiệu để trả lời thay vì gõ trong cuộc trò chuyện. Các thử nghiệm viên của Google cho biết ra hiệu cảm thấy nhanh hơn và tự nhiên hơn so với gõ tiếng Anh.
Trên toàn thế giới có hơn 70 triệu người khiếm thính, giao tiếp bằng khoảng 200 ngôn ngữ ký hiệu khác nhau. Bản phát hành này hỗ trợ một ngôn ngữ trên một dòng điện thoại. Nhưng nó chứng minh rằng độ chính xác ở mức tiêu dùng đã đạt được, và điều đó quan trọng cho những gì tiếp theo.
Tại sao ngôn ngữ quan trọng hơn công nghệ trong trường hợp này
Bản phát hành này cũng là một tuyên bố về cách đối xử với ngôn ngữ ký hiệu. Các hệ thống trước đây thường dịch ASL sang tiếng Anh có ký hiệu, ánh xạ từng từ một, bỏ qua ngữ pháp riêng của ASL. SL2T được xây dựng từ đầu để coi ASL là một ngôn ngữ độc lập, với các cấu trúc không gian, dấu hiệu khuôn mặt và ngữ pháp phi tuyến tính của riêng nó.
Sự khác biệt này không chỉ mang tính kỹ thuật. Một hệ thống áp đặt thứ tự từ tiếng Anh lên ASL ngầm định khung ASL như một dạng ngôn ngữ phái sinh hoặc thứ cấp. Các nhà ngôn ngữ học ngôn ngữ ký hiệu đã ghi nhận sự căng thẳng này trong nhiều thập kỷ, và việc coi ASL là ngôn ngữ chính vừa là quyết định quản trị vừa là quyết định kỹ thuật.
Với những ai làm việc với ngôn ngữ, nghiên cứu về nhận thức đa ngôn ngữ và lão hóa não bộ là lời nhắc nhở hữu ích rằng ngôn ngữ không chỉ là phương tiện giao tiếp mà còn là kiến trúc nhận thức.
Những giới hạn thực sự bạn cần biết là gì?
Một số điều SL2T không thể làm cũng quan trọng không kém những gì nó có thể làm.
- Hiện chỉ hỗ trợ ASL sang tiếng Anh. BSL, LSF, Auslan và các ngôn ngữ ký hiệu lớn khác chưa được hỗ trợ.
- Hiệu suất giảm trong điều kiện ánh sáng yếu, góc máy ảnh nghiêng và khi người ra hiệu không phải người lớn nhất trong khung hình.
- Còn lỗi với ký hiệu hiếm, đánh vần ngón tay nhanh và các cấu trúc bị động hay phân loại từ của ASL.
- Giới hạn 60 giây mỗi đoạn, không có bộ nhớ giữa các đoạn, và không được huấn luyện trên người dưới 18 tuổi.
- Đôi khi tạo ra văn bản khi không có ai ra hiệu, dù Google cho biết đã giảm thiểu so với phiên bản trước khi ra mắt.
Quan trọng hơn: ủy ban tư vấn cùng phát triển công nghệ này với Google, bao gồm Hiệp hội Người Điếc Quốc gia Mỹ và Liên đoàn Người Điếc Thế giới, đã xác định rõ ràng SL2T chỉ dùng cho tình huống không chính thức, ít rủi ro: nhắn tin, tìm kiếm, trò chuyện thông thường. Tuyệt đối không thể thay thế phiên dịch viên có chứng chỉ trong các buổi tư vấn y tế, thủ tục pháp lý, phỏng vấn xin việc hay tương tác với cơ quan nhà nước.
Các số liệu chuẩn được trích dẫn là do Google tự công bố. Chưa có đánh giá học thuật độc lập nào về mô hình đã triển khai tính đến tháng 8/2026.
Điều gì cần theo dõi tiếp theo
Lộ trình của Google bao gồm: thêm dấu câu và lệnh chỉnh sửa, hỗ trợ nhiều người ra hiệu cùng lúc, theo dõi biểu cảm khuôn mặt tốt hơn, và mở rộng dữ liệu phương ngữ ASL bao gồm Black ASL, vốn còn yếu trong các mô hình hiện tại. Câu hỏi quan trọng nhất là liệu kiến trúc SL2T có thể chuyển giao sang các ngôn ngữ ký hiệu khác mà không cần thêm 100.000 giờ dữ liệu cho mỗi ngôn ngữ hay không.
Nếu được, đây trở thành khuôn mẫu để thu hẹp khoảng cách nhận dạng giọng nói trong 200 ngôn ngữ ký hiệu cùng một lúc. Nếu không, SL2T vẫn là bước đầu tiên có ý nghĩa nhưng còn hạn chế.
Câu hỏi thường gặp
SL2T có hỗ trợ tất cả ngôn ngữ ký hiệu không, hay chỉ Ngôn ngữ Ký hiệu Mỹ?
Khi ra mắt (tháng 8 năm 2026), SL2T chỉ hỗ trợ Ngôn ngữ Ký hiệu Mỹ sang tiếng Anh trên Pixel 11. Mô hình được huấn luyện trên dữ liệu từ hơn 50 ngôn ngữ ký hiệu và Google có kế hoạch mở rộng, nhưng chưa đưa ra mốc thời gian cho các ngôn ngữ như BSL hay LSF.
Tôi có thể dùng SL2T trên bất kỳ điện thoại Android nào không?
Không. Khi ra mắt, SL2T chỉ có trên Google Pixel 11. Google cho biết sẽ hỗ trợ thêm các thiết bị khác nhưng chưa công bố cụ thể dòng máy nào hay thời điểm ra mắt.
SL2T có đủ chính xác để thay thế phiên dịch viên ngôn ngữ ký hiệu không?
Không, và ủy ban tư vấn của Google cũng cấm điều này. SL2T được thiết kế cho các tình huống không chính thức: nhắn tin, tìm kiếm, trò chuyện thông thường. Không được dùng trong tư vấn y tế, thủ tục pháp lý, phỏng vấn xin việc hay bất kỳ tình huống chính thức nào đòi hỏi phiên dịch viên có chứng chỉ.
SL2T bảo vệ quyền riêng tư như thế nào khi sử dụng camera?
Video thô từ camera bị loại bỏ ngay trên thiết bị. MediaPipe chuyển đổi video thành 130 điểm mốc hình học trước khi bất kỳ dữ liệu nào rời khỏi điện thoại. Chỉ có các tọa độ đó được máy chủ Google xử lý, video thực tế của người ra hiệu không bao giờ được gửi đến Google.
SL2T khác gì so với các hệ thống AI nhận dạng ngôn ngữ ký hiệu trước đây?
Các hệ thống cũ dùng gloss như bước trung gian, dẫn đến từ vựng hạn chế và mất ngữ pháp không gian của ASL. SL2T tạo trực tiếp văn bản tiếng Anh từ luồng tọa độ chuyển động, giúp chất lượng dịch thuật cải thiện theo dữ liệu huấn luyện thay vì phụ thuộc vào từ điển thủ công. Nó cũng coi ASL là ngôn ngữ độc lập, không phải tiếng Anh có ký hiệu.
Nguồn: Blog Google DeepMind: Đưa AI ngôn ngữ ký hiệu đến tay người dùng (2026)
Về tác giả
Đào Huy (Lucas) là dịch thuật viên chuyên nghiệp làm việc giữa tiếng Anh, tiếng Việt, tiếng Trung và tiếng Pháp, với hơn bảy năm kinh nghiệm trong dịch thuật kỹ thuật, pháp lý và bản địa hóa phần mềm. Anh theo dõi những phát triển tại điểm giao giữa ngôn ngữ và công nghệ vì, như SL2T cho thấy, hai lĩnh vực này hiếm khi tách rời: các lựa chọn về ngữ pháp, thứ tự từ và thẩm quyền ngôn ngữ không chỉ là quyết định kỹ thuật mà còn là chính sách ngôn ngữ.
Nếu doanh nghiệp của bạn cần dịch Anh-Việt, tài liệu kỹ thuật, bằng sáng chế và sở hữu trí tuệ, hay bản địa hóa giao diện phần mềm, Lucas sẵn sàng cung cấp báo giá miễn phí tại daohuy.com.
Written by Dao Huy (Lucas), Vietnamese translator & localization specialist (EN · ZH · FR → Vietnamese). See translation services →
