Phụ đề SDH: định dạng hiệu ứng âm thanh, nhạc và tên diễn giả
💡 Trong phụ đề SDH, hiệu ứng âm thanh đặt trong [NGOẶC VUÔNG] trên dòng riêng, diễn giả ngoài màn hình được đánh dấu in nghiêng (TÊN DIỄN GIẢ: lời thoại), và âm nhạc bọc trong ký hiệu ♪. Ba quy tắc này - theo hướng dẫn W3C WAI và WCAG 1.2.2 - bao phủ phần lớn sự kiện phi thoại trong bất kỳ dự án SDH nào.
Ý chính
- Hiệu ứng âm thanh: [MÔ TẢ BẰNG CHỮ HOA], dòng riêng, đặt trước hoặc đúng thời điểm xảy ra
- Diễn giả ngoài màn hình: in nghiêng toàn bộ cue, thêm TÊN DIỄN GIẢ: trước lời thoại
- Âm nhạc: ♪ tâm trạng hoặc tên bài ♪ cho nhạc nền in nghiêng; ♪ lời bài hát ♪ khi hát trực tiếp trong cảnh
- Ngữ cảnh giọng nói: (thì thầm), (cười), (thở hổn hển) đặt inline trước dòng thoại
- Hét lớn hoặc la to: CHỮ HOA toàn câu thoại, không cần thẻ ngoặc
SDH khác gì so với file phụ đề thông thường?
SDH (Phụ đề dành cho người Điếc và Khiếm thính) mang đầy đủ thông tin âm thanh: toàn bộ lời thoại, hiệu ứng âm thanh quan trọng với câu chuyện, cue nhạc, và nhận dạng diễn giả khi camera không cho thấy ai đang nói. File phụ đề thông thường chỉ chứa lời thoại và đôi khi một vài lời bài hát.
WCAG 1.2.2 nêu rõ yêu cầu: phụ đề phải truyền đạt "không chỉ lời thoại, mà còn xác định ai đang nói và bao gồm thông tin phi ngôn ngữ qua âm thanh, bao gồm hiệu ứng âm thanh có ý nghĩa." SDH không phải là tùy chọn nâng cao - đây là chuẩn tiếp cận tối thiểu cho video được ghi trước phát hành trên web.
Trong thực tế, sự khác biệt thể hiện ở khoảng một trong bốn cue. Đó là nơi kỹ năng SDH thực sự được thể hiện: tiếng cửa đập ngoài màn hình báo hiệu ai đó vừa vào, cuộc trao đổi thì thầm làm thay đổi thế lực trong cảnh, cue nhạc thiết lập tâm trạng trước khi câu đầu tiên được nói.
Bảng quy ước định dạng SDH
Đây là bảng tham chiếu tôi dùng khi bắt đầu mỗi dự án SDH. Quy ước ngoặc vuông cho hiệu ứng âm thanh theo định dạng YouTube ghi rõ ("thêm text như [vỗ tay] hoặc [sấm sét]") và là cách phổ biến nhất trong các bản giao hàng streaming Mỹ. Hướng dẫn W3C WAI dùng ngoặc tròn, nhưng ngoặc vuông không bị nhầm với ghi chú biên tập khi chuyển sang văn bản thuần, nên tôi ưu tiên dùng trong file SRT.
| Sự kiện âm thanh | Ký hiệu | Ví dụ trong SRT |
|---|---|---|
| Hiệu ứng âm thanh trong màn hình | [MÔ TẢ CHỮ HOA] | [KÍNH VỠ] |
| Hiệu ứng âm thanh ngoài màn hình | [MÔ TẢ] | [SẤM ĐẰNG XA] |
| Diễn giả đã biết tên, ngoài màn hình | TÊN: lời thoại (toàn cue in nghiêng) | ANNA: Tránh xa cửa ra. |
| Giọng nói chưa xác định, ngoài màn hình | ĐÀN ÔNG: / PHỤ NỮ: (toàn cue in nghiêng) | ĐÀN ÔNG: Ngoài kia là ai? |
| Nhạc nền không xuất hiện trong cảnh | ♪ tâm trạng hoặc tên bài ♪ | ♪ dàn dây căng thẳng ♪ |
| Bài hát có lời trực tiếp trong cảnh | ♪ lời bài hát ♪ | ♪ Em không thể ngăn cơn mưa ♪ |
| Giọng thì thầm | (thì thầm) trước lời thoại | (thì thầm) Chúng ta cần đi ngay. |
| Hét lớn hoặc la to | CHỮ HOA toàn câu thoại | TÔI ĐÃ BẢO ANH RỜI ĐI. |
| Ngữ cảnh cảm xúc khi nói | (mô tả) trước lời thoại | (cười) Tôi không thể tin được. |
Ghi chú về in nghiêng trong SRT: dùng thẻ <i>...</i> quanh toàn bộ cue ngoài màn hình. Một số timeline NLE bỏ thẻ này khi nhập; với bản giao hàng broadcast CEA-708, định dạng được mã hóa vào lớp dịch vụ 708 thay vì thẻ SRT, nhưng quy ước ký hiệu vẫn giữ nguyên.
Làm thế nào để định dạng tên diễn giả trong và ngoài màn hình?
Quy tắc tôi áp dụng: nếu camera đang hiện mặt diễn giả vào thời điểm nói, không cần thẻ tên. Người xem thấy ai đang nói. Thẻ chỉ dùng khi họ không thể thấy.
Với nhân vật đã biết tên đang nói ngoài màn hình (tiếng nói vọng qua cửa, qua điện thoại, giọng thuyết minh), tôi in nghiêng toàn bộ cue và đặt tên nhân vật bằng chữ hoa trước dấu hai chấm: THÁM TỬ: Anh không nên quay lại đây. Tôi dùng tên đầy đủ lần đầu tiên nhân vật nói ngoài màn hình trong một cảnh; sau đó chỉ cần tên là đủ.
Với giọng nói chưa xác định (một câu rõ ràng trong tiếng đám đông, người gọi điện chưa được tiết lộ tên), tôi dùng nhãn mô tả: NHÂN VIÊN ĐIỀU PHỐI: hoặc TRẺ EM:. Tôi tránh nhãn mơ hồ như GIỌNG NÓI: trừ khi thực sự không có thông tin cụ thể hơn. Với thuyết minh phim tài liệu, tôi thiết lập người thuyết minh một lần với NGƯỜI THUYẾT MINH: ở cue đầu tiên; các cue tiếp theo trong cùng một đoạn liên tục không lặp lại thẻ.
Đây là cách các quy tắc đó trông như thế nào trong một đoạn SRT bốn sự kiện từ cảnh phim hành động:
1
00:00:04,200 --> 00:00:06,100
[DOOR SLAMS]
2
00:00:06,200 --> 00:00:09,400
<i>ANNA: (breathing heavily)
Are you in there?</i>
3
00:00:09,500 --> 00:00:11,800
(whispers) Get away from the window.
4
00:00:11,900 --> 00:00:14,200
<i>♪ low, dissonant strings ♪</i>
- Cue 1: [DOOR SLAMS] là sự kiện độc lập. Nó báo với người xem điều gì đó đã xảy ra trước khi camera cắt sang để hiện ra.
- Cue 2: Anna đang ở ngoài màn hình (nghe thấy nhưng chưa xuất hiện). Thẻ <i> bao phủ toàn cue; ANNA: đặt tên diễn giả; (breathing heavily) là ghi chú giọng nói inline.
- Cue 3: lời thoại trong màn hình. Không cần thẻ tên vì camera đang hiện ai đang nói. (whispers) trước câu cho biết cách nói.
- Cue 4: nhạc nền không trong cảnh. Ký hiệu ♪ và in nghiêng đánh dấu là nhạc; tôi mô tả tâm trạng thay vì chỉ "đang có nhạc" vì tâm trạng mới là thông tin cần truyền đạt.
Khi nào thêm hiệu ứng âm thanh vào phụ đề, khi nào bỏ qua?
Hướng dẫn W3C WAI đưa ra bài kiểm thực tế: ghi phụ đề cho âm thanh "nếu cần thiết cho việc hiểu và/hoặc thưởng thức nội dung." Tôi áp dụng bằng cách hỏi: nếu sự kiện này im lặng, người xem Điếc có bỏ lỡ điều gì liên quan đến câu chuyện không? Có thì thêm vào. Không thì bỏ qua.
Sự kiện tôi luôn thêm: tiếng súng nổ, va chạm hoặc tai nạn, điện thoại rung, cửa mở ra lộ diện nhân vật, còi báo động kích hoạt phản ứng của nhân vật, thông báo mà cốt truyện phụ thuộc vào. Sự kiện tôi thường bỏ: tiếng xe cộ nền trong cảnh đường phố khi không có gì quan trọng, tiếng đám đông mang tính không khí thuần túy, nhạc nền chỉ để lấp chỗ trống.
Bẫy tôi gặp nhiều nhất trong SDH của người mới: gắn thẻ quá nhiều âm thanh nền ([TIẾNG ỒN ĐÔ THỊ] trước mỗi cảnh thành phố) và bỏ sót phản ứng với âm thanh ngoài màn hình. Một nhân vật giật mình vì điều gì đó người xem không nghe thấy - đó là sự kiện cần gắn thẻ, không phải tiếng ồn nền ba giây trước đó.
Những gì tôi tự xử lý và khi nào cần chuyên gia SDH
Bất kỳ ai dùng Subtitle Edit và bảng quy ước trên đây đều có thể tạo file SDH chắc lượng cho streaming hoặc video web. Tính năng "Fix Common Errors" trong Subtitle Edit bắt lỗi thẻ in nghiêng không khớp. Bộ lọc SDH trong menu Tools hiển thị các sự kiện có thẻ hiệu ứng âm thanh để bạn kiểm tra độ phủ so với kịch bản trước khi giao hàng.
Ngưỡng cần chuyên gia: bản giao hàng broadcast Mỹ. SDH broadcast tại Mỹ được giao dưới dạng CEA-608 mã hóa trong SCC hoặc SMPTE-TT, nơi nội dung hiệu ứng âm thanh và tên diễn giả đi vào luồng dữ liệu có cấu trúc, không phải chỉ là thẻ in nghiêng SRT. Quy ước ký hiệu tôi mô tả vẫn điều khiển nội dung văn bản, nhưng định dạng giao hàng và yêu cầu QC khác với SRT thông thường. Làm đúng quy ước là điều kiện tiên quyết; tạo bản giao hàng broadcast có cấu trúc đúng là bước chuyên gia CEA-608/708 giúp tiết kiệm rủi ro phải giao lại.
Với bản giao hàng SDH và caption tiếng Anh trên các tựa streaming Mỹ, dịch vụ phụ đề SDH tiếng Anh của tôi bao gồm cả quy ước ký hiệu lẫn định dạng giao hàng. Nếu bạn cần ghép track SDH tiếng Anh đó với phụ đề tiếng Việt, quy trình dịch phụ đề giữ đồng bộ timing và tên diễn giả.
Câu hỏi thường gặp
Thẻ hiệu ứng âm thanh nên đặt trên dòng SRT riêng hay inline với thoại?
Dòng riêng, như một sự kiện SRT độc lập, khi âm thanh không trùng với lời nói. Inline (mô tả trong ngoặc trước thoại) khi âm thanh và lời thoại đồng thời và tách sự kiện sẽ làm hỏng timing. Phần lớn hiệu ứng quan trọng với câu chuyện xảy ra trong khoảng trống âm thanh giữa các dòng thoại, nên sự kiện độc lập là lựa chọn tự nhiên trong đa số trường hợp.
In nghiêng có đánh dấu tất cả âm thanh ngoài màn hình hay chỉ diễn giả ngoài màn hình?
In nghiêng đánh dấu nguồn âm thanh ngoài màn hình nói chung: giọng qua điện thoại, người nói ở phòng bên, thuyết minh, và nhạc nền không xuất hiện trong cảnh. Nhạc trong màn hình (ban nhạc đang biểu diễn, ca sĩ đang hát) không cần in nghiêng. Hướng dẫn W3C WAI khuyến nghị dùng in nghiêng cho giọng nói ngoài màn hình.
Làm sao phụ đề nhạc nền khi không biết tên bài?
Mô tả tâm trạng và nhạc cụ: ♪ guitar acoustic nhẹ nhàng, nhịp chậm ♪. Khi bài có thể nhận ra, ghi tên bài: ♪ Ánh Trăng Sonata của Beethoven ♪. Với phim tài liệu khi bản nhạc chính là nội dung, tài liệu WCAG 1.2.2 Understanding cho ví dụ cụ thể: [Orchestral Suite No. 3.2 in D major, BWV 1068, Air] ♪ Giai điệu êm đềm, nhịp chậm ♪.
Nhà phân phối yêu cầu cả SDH lẫn closed caption. Đó có phải cùng một file không?
Thường là không. Bản giao hàng streaming Mỹ điển hình bao gồm file caption tiếng Anh (SCC hoặc SMPTE-TT, mã hóa CEA-608/708) và file phụ đề SDH riêng (SRT hoặc TTML). File caption chứa dữ liệu 608/708 theo yêu cầu pháp lý Mỹ. File SDH là phiên bản phụ đề văn bản dùng cùng với track âm thanh được lồng tiếng. Hãy xác nhận với nhà phân phối các loại file cần giao trước khi sản xuất.
Mỗi sự kiện SDH có cần thẻ tên diễn giả không?
Không. Thẻ tên chỉ cần khi người xem không nhận ra ai đang nói từ ngữ cảnh hình ảnh. Nếu mặt nhân vật đang hiện trên màn hình vào thời điểm nói, không cần thẻ. Thẻ dành cho giọng nói ngoài màn hình, thoại chồng chéo khi nhiều người nói cùng lúc, và cảnh không hiện nhân vật đang nói trong nhiều giây liên tiếp.
Nguồn
- W3C WAI: Transcribing Audio to Text - quy ước in nghiêng/ngoặc cho âm thanh, ký hiệu ♪ nhạc, in nghiêng ngoài màn hình, chữ hoa cho tiếng hét. Kiểm tra tháng 10/2026.
- WCAG 2.1 SC 1.2.2 Understanding: Captions (Prerecorded) - yêu cầu ghi tên diễn giả, hiệu ứng âm thanh và nhạc; ví dụ ký hiệu nhạc. Kiểm tra tháng 10/2026.
- YouTube Help: Add subtitles and captions - [vỗ tay] và [sấm sét] dùng định dạng ngoặc vuông cho sự kiện âm thanh. Kiểm tra tháng 10/2026.
- Subtitle Edit (nikse.dk) - bộ lọc SDH, kiểm tra thẻ, và Fix Common Errors để kiểm tra chất lượng SDH. Kiểm tra tháng 10/2026.
Written by Dao Huy (Lucas), Vietnamese translator & localization specialist (EN · ZH · FR → Vietnamese). See translation services →
