Cẩm nang thực hành về chuyển âm thanh thành văn bản

Giải thích quy trình chuyển âm thanh thành văn bản cục bộ và trên đám mây

Chuyển âm thanh thành văn bản là một chuỗi từ nhập nội dung đến văn bản đã kiểm tra. Hỗ trợ định dạng, nơi xử lý, dấu thời gian, người nói, chỉnh sửa và xuất là những vấn đề cần được xem xét riêng.

Đọc trong 4 phút
Không gian chuyển âm thanh thành văn bản với micrô, tai nghe, máy tính xách tay và màn hình

Tệp chỉ là điểm khởi đầu

Quy trình chuyển âm thanh thành văn bản sẽ giải mã nội dung, chuẩn hóa hoặc lấy mẫu lại âm thanh, phát hiện lời nói, tạo thời gian cho từ hoặc đoạn, gán nhãn người nói tùy chọn, hiển thị văn bản có thể chỉnh sửa rồi xuất. Một công cụ có thể thành công ở giai đoạn này nhưng thất bại ở giai đoạn khác. “Hỗ trợ MP4” có thể chỉ nghĩa là âm thanh được trích từ một số biến thể MP4, không phải mọi codec và tệp hỏng đều hoạt động.

Giữ nguyên nội dung gốc. Làm việc từ một bản sao, ghi lại phiên bản công cụ và mô hình, đồng thời giữ đủ thông tin thời gian để xem lại những đoạn có tranh chấp. Bản ghi dài cần có cách tiếp tục hoặc khôi phục ổn định nếu máy tính chuyển sang ngủ hoặc công việc bị gián đoạn.

Xử lý cục bộ và đám mây là lựa chọn, không phải bảo đảm chất lượng

Chuyển âm thanh thành văn bản cục bộ có thể giảm nhu cầu tải bản ghi lên và tiếp tục hoạt động sau khi cài đủ mô hình cần thiết. Cách này cũng dùng CPU, GPU, bộ nhớ, dung lượng lưu trữ và điện năng của máy tính. Xử lý trên đám mây có thể tập trung hóa việc xử lý và cộng tác, nhưng bạn phải xem xét hoạt động tải lên, lưu giữ, huấn luyện, nhà xử lý phụ, khu vực, tài khoản và xóa.

Sản phẩm lai có thể sử dụng hợp pháp cả hai. Hãy yêu cầu sơ đồ luồng dữ liệu hoặc bảng theo từng hoạt động thay vì chấp nhận một nhãn chung chung. Lưu lượng tải mô hình và cập nhật phần mềm khác với tải âm thanh nguồn lên; sự khác biệt phải được nêu rõ.

Nhãn người nói chỉ là giả thuyết

Phân tách người nói (diarization) chia lời nói thành các nhóm như Người nói 1 và Người nói 2. Lời nói chồng lấn, câu chen ngắn, giọng giống nhau, tiếng vọng trong phòng, xử lý cuộc gọi từ xa và nội dung phát nền có thể làm các nhóm bị nhầm. Khả năng nhận dạng và gọi tên một cá nhân đã biết là tính năng riêng biệt và nhạy cảm hơn.

Dùng nhãn trung lập cho đến khi có người kiểm tra. Không coi một phát biểu được tự động gán người nói là biên bản có thẩm quyền, lời thừa nhận pháp lý hoặc hồ sơ nhận dạng đáng tin cậy.

Bản chép lời chỉ hoàn tất sau khi được kiểm tra

Kiểm tra tên riêng, số liệu, từ phủ định, thuật ngữ chuyên ngành, người phụ trách đầu việc, ngày tháng và những đoạn có lời nói chồng lấn. Hãy nghe âm thanh quanh dấu thời gian thay vì đoán từ văn bản lân cận. Đánh dấu trung thực những đoạn không nghe được thay vì tạo ra sự chắc chắn giả.

Chọn định dạng xuất cho tác vụ tiếp theo: văn bản thuần để tìm kiếm và soạn thảo, văn bản có dấu thời gian để xác minh, DOCX hoặc PDF để lưu hành, JSON cho quy trình phần mềm và SRT hoặc VTT cho phụ đề có mã thời gian. Xác nhận mã hóa và ký tự kết thúc dòng khi một hệ thống khác sẽ nhập tệp.

Nguồn

  1. NIST — Khung Quyền riêng tư
  2. Thư viện Quốc hội Hoa Kỳ — Mô tả định dạng phụ đề SubRip

Làm quen với VTA Dictate

Biến nhiều điều bạn nói thành nội dung có thể sử dụng.

Nhập liệu bằng giọng nói trên Windows, ghi lại cuộc trò chuyện khi được phép, chuyển âm thanh thành văn bản, biên soạn ghi chú cuộc họp và xuất phụ đề trong một không gian làm việc trên máy tính.