檔案只是起點
轉錄工作流程會解碼媒體、正規化或重新取樣音訊、偵測語音、建立字詞或片段時間、指派選用的說話者標籤、產生可編輯文字,再匯出結果。工具可能在某個階段成功,卻在另一階段失敗。「支援 MP4」可能只代表能從部分 MP4 變體擷取音訊,不表示所有編碼格式及損壞檔案都能使用。
請保持原始媒體不變,以副本進行作業、記錄工具與模型版本,並保留足夠的時間資訊,以便重新檢視有爭議的片段。若電腦進入睡眠或工作遭到中斷,長篇錄音應有可預期的續傳或復原方式。
本機與雲端只是處理選項,不保證品質
本機轉錄可以減少上傳錄音的需要,且安裝必要模型後可離線繼續運作,但也會使用電腦的 CPU、GPU、記憶體、儲存空間及電力。雲端轉錄可以集中處理及協作,卻需要檢視上傳、保留、訓練、次級處理者、區域、帳戶及刪除行為。
混合式產品合理地同時使用兩者。請索取資料流程圖或逐項作業表,不要只接受籠統標籤。模型下載與軟體更新流量不同於上傳來源音訊,兩者差異應明確說明。
說話者標籤只是推測
語者分離會將語音分成「說話者 1」、「說話者 2」等群組。重疊語音、簡短插話、相似聲音、室內回音、遠端通話處理及背景媒體,都可能使群組判斷混亂。辨認已知個人姓名的說話者辨識,是另一項更敏感的功能。
在人工檢查前請使用中性標籤。不要把自動歸屬的陳述視為權威會議紀錄、法律自白或可靠的身分紀錄。
逐字稿要經過檢查才算完成
檢查名稱、數字、否定語句、專業詞彙、待辦負責人、日期及重疊語音片段。請聆聽時間戳記前後的音訊,不要只根據周圍文字猜測。確實聽不清楚的部分應加以標記,不要假裝能夠確定。
依下一項工作選擇匯出格式:純文字適合搜尋和撰稿、含時間戳記的文字適合查核、DOCX 或 PDF 適合傳閱、JSON 適合軟體處理流程,SRT 或 VTT 則適合含時間字幕。如果檔案要由其他系統匯入,請確認編碼及行尾格式。
