ファイルは出発点にすぎません
文字起こしのワークフローでは、メディアをデコードし、音声を正規化またはリサンプリングし、発話を検出して、単語または区間ごとのタイミングを作成します。必要に応じて話者ラベルを割り当て、編集可能なテキストを生成し、書き出します。ある工程では成功しても、別の工程で失敗する場合があります。「MP4対応」とは、一部のMP4形式から音声を抽出できるという意味にすぎず、すべてのコーデックや破損ファイルに対応するとは限りません。
元のメディアは変更せず保管してください。コピーを使って作業し、使用したツールとモデルのバージョンを記録して、問題のある箇所を再確認できるだけのタイミング情報を残します。長時間の録音では、パソコンがスリープした場合や処理が中断した場合に、予測可能な方法で再開または復旧できることが重要です。
ローカルとクラウドは処理方法であり、品質を保証するものではない
ローカル文字起こしは、録音をアップロードする必要性を減らし、必要なモデルのインストール後はオフラインでも処理を続けられます。一方で、パソコンのCPU、GPU、メモリ、ストレージ、電力を使用します。クラウド文字起こしでは処理や共同作業を一元化できますが、アップロード、保持、学習利用、再委託先、処理地域、アカウント、削除の仕組みを確認する必要があります。
ハイブリッド製品が両方を正当に利用することもあります。一括りの説明をそのまま受け入れず、データフロー図や操作ごとの一覧を確認してください。モデルのダウンロードやソフトウェア更新の通信は、元の音声をアップロードする通信とは異なります。この違いは明示されるべきです。
話者ラベルは推定結果
話者分離では、発話を「話者1」「話者2」のようなグループに分けます。発話の重なり、短い相づち、似た声、室内の反響、リモート通話の音声処理、背景メディアによって、グループ分けを誤る場合があります。既知の人物を名前で特定する話者認識は、これとは別の、より慎重な扱いを要する機能です。
人が確認するまでは、中立的なラベルを使ってください。自動的に話者が割り当てられた発言を、正式な議事録、法的な自認、信頼できる本人確認記録として扱わないでください。
文字起こしは確認して初めて完成する
名前、数字、否定表現、専門用語、アクション項目の担当者、日付、発話が重なった箇所を確認します。周囲のテキストから推測せず、タイムスタンプの前後を聞いてください。本当に聞き取れない部分は、確かな内容を作り上げず、聞き取り不能と記録します。
次の作業に合わせて書き出し形式を選びます。検索や下書きにはプレーンテキスト、検証にはタイムスタンプ付きテキスト、共有にはDOCXまたはPDF、ソフトウェア処理にはJSON、タイムコード付き字幕にはSRTまたはVTTが適しています。別のシステムへ読み込む場合は、文字エンコーディングと改行コードも確認してください。
