파일은 시작에 불과합니다
전사 작업 흐름에서는 미디어를 디코딩하고, 오디오를 정규화하거나 리샘플링하고, 음성을 감지하고, 단어 또는 구간별 타이밍을 만들고, 선택적으로 화자 레이블을 지정하고, 편집 가능한 텍스트로 표시한 뒤 내보냅니다. 도구가 한 단계에서는 성공하고 다른 단계에서는 실패할 수 있습니다. ‘MP4 지원’은 일부 MP4 변형에서 오디오를 추출할 수 있다는 뜻일 수 있으며 모든 코덱과 손상된 파일이 작동한다는 의미는 아닙니다.
원본 미디어는 변경하지 말고 사본으로 작업하십시오. 도구와 모델 버전을 기록하고, 논란이 있는 구간을 다시 확인할 수 있도록 충분한 타이밍 정보를 보존하십시오. 컴퓨터가 절전 모드로 전환되거나 작업이 중단될 경우를 대비해 긴 녹음에는 예측 가능한 재개 또는 복구 방법이 있어야 합니다.
로컬과 클라우드는 처리 방식일 뿐, 품질 보장이 아닙니다
로컬 전사는 녹음 파일을 업로드할 필요를 줄이고 필수 모델을 설치한 뒤에는 계속 작동할 수 있습니다. 대신 컴퓨터의 CPU, GPU, 메모리, 저장 공간 및 전력을 사용합니다. 클라우드 전사는 처리와 협업을 중앙화할 수 있지만 업로드, 보관, 학습, 하위 처리업체, 지역, 계정 및 삭제 방식에 대한 검토가 필요합니다.
하이브리드 제품이 두 방식을 모두 사용하는 것은 타당할 수 있습니다. 포괄적인 명칭만 믿기보다 데이터 흐름도나 작업별 표를 요청하십시오. 모델 다운로드 및 소프트웨어 업데이트 트래픽은 원본 오디오 업로드와 다르며 이 차이를 명확히 밝혀야 합니다.
화자 레이블은 추정 결과입니다
화자 분리는 음성을 화자 1, 화자 2와 같은 군집으로 나눕니다. 겹치는 발화, 짧은 끼어들기, 비슷한 목소리, 실내 울림, 원격 통화 처리 및 배경 미디어 때문에 군집이 잘못 나뉠 수 있습니다. 알려진 개인의 이름을 식별하는 화자 인식은 별개의 기능이며 훨씬 민감하게 다뤄야 합니다.
사람이 확인하기 전까지는 중립적인 레이블을 사용하십시오. 자동으로 화자가 지정된 발언을 공신력 있는 회의록, 법적 자백 또는 신뢰할 수 있는 신원 기록으로 취급하지 마십시오.
전사문은 검토해야 완성됩니다
이름, 숫자, 부정 표현, 전문 용어, 실행 항목 담당자, 날짜 및 발화가 겹치는 구간을 검토하십시오. 주변 텍스트만 보고 추측하지 말고 타임스탬프 전후를 들어 보십시오. 정말 들리지 않는 부분은 확실한 것처럼 지어내지 말고 알아들을 수 없음으로 표시하십시오.
다음 작업에 맞는 내보내기 형식을 선택하십시오. 검색 및 초안 작성에는 일반 텍스트, 검증에는 타임스탬프가 포함된 텍스트, 공유에는 DOCX 또는 PDF, 소프트웨어 파이프라인에는 JSON, 타이밍 자막에는 SRT 또는 VTT가 적합합니다. 다른 시스템이 파일을 읽어 들인다면 인코딩과 줄바꿈 방식도 확인하십시오.
