전사 실무 가이드

로컬 및 클라우드 전사 워크플로 이해하기

전사는 미디어 입력에서 검토된 텍스트에 이르는 일련의 과정입니다. 지원 형식, 처리 위치, 타임스탬프, 화자, 편집 및 내보내기는 각각 따로 살펴봐야 합니다.

읽는 데 4분
마이크, 헤드폰, 노트북, 모니터를 갖춘 오디오 전사 작업 공간

파일은 시작에 불과합니다

전사 작업 흐름에서는 미디어를 디코딩하고, 오디오를 정규화하거나 리샘플링하고, 음성을 감지하고, 단어 또는 구간별 타이밍을 만들고, 선택적으로 화자 레이블을 지정하고, 편집 가능한 텍스트로 표시한 뒤 내보냅니다. 도구가 한 단계에서는 성공하고 다른 단계에서는 실패할 수 있습니다. ‘MP4 지원’은 일부 MP4 변형에서 오디오를 추출할 수 있다는 뜻일 수 있으며 모든 코덱과 손상된 파일이 작동한다는 의미는 아닙니다.

원본 미디어는 변경하지 말고 사본으로 작업하십시오. 도구와 모델 버전을 기록하고, 논란이 있는 구간을 다시 확인할 수 있도록 충분한 타이밍 정보를 보존하십시오. 컴퓨터가 절전 모드로 전환되거나 작업이 중단될 경우를 대비해 긴 녹음에는 예측 가능한 재개 또는 복구 방법이 있어야 합니다.

로컬과 클라우드는 처리 방식일 뿐, 품질 보장이 아닙니다

로컬 전사는 녹음 파일을 업로드할 필요를 줄이고 필수 모델을 설치한 뒤에는 계속 작동할 수 있습니다. 대신 컴퓨터의 CPU, GPU, 메모리, 저장 공간 및 전력을 사용합니다. 클라우드 전사는 처리와 협업을 중앙화할 수 있지만 업로드, 보관, 학습, 하위 처리업체, 지역, 계정 및 삭제 방식에 대한 검토가 필요합니다.

하이브리드 제품이 두 방식을 모두 사용하는 것은 타당할 수 있습니다. 포괄적인 명칭만 믿기보다 데이터 흐름도나 작업별 표를 요청하십시오. 모델 다운로드 및 소프트웨어 업데이트 트래픽은 원본 오디오 업로드와 다르며 이 차이를 명확히 밝혀야 합니다.

화자 레이블은 추정 결과입니다

화자 분리는 음성을 화자 1, 화자 2와 같은 군집으로 나눕니다. 겹치는 발화, 짧은 끼어들기, 비슷한 목소리, 실내 울림, 원격 통화 처리 및 배경 미디어 때문에 군집이 잘못 나뉠 수 있습니다. 알려진 개인의 이름을 식별하는 화자 인식은 별개의 기능이며 훨씬 민감하게 다뤄야 합니다.

사람이 확인하기 전까지는 중립적인 레이블을 사용하십시오. 자동으로 화자가 지정된 발언을 공신력 있는 회의록, 법적 자백 또는 신뢰할 수 있는 신원 기록으로 취급하지 마십시오.

전사문은 검토해야 완성됩니다

이름, 숫자, 부정 표현, 전문 용어, 실행 항목 담당자, 날짜 및 발화가 겹치는 구간을 검토하십시오. 주변 텍스트만 보고 추측하지 말고 타임스탬프 전후를 들어 보십시오. 정말 들리지 않는 부분은 확실한 것처럼 지어내지 말고 알아들을 수 없음으로 표시하십시오.

다음 작업에 맞는 내보내기 형식을 선택하십시오. 검색 및 초안 작성에는 일반 텍스트, 검증에는 타임스탬프가 포함된 텍스트, 공유에는 DOCX 또는 PDF, 소프트웨어 파이프라인에는 JSON, 타이밍 자막에는 SRT 또는 VTT가 적합합니다. 다른 시스템이 파일을 읽어 들인다면 인코딩과 줄바꿈 방식도 확인하십시오.

출처

  1. NIST — 개인정보 보호 프레임워크
  2. 미국 의회도서관 — SubRip 자막 형식 설명

VTA Dictate 만나보기

말한 내용을 더 많이, 활용 가능한 결과물로 바꾸십시오.

하나의 데스크톱 작업 공간에서 Windows 전반에 음성을 입력하고, 동의를 받아 대화를 녹음하고, 오디오를 전사하고, 회의 노트를 다듬고, 자막을 내보내십시오.