คู่มือภาคปฏิบัติด้านการถอดเสียง

อธิบายเวิร์กโฟลว์การถอดเสียงภายในเครื่องและบนคลาวด์

การถอดเสียงเป็นกระบวนการต่อเนื่องตั้งแต่นำเข้าสื่อไปจนถึงข้อความที่ตรวจทานแล้ว การรองรับรูปแบบ ตำแหน่งประมวลผล ข้อมูลเวลา ผู้พูด การแก้ไข และการส่งออก เป็นเรื่องที่ควรถามแยกกัน

ใช้เวลาอ่าน 4 นาที
พื้นที่ทำงานถอดเสียงที่มีไมโครโฟน หูฟัง แล็ปท็อป และจอภาพ

ไฟล์เป็นเพียงจุดเริ่มต้น

ขั้นตอนการถอดเสียงจะถอดรหัสสื่อ ปรับระดับหรือสุ่มตัวอย่างเสียงใหม่ ตรวจหาเสียงพูด สร้างเวลาระดับคำหรือช่วง เพิ่มป้ายกำกับผู้พูดที่เลือกใช้ได้ แสดงข้อความที่แก้ไขได้ และส่งออก เครื่องมืออาจสำเร็จในขั้นตอนหนึ่งแต่ล้มเหลวในอีกขั้น “รองรับ MP4” อาจหมายถึงดึงเสียงจาก MP4 บางรูปแบบได้ ไม่ได้หมายความว่าตัวแปลงสัญญาณทุกชนิดและไฟล์เสียหายจะใช้ได้

เก็บสื่อต้นฉบับไว้โดยไม่แก้ไข ทำงานจากสำเนา บันทึกเครื่องมือและเวอร์ชันโมเดล และเก็บข้อมูลเวลาให้เพียงพอสำหรับย้อนตรวจช่วงที่มีข้อโต้แย้ง ไฟล์บันทึกยาวควรมีวิธีดำเนินการต่อหรือกู้คืนที่คาดการณ์ได้ หากเครื่องเข้าสู่โหมดพักหรืองานถูกขัดจังหวะ

ภายในเครื่องและบนคลาวด์เป็นตัวเลือกการประมวลผล ไม่ใช่การรับประกันคุณภาพ

การถอดเสียงภายในเครื่องช่วยลดความจำเป็นในการอัปโหลดไฟล์บันทึก และทำงานต่อได้หลังติดตั้งโมเดลที่จำเป็นแล้ว แต่ใช้ CPU, GPU, หน่วยความจำ พื้นที่จัดเก็บ และพลังงานของคอมพิวเตอร์ ส่วนการถอดเสียงบนคลาวด์รวมศูนย์การประมวลผลและการทำงานร่วมกันได้ แต่ต้องตรวจสอบการอัปโหลด การเก็บรักษา การใช้ฝึกโมเดล ผู้ประมวลผลช่วง ภูมิภาค บัญชี และพฤติกรรมการลบ

ผลิตภัณฑ์แบบผสมอาจใช้ทั้งสองอย่างได้อย่างสมเหตุสมผล ขอแผนภาพการไหลของข้อมูลหรือตารางแยกตามการดำเนินการ แทนการยอมรับคำเรียกโดยรวม การรับส่งข้อมูลเพื่อดาวน์โหลดโมเดลและอัปเดตซอฟต์แวร์ต่างจากการอัปโหลดเสียงต้นฉบับ และควรระบุความแตกต่างให้ชัดเจน

ป้ายกำกับผู้พูดเป็นเพียงข้อสันนิษฐาน

การแยกผู้พูดจัดเสียงเป็นกลุ่ม เช่น ผู้พูด 1 และผู้พูด 2 เสียงพูดที่ทับกัน คำแทรกสั้น ๆ เสียงคล้ายกัน เสียงสะท้อนในห้อง การประมวลผลสายระยะไกล และสื่อที่เล่นอยู่เบื้องหลัง อาจทำให้กลุ่มเหล่านี้สับสน การรู้จำผู้พูดที่ระบุชื่อบุคคลที่รู้จักเป็นความสามารถอีกประเภทหนึ่งและมีความอ่อนไหวมากกว่า

ใช้ป้ายกำกับกลาง ๆ จนกว่าจะมีผู้ตรวจ อย่าถือว่าข้อความที่ระบบระบุผู้พูดโดยอัตโนมัติเป็นรายงานการประชุมที่เชื่อถือได้ การยอมรับทางกฎหมาย หรือบันทึกยืนยันตัวตนที่เชื่อถือได้

ข้อความถอดเสียงจะสมบูรณ์เมื่อผ่านการตรวจทาน

ตรวจชื่อ ตัวเลข คำปฏิเสธ คำศัพท์เฉพาะ ผู้รับผิดชอบงาน วันที่ และช่วงที่มีเสียงพูดทับกัน ฟังเสียงรอบเวลาในไฟล์แทนการเดาจากข้อความข้างเคียง ทำเครื่องหมายช่วงที่ฟังไม่ได้จริงแทนการแต่งความแน่นอนขึ้นมา

เลือกรูปแบบส่งออกให้เหมาะกับงานถัดไป ได้แก่ ข้อความธรรมดาสำหรับค้นหาและร่าง ข้อความพร้อมเวลาสำหรับตรวจสอบ DOCX หรือ PDF สำหรับเผยแพร่ JSON สำหรับกระบวนการซอฟต์แวร์ และ SRT หรือ VTT สำหรับคำบรรยายพร้อมเวลา ยืนยันการเข้ารหัสและอักขระขึ้นบรรทัดใหม่ หากระบบอื่นจะนำเข้าไฟล์

แหล่งข้อมูล

  1. NIST — กรอบงานความเป็นส่วนตัว
  2. หอสมุดรัฐสภาสหรัฐฯ — คำอธิบายรูปแบบคำบรรยาย SubRip

ทำความรู้จัก VTA Dictate

เปลี่ยนสิ่งที่พูดให้เป็นงานที่นำไปใช้ได้มากยิ่งขึ้น

พิมพ์ด้วยเสียงได้ทั่วทั้ง Windows บันทึกบทสนทนาเมื่อได้รับอนุญาต ถอดเสียง จัดทำบันทึกการประชุม และส่งออกคำบรรยาย ทั้งหมดจากพื้นที่ทำงานบนเดสก์ท็อปแห่งเดียว