Le fichier n’est que le début
Un processus de transcription décode le média, normalise ou rééchantillonne l’audio, détecte la parole, crée des codes temporels pour les mots ou les segments, attribue éventuellement des étiquettes aux locuteurs, produit un texte modifiable et l’exporte. Un outil peut réussir une étape et échouer à une autre. « Prend en charge MP4 » peut signifier que l’audio est extractible de certaines variantes MP4, et non que tous les codecs et fichiers endommagés fonctionneront.
Conservez le média d’origine sans le modifier. Travaillez à partir d’une copie, consignez la version de l’outil et du modèle, et préservez suffisamment de données temporelles pour pouvoir réexaminer les passages contestés. Pour les longs enregistrements, prévoyez un moyen fiable de reprendre ou de récupérer le travail si l’ordinateur se met en veille ou si la tâche est interrompue.
Le traitement local et infonuagique constitue un choix, et non une garantie de qualité
La transcription locale peut éviter d’avoir à téléverser l’enregistrement et continuer de fonctionner une fois les modèles requis installés. Elle sollicite toutefois le processeur, le processeur graphique, la mémoire, le stockage et l’alimentation de l’ordinateur. La transcription infonuagique peut centraliser le traitement et la collaboration, mais exige d’examiner le téléversement, la conservation, l’entraînement, les sous-traitants, la région, le compte et la suppression des données.
Un produit hybride peut légitimement combiner les deux. Demandez un schéma des flux de données ou un tableau détaillé par opération plutôt que de vous fier à une étiquette générale. Le téléchargement d’un modèle et le trafic lié aux mises à jour du logiciel ne sont pas la même chose que le téléversement du fichier audio source ; cette distinction doit être explicite.
Les étiquettes de locuteur sont des hypothèses
La diarisation répartit la parole en groupes tels que Locuteur 1 et Locuteur 2. Les chevauchements, les brèves interjections, les voix semblables, l’écho de la pièce, le traitement des appels à distance et les médias diffusés en arrière-plan peuvent brouiller ces regroupements. La reconnaissance des locuteurs qui nomme une personne connue constitue une fonction distincte et plus sensible.
Utilisez des étiquettes neutres jusqu’à ce qu’une personne les vérifie. Ne considérez pas une déclaration attribuée automatiquement comme un procès-verbal faisant autorité, un aveu juridique ou une preuve d’identité fiable.
Une transcription n’est complète qu’après révision
Vérifiez les noms, les nombres, les négations, les termes spécialisés, les responsables des mesures à prendre, les dates et les passages où plusieurs personnes parlent en même temps. Écoutez autour du code temporel au lieu de deviner d’après le texte environnant. Signalez les passages véritablement inaudibles plutôt que d’inventer une certitude.
Choisissez le format d’exportation en fonction de l’étape suivante : texte brut pour la recherche et la rédaction, texte horodaté pour la vérification, DOCX ou PDF pour la diffusion, JSON pour les chaînes de traitement logiciel, et SRT ou VTT pour les sous-titres synchronisés. Vérifiez l’encodage et les fins de ligne lorsque le fichier doit être importé dans un autre système.
