
Comment transcrire un enregistrement d'interview en 2026
Summarize this article with:
Transcrire à la main une interview d'une heure prend environ quatre à six heures. L'IA vous donne un brouillon en quelques minutes ; comptez ensuite 15 à 30 minutes pour corriger noms propres, chiffres et étiquettes d'intervenants avant de citer. L'écart de précision entre les outils se joue surtout sur votre micro et votre dispositif de consentement, pas sur le logiciel. Choisissez le verbatim épuré pour le journalisme, conservez l'audio d'origine et vérifiez chaque citation sur l'enregistrement avant qu'elle parte à l'impression.
TL;DR. Une interview d'une heure demande quatre à six heures de transcription manuelle et environ cinq minutes plus une passe de correction de 15 à 30 minutes avec l'IA. L'essentiel de votre précision finale se décide avant d'appuyer sur « enregistrer » : choix du micro, pièce, consentement. Optez pour le verbatim épuré en journalisme, faites passer l'audio dans un outil de transcription, corrigez noms propres et chiffres lors d'une rapide passe de relecture, et vérifiez chaque citation directe sur l'enregistrement avant de publier. Conservez l'audio d'origine.
Une interview typique produit 30 à 60 minutes d'audio qui doivent devenir des citations exactes, des thèmes et une analyse. La transcription en est le fondement. Bien faite, la rédaction coule de source. Bâclée, vous perdez des heures à traquer des mots mal cités dans l'enregistrement — ou pire, vous publiez une citation fantôme et devez faire paraître un rectificatif.
Je construis ConvertAudioToText, donc je lis et corrige des transcriptions toute la journée. Le flux de travail ci-dessous est celui qui tient sous la pression des délais pour les journalistes et les chercheurs qualitatifs. Il ne s'agit pas de savoir quel logo est « le meilleur outil ». Les décisions de prise de son que vous prenez avant l'interview améliorent la précision bien plus que le logiciel. Les journalistes devraient aussi consulter la page outils de transcription pour journalistes, qui couvre le flux de travail en rédaction de bout en bout.

Le temps que l'IA fait réellement gagner
La version honnête du discours commercial. La transcription manuelle suit un ratio bien documenté : les transcripteurs expérimentés travaillent à raison d'environ quatre heures de frappe par heure d'audio, et un audio médiocre ou plusieurs intervenants peuvent doubler voire tripler ce temps (GMR Transcription). Votre cerveau suit la parole à 125 à 175 mots par minute, mais la plupart des gens tapent à 60 à 90 mots par minute : vous faites sans cesse pause et retour arrière.
L'IA inverse l'équation. Une interview de 60 minutes se transcrit en trois à cinq minutes environ, et vous consacrez le temps gagné à ce qui requiert un humain : la correction et le reportage.
| Approche | Temps pour une interview d'1 heure | Coût | Idéal pour |
|---|---|---|---|
| À la main | 4 à 6 heures | Votre temps | Petits extraits, verbatim de qualité juridique, contrôle maximal |
| Brouillon IA, puis correction | 5 min de traitement + 15 à 30 min de correction | Gratuit à quelques dollars | La plupart des interviews |
| Service de transcription humaine | 12 heures à quelques jours de délai | Environ 1,50 à 2 $ par minute d'audio | Accents prononcés, précision niveau tribunal, budget disponible |
Le seuil de rentabilité est évident pour presque toutes les interviews. La transcription manuelle ne l'emporte que lorsque l'enregistrement est si brouillon qu'un brouillon IA prendrait plus de temps à corriger qu'à taper de zéro, ce qui signifie généralement que l'audio source était mauvais. C'est un problème d'enregistrement, et l'enregistrement est justement là où nous commençons.
Avant d'enregistrer : ce qui décide de votre précision
La meilleure transcription vient du meilleur audio, et un audio propre est une décision de prise de son, pas une retouche de post-production. Aucun modèle ne restitue des mots que le micro n'a jamais captés.
Adaptez le micro au format
- En présentiel. Deux micros cravate, ou un micro canon placé entre vous et votre interlocuteur. Un enregistreur de terrain comme la série Zoom H peut capter chaque intervenant sur une piste séparée, ce qui rend les étiquettes d'intervenants bien plus fiables.
- Visioconférence à distance. Enregistrez chaque intervenant localement quand c'est possible (Riverside, Zencastr ou équivalent le font), afin que chaque voix ait son propre fichier propre plutôt qu'un seul flux compressé de qualité appel.
- Téléphone. Utilisez une application d'enregistrement d'appel ou un enregistreur dédié, pas le haut-parleur capté par un micro de salle situé à une soixantaine de centimètres.
Ce qu'il faut éviter : le micro intégré du portable en travers du bureau, ou les deux personnes penchées vers un unique téléphone posé sur la table. Les deux produisent un audio de qualité moyenne qu'un modèle d'IA transcrira quand même, simplement avec plus d'erreurs à traquer ensuite à l'oreille. Pour aller plus loin sur le matériel, voir les meilleurs enregistreurs pour journalistes et comment gérer le bruit de fond dans un enregistrement.
Obtenez un consentement enregistré
Les règles du droit d'enregistrement varient selon les juridictions et elles comptent. Un groupe central d'États américains exige le consentement de toutes les parties (chaque personne consent avant que vous n'enregistriez), et la Californie, la Floride, l'Illinois et la Pennsylvanie figurent parmi les plus strictes. Plusieurs États sont réellement contestés ou hybrides (le Nevada et le Michigan sont interprétés différemment selon les tribunaux), alors ne vous fiez pas à une liste toute faite trouvée en ligne, y compris ce paragraphe. Vérifiez les spécificités de votre État dans enregistrer des interviews légalement, État par État et l'enquête Justia sur les 50 États.
Même dans les États à consentement d'une seule partie, un consentement enregistré est une bonne pratique et vous protège si l'interview est contestée plus tard. La formule d'ouverture standard : « J'enregistre pour garantir l'exactitude, cela vous convient-il ? » Attendez le « oui » verbal. Cette phrase enregistrée entre dans la transcription et devient votre autorisation documentée.
Choisissez d'abord le style de verbatim
Décidez avant l'interview du degré de littéralité de la transcription. Ce choix change votre façon de corriger et de citer.
- Verbatim strict conserve chaque « euh », chaque faux départ et chaque pause. Exigé pour les preuves juridiques, l'analyse vocale et certaines recherches qualitatives.
- Verbatim intelligent supprime les scories et les faux départs, garde la grammaire telle que dite. Standard pour la recherche académique.
- Verbatim épuré supprime les scories et lisse légèrement les faux départs. Standard en journalisme.
- Version éditée réécrit en prose propre. À utiliser uniquement pour la citation finale publiée, jamais comme transcription archivée.
En journalisme, le verbatim épuré est presque toujours le bon choix : il préserve la voix de l'intervenant tout en retirant le bruit qui rendrait quiconque mal à l'aise sur le papier. Les arbitrages sont détaillés dans verbatim vs transcription épurée.
Pendant l'interview : trois habitudes qui rapportent ensuite
- Laissez l'interlocuteur finir. Les chevauchements de parole sont la première source d'erreurs de transcription, car aucun modèle ni aucun outil de diarisation ne sépare proprement deux personnes qui parlent en même temps. La demi-seconde de silence paraît longue dans la pièce et se lit parfaitement sur la page.
- Répétez les noms et termes inhabituels. « Pour confirmer, c'est bien orthographié C-O-O-L-I-F-Y ? » donne à la transcription un point d'ancrage net et vous épargne une vérification ultérieure.
- Notez l'horodatage de toute citation marquante. Noter « 23:17, déclaration de mission » dans votre carnet transforme une chasse à la citation en recherche de 10 secondes.
La passe de transcription
1. Rognez et convertissez
Coupez le silence mort au début et à la fin. Si le fichier est une vidéo (MP4 Zoom ou Riverside), l'audio seul suffit et s'importe plus vite :
ffmpeg -i interview.mp4 -vn -acodec mp3 -ab 192k interview.mp3
Cela réduit la taille du fichier d'environ 80 % sans perte de précision notable pour la parole.
2. Importez et configurez
Déposez le fichier dans votre outil de transcription. Le transcripteur anglais gratuit gère les interviews courtes sans compte, et le modèle d'interview journalisme est le bon point d'entrée quand vous voulez une sortie structurée (citations à ressortir, affirmations à vérifier, pistes de chapô) plutôt qu'un mur de texte brut.
Trois réglages qui font bouger la précision :
- Langue. Spécifiez-la plutôt que de compter sur la détection automatique, surtout pour un audio non anglophone.
- Nombre d'intervenants. Indiquez le nombre réel (2 pour un tête-à-tête, 3 pour un journaliste et deux interlocuteurs). La diarisation est plus précise quand elle n'a pas à deviner combien de voix chercher.
- Renforcement de vocabulaire ou de mots-clés. Passez tous les noms inhabituels, jargons ou noms propres. Une liste de cinq mots attrape les erreurs de marque et de nom de famille qui sinon apparaissent à chaque première passe.
3. Lancez
Une interview de 60 minutes se traite typiquement en trois à cinq minutes, avec une progression grossièrement linéaire. La transcription IA moderne affiche environ 8 à 12 % de taux d'erreur par mot sur de l'audio conversationnel réel, mieux sur des enregistrements propres, moins bien sur des appels bruités (benchmarks WER de Whisper). Voilà pourquoi la passe de correction existe, et pourquoi votre prise de son compte : un enregistrement propre se situe au bon bout de cette fourchette.
4. La passe de correction de 15 minutes
C'est l'étape la plus importante et celle que tout le monde saute. Ouvrez la transcription avec l'audio synchronisé (l'éditeur de CATT lie le texte à l'audio : cliquez sur n'importe quel mot pour y accéder) :
- Écoutez à vitesse 1,5x en parcourant le texte des yeux.
- Mettez en pause pour corriger ce qui peut vous causer des ennuis :
- Noms propres. Presque toujours erronés à la première passe.
- Chiffres. Un montant en dollars ou une date mal rapportés se publient tels quels — et c'est embarrassant.
- Étiquettes d'intervenants. Vérifiez que la première minute est correcte, le reste suit généralement.
- Erreurs qui changent le sens. Un « pas » tombé, ou une confusion entre mots proches (« leur » vs « leurs »).
- Passez outre les préférences stylistiques, les débats sur les mots de remplissage (si vous avez choisi le verbatim épuré) et la ponctuation mineure.
Comptez 15 à 30 minutes pour corriger une interview de 60 minutes. Si c'est plus long, l'audio source était mauvais et vous êtes en train de réécrire, pas de corriger. Plus de détails sur la réduction de l'écart de précision dans pourquoi la précision de transcription varie.
Extraire et vérifier les citations
La transcription existe. Maintenant il vous faut des citations, et il faut qu'elles soient exactement ce qui a été dit.
Trouvez les citations
- Recherche et survol pour les formats courts où vous connaissez déjà l'angle : cherchez des mots-clés, relevez les passages.
- Passe de surlignage pour les formats longs : lisez toute la transcription une fois, marquez tout ce qui est citable, puis retenez les trois à cinq plus fortes par thème.
- Sortie structurée quand vous voulez une longueur d'avance : le modèle d'interview journalisme renvoie des thèmes, des citations candidates et des suggestions de chapô. Traitez-le comme un brouillon et vérifiez tout sur l'audio. La méthode complète est dans comment extraire des citations d'une interview.
Vérifiez avant de publier
Avant qu'une citation directe parte à l'impression :
- Retrouvez la citation dans la transcription.
- Cliquez pour accéder à ce moment de l'audio.
- Écoutez le contexte autour.
- Confirmez la formulation, emphase et ton compris.
Avec un éditeur à clic-pour-naviguer, cela prend environ 30 secondes par citation. Sauter cette étape a causé plus de rectificatifs journalistiques que n'importe quelle autre faille de flux de travail. L'IA se trompe subtilement sur des mots d'une façon qui semble plausible — c'est exactement pourquoi une écoute rapide attrape ce qu'une relecture ne voit pas.
Comparaison honnête : là où les outils diffèrent vraiment
L'outil compte moins que la prise de son, mais la question est légitime, alors voici la version directe avec les tarifs actuels. Les outils spécialisés pour interviews et recherche se regroupent autour de trois arbitrages : combien ils corrigent pour vous, s'ils offrent une option de qualité humaine, et comment ils tarifient.
| Outil | Modèle | Offre gratuite | Entrée payante | Remarquable pour les interviews |
|---|---|---|---|---|
| ConvertAudioToText | IA, abonnement mensuel fixe | 10 min sans compte ; 10 min offertes une fois avec un compte | À partir de 9,99 $/mois | Étiquettes d'intervenants, éditeur à clic-pour-naviguer, modèles structurés journalisme/recherche, couverture des langues africaines et non anglaises |
| Otter.ai | IA, temps réel | 300 min/mois (Basic) | Pro 8,33 $/utilisateur/mois (annuel) | Capture et notes de réunions en direct (otter.ai/pricing) |
| Descript | IA, éditeur d'abord | 1 heure/mois | Hobbyist 16 $/mois (10 h) | Montez l'audio/vidéo en éditant la transcription (descript.com/pricing) |
| Trint | IA, rédaction | Aucune | Starter environ 52 $/mois | Collaboration et traduction pour les équipes éditoriales |
| Rev | IA + humain | 45 min IA/mois | Essentials 29,99 $/mois ; humain environ 1,50 à 2 $ par minute d'audio | Transcription humaine quand 99 % de précision est non négociable (rev.com/pricing) |
Mon avis en une phrase : pour la plupart des interviews, n'importe quel outil IA compétent plus une passe de correction disciplinée bat la transcription humaine payante, et la seule raison de payer le tarif à la minute de Rev est lorsqu'un tribunal, un accent prononcé ou un risque juridique rend les derniers pourcents de précision valables vingt fois leur coût. Pour le décryptage complet de quand la prime humaine vaut le coup, voir IA vs transcription humaine. Les prix ci-dessus sont ceux de mi-2026 et évoluent, donc vérifiez la page de chaque fournisseur avant de vous engager.
Interviews multi-intervenants et tables rondes
Les interviews en table ronde avec trois interlocuteurs ou plus sont plus difficiles, et l'assumer honnêtement vous évite de faire confiance à une mauvaise étiquette :
- Prévoyez quelques attributions erronées. Vérifiez l'étiquette d'intervenant sur chaque citation que vous utilisez réellement.
- Les chevauchements s'aggravent. Certaines lignes d'un micro seront inintelligibles. Des micros par intervenant règlent l'essentiel si vous maîtrisez la prise de son.
- Réglez le nombre d'intervenants dans l'outil pour que la diarisation n'ait pas à deviner.
Le fonctionnement de l'étiquetage sous-jacent est expliqué dans la diarisation des intervenants expliquée.
Interviews en langue étrangère et traduites
Si l'interview est en espagnol, en français, en portugais, en arabe ou dans une autre langue, transcrivez d'abord dans la langue d'origine. Le résultat est plus précis que de demander au modèle de traduire en transcrivant, et vous conservez un fidèle relevé à partir duquel citer.
Traduisez ensuite la transcription comme une étape distincte (DeepL, Google Traduction ou un traducteur humain selon l'enjeu). Citez dans la langue d'origine là où c'est important, traduit lorsque vous publiez en anglais. Pour le wolof, le swahili et le haoussa, CATT couvre les langues d'Afrique de l'Ouest et de l'Est que beaucoup d'outils plus anciens ne gèrent tout simplement pas.
Traitement des contenus sensibles
Certains contenus d'interview demandent un traitement attentif :
- Passages off the record. Marquez-les dans la transcription (« début OTR » / « fin OTR »). Ne les supprimez pas de vos archives, car vous pourriez avoir besoin de vérifier plus tard ce qui a réellement été dit, mais n'en citez rien.
- Passages en arrière-plan. Même traitement : disponibles pour le contexte, mais sans attribution.
- Sources anonymes. Remplacez le nom par un pseudonyme avant que la transcription ne parte à un rédacteur en chef. Conservez l'original codé à part et en sécurité.
- Personnes vulnérables. Survivants, mineurs, lanceurs d'alerte. Traitez l'enregistrement lui-même comme sensible, et limitez qui peut y accéder.
Le modèle d'entretien de recherche et le modèle de conférence de presse gèrent la sortie structurée pour d'autres contextes de reportage.
Rangez l'audio, la transcription et vos notes ensemble
Gardez tout ce qui concerne une interview dans un dossier au nom cohérent :
2026-05-26_alice-jones-interview/
├── audio.mp3
├── transcript.txt
├── transcript.docx
├── consent-line-timestamp.txt
├── notes-during-interview.md
└── pull-quotes.md
Pour la recherche de longue durée, imbriquez par projet : project-alpha/2026-05-26_alice/.... Les transcriptions deviennent un corpus consultable, et six mois plus tard vous retrouvez n'importe quelle interview en moins d'une minute. Ne jetez jamais l'audio d'origine. Le disque coûte peu, et l'enregistrement est la seule chose qui vous permette de défendre une citation si elle est un jour contestée.
Trois erreurs qui coûtent le plus de temps aux reporters
- Transcrire à la main par habitude. Quatre à six heures de frappe remplacées par cinq minutes plus une courte correction. Le temps gagné part dans le reportage et l'écriture.
- Sauter la passe de correction. Publier des citations directes depuis une transcription IA brute, c'est ainsi que les citations fantômes s'impriment. Corrigez toujours avant de citer.
- Ne pas garder l'audio. Sans l'enregistrement, impossible de vérifier une citation contestée — et c'est précisément la situation où vous en avez le plus besoin.
Faites-le dès votre prochaine interview
Si une interview dort sur votre disque, faites-la passer dans le transcripteur anglais gratuit, puis dans le modèle d'interview journalisme, et comparez la sortie structurée à ce que vous auriez produit d'une lecture manuelle. La plupart des interviews contiennent au moins une citation forte dans la sortie du modèle que vous auriez survolée à la première lecture. Voilà l'argument pour laisser la machine taper pendant que vous faites le reportage.
Questions fréquemment posées
Combien de temps faut-il pour transcrire une interview d'une heure ?
À la main, quatre à six heures pour un audio clair, et le double ou le triple pour des enregistrements médiocres ou plusieurs intervenants. Avec l'IA, environ trois à cinq minutes pour générer le brouillon, puis 15 à 30 minutes de correction avant de citer.
Quelle est la précision de la transcription d'interview par IA ?
L'IA moderne affiche environ 8 à 12 % de taux d'erreur par mot sur de l'audio conversationnel réel, mieux sur des enregistrements propres, moins bien sur des audios bruités ou très accentués. C'est suffisant pour un brouillon de travail, pas pour des citations directes non corrigées — voilà pourquoi existent la passe de correction et la vérification des citations.
Faut-il utiliser l'IA ou un service de transcription humaine ?
Utilisez l'IA pour presque toutes les interviews : un enregistrement propre plus une courte passe de correction vous donnent des citations publiables gratuitement ou pour quelques dollars. Payez la transcription humaine (environ 1,50 à 2 $ par minute d'audio) seulement quand l'audio est très difficile ou que l'enjeu de précision est de niveau juridique, comme une déposition ou un procès-verbal d'audience.
Quel style de verbatim choisir en journalisme ?
Le verbatim épuré. Il supprime les scories et lisse légèrement les faux départs tout en gardant les mots et la voix réels de l'intervenant. Réservez le verbatim strict aux preuves juridiques ou à l'analyse vocale, et la prose entièrement éditée à la citation finale publiée, jamais à votre transcription archivée.
Est-il légal d'enregistrer une interview ?
Cela dépend de votre juridiction. Un groupe central d'États américains exige le consentement de toutes les personnes présentes dans la conversation, et quelques États sont réellement contestés. Enregistrer un consentement verbal au début vous protège partout. Consultez les détails dans notre guide État par État et l'enquête Justia sur les 50 États avant d'enregistrer.
Comment transcrire une interview dans une autre langue ?
Transcrivez d'abord dans la langue d'origine, puis traduisez le texte comme une étape séparée. Traduire pendant la transcription est moins précis et perd le fidèle relevé dont vous avez besoin pour citer. CATT prend en charge l'espagnol, le français, l'arabe et des langues africaines dont le wolof, le swahili et le haoussa.
Pourquoi ma transcription attribue-t-elle mal qui a dit quoi ?
L'étiquetage des intervenants (diarisation) peine avec les chevauchements de parole et avec deux voix qui se ressemblent, et il est encore moins bon sur des panels de trois personnes ou plus. Enregistrer chaque intervenant sur un micro séparé et régler le nombre d'intervenants dans l'outil aident tous les deux. Vérifiez toujours l'étiquette d'intervenant de toute citation que vous publiez.
Peut-on transcrire une interview Zoom ou vidéo sans fichier audio séparé ?
Oui. Importez directement le MP4, ou extrayez d'abord l'audio seul avec FFmpeg pour alléger le fichier et accélérer l'import. L'audio seul ne perd rien pour la précision de transcription.
Questions Fréquemment Posées
Combien de temps faut-il pour transcrire une interview d'une heure ?
À la main, quatre à six heures pour un audio clair, et le double ou le triple pour des enregistrements médiocres ou plusieurs intervenants. Avec l'IA, environ trois à cinq minutes pour générer le brouillon, puis 15 à 30 minutes de correction avant de citer.
Quelle est la précision de la transcription d'interview par IA ?
L'IA moderne affiche environ 8 à 12 % de taux d'erreur par mot sur de l'audio conversationnel réel, mieux sur des enregistrements propres, moins bien sur des audios bruités ou très accentués. C'est suffisant pour un brouillon de travail, pas pour des citations directes non corrigées — voilà pourquoi existent la passe de correction et la vérification des citations.
Faut-il utiliser l'IA ou un service de transcription humaine ?
Utilisez l'IA pour presque toutes les interviews : un enregistrement propre plus une courte passe de correction vous donnent des citations publiables gratuitement ou pour quelques dollars. Payez la transcription humaine (environ 1,50 à 2 $ par minute d'audio) seulement quand l'audio est très difficile ou que l'enjeu de précision est de niveau juridique, comme une déposition ou un procès-verbal d'audience.
Quel style de verbatim choisir en journalisme ?
Le verbatim épuré. Il supprime les scories et lisse légèrement les faux départs tout en gardant les mots et la voix réels de l'intervenant. Réservez le verbatim strict aux preuves juridiques ou à l'analyse vocale, et la prose entièrement éditée à la citation finale publiée, jamais à votre transcription archivée.
Est-il légal d'enregistrer une interview ?
Cela dépend de votre juridiction. Un groupe central d'États américains exige le consentement de toutes les personnes présentes dans la conversation, et quelques États sont réellement contestés. Enregistrer un consentement verbal au début vous protège partout. Consultez les détails dans notre guide État par État et l'enquête Justia sur les 50 États avant d'enregistrer.
Comment transcrire une interview dans une autre langue ?
Transcrivez d'abord dans la langue d'origine, puis traduisez le texte comme une étape séparée. Traduire pendant la transcription est moins précis et perd le fidèle relevé dont vous avez besoin pour citer. CATT prend en charge l'espagnol, le français, l'arabe et des langues africaines dont le wolof, le swahili et le haoussa.
Pourquoi ma transcription attribue-t-elle mal qui a dit quoi ?
L'étiquetage des intervenants (diarisation) peine avec les chevauchements de parole et avec deux voix qui se ressemblent, et il est encore moins bon sur des panels de trois personnes ou plus. Enregistrer chaque intervenant sur un micro séparé et régler le nombre d'intervenants dans l'outil aident tous les deux. Vérifiez toujours l'étiquette d'intervenant de toute citation que vous publiez.
Peut-on transcrire une interview Zoom ou vidéo sans fichier audio séparé ?
Oui. Importez directement le MP4, ou extrayez d'abord l'audio seul avec FFmpeg pour alléger le fichier et accélérer l'import. L'audio seul ne perd rien pour la précision de transcription.
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.