
Enregistrer des interviews en présentiel pour des transcriptions impeccables
Summarize this article with:
Le premier levier de précision pour la transcription d'interviews n'est pas le logiciel que vous utilisez, mais la façon dont vous placez le micro. Deux micros cravate sur des pistes séparées battent toute configuration mono-piste pour la séparation des voix. Visez des pics entre -12 et -6 dB, effectuez toujours un enregistrement de secours et recueillez un consentement verbal enregistré avant de démarrer. Un kit à 300-400 $ couvre tous les scénarios, du bureau tranquille au hall d'un congrès bondé.
Un placement de micro soigné bat toutes les astuces logicielles existantes. Une interview de 90 minutes bien enregistrée se téléverse, se transcrit et renvoie une transcription annotée par locuteur en quelques minutes. Un enregistrement raté signifie des heures de nettoyage, quel que soit l'outil d'IA utilisé. Ce guide présente les configurations concrètes qui fonctionnent, avec du matériel réellement disponible en 2026.
Pourquoi l'enregistrement en présentiel diffère du travail en studio
Vous ne maîtrisez pas la pièce. Les interviews ont lieu dans des cafés, des halls d'hôtel, des bureaux en open space bruyants, sur les salons de congrès ou en voiture. Vous disposez peut-être de quatre-vingt-dix secondes pour tout installer avant que votre interlocuteur ne se sente gêné par le matériel.
Les vraies contraintes :
- Un bruit variable que vous ne pouvez pas réduire
- Des interlocuteurs qui bougent, changent de position ou s'éloignent
- Une fenêtre de temps limitée (généralement 30 à 60 minutes)
- Un seuil de confort : un matériel visible change la façon dont les gens parlent
La bonne nouvelle : la transcription par IA moderne pardonne un audio imparfait quand les fondamentaux sont respectés. Ces fondamentaux sont une distance micro constante et une séparation propre des voix.
Trois configurations qui couvrent tous les scénarios
| Configuration | Idéal pour | Coût approximatif du matériel | Séparation des voix |
|---|---|---|---|
| Micro cravate unique sur le sujet | Entretien individuel, questions-réponses journalistiques | 70-130 $ | Bonne (sujet uniquement) |
| Deux micros cravate, pistes séparées | Interviews à deux, chercheurs, podcasteurs | 270-400 $ | Excellente |
| Micro à surface posé sur la table | Groupes de 3 à 4 personnes, tables rondes | 35-180 $ | Correcte |
Configuration 1 : micro cravate unique sur le sujet
L'option la plus simple. Fixez un micro cravate sur la chemise du sujet, de six à huit pouces sous son menton, capsule légèrement inclinée vers le haut. Reliez-le à un enregistreur de terrain ou à votre téléphone.
Options fiables actuellement : le Rode SmartLav+ (~69 $ chez les grands revendeurs, vérifié en juillet 2026) se connecte directement à un smartphone via TRRS. Pour un enregistreur dédié, associez n'importe quel micro cravate filaire au Zoom H1essential (environ 99 $ prix constaté), qui enregistre en 32 bits flottant et neutralise la plupart des erreurs de gain avant qu'elles ne se produisent.
Cela capture votre sujet proprement. Vous n'êtes pas sur l'enregistrement, ce qui convient au journalisme de questions-réponses où vos questions sont courtes et dont vous vous souvenez. Pour les interviews analytiques plus longues où vos questions comptent autant que les réponses, passez à la configuration 2.
Configuration 2 : deux micros cravate sur des pistes séparées (recommandée)
Deux micros, un par locuteur, sur des canaux stéréo séparés : c'est la configuration vers laquelle convergent la plupart des journalistes et chercheurs en activité. Chaque locuteur obtient une piste propre et isolée, ce qui rend l'identification des locuteurs au moment de la transcription déterministe plutôt que probabiliste.
Pour les installations filaires, deux micros cravate économiques associés à un enregistreur multi-entrées font l'affaire. Le Zoom H4essential (~199 $ prix constaté) accepte deux entrées XLR/TRS sur des canaux séparés. Le Zoom H6essential (~299 $ prix constaté) gère quatre entrées simultanées et ajoute une fonction de piste de sécurité. Prix relevés auprès de Zoom et de revendeurs tiers, juillet 2026 ; les anciens modèles H5 et H1n ont été remplacés par cette série Essential.
En sans-fil, le système double canal Rode Wireless GO II (deux émetteurs, un récepteur) est toujours commercialisé activement à mi-2026, avec des prix constatés allant d'environ 185 $ à 299 $ selon le revendeur et le pack. Il offre une portée de 200 m et un enregistrement intégré dans chaque émetteur comme filet de sécurité.
Le surcoût est vite rentabilisé. Quand chaque voix occupe sa propre piste, vous téléversez un fichier stéréo et l'étape de diarisation se réduit à une simple séparation gauche/droite plutôt qu'à de la devinette acoustique. Pour en savoir plus sur l'effet de la séparation des voix sur la précision, consultez notre explication de la diarisation des locuteurs.
Configuration 3 : micro à surface posé sur la table
Pas de fixation, pas de temps d'installation. Posez un micro à surface (aussi appelé micro PZM) à plat au centre de la table. Le Shure MX391 et les modèles similaires, dans la gamme des 35 à 150 $, captent tout le monde dans un rayon d'environ deux mètres.
Utilisez cette option quand vos interlocuteurs refusent de porter un micro cravate, ou quand vous êtes plus de quatre et que les micros individuels deviennent peu pratiques.
La contrepartie : une seule piste mixte oblige l'IA à séparer les voix acoustiquement. Cela fonctionne bien avec deux voix très distinctes, mais se dégrade avec trois locuteurs ou plus aux tonalités proches. Le micro capte aussi tout le reste sur la table : tasses, froissement de papier, tapotements. Pour une installation mobile couvrant les interviews de groupe sur Android ou iPhone, un téléphone muni d'un adaptateur à surface à pince constitue un substitut raisonnable.
Détails de placement des micros
Pour les micros cravate :
- Fixez-le au revers ou sur la poitrine, de six à huit pouces sous le menton
- Inclinez légèrement la capsule vers le haut, en direction de la bouche
- Évitez les cols amples, les écharpes et les bijoux qui frottent contre la capsule
- Effectuez un test de 30 secondes et demandez au sujet de tourner la tête à gauche puis à droite pendant que vous surveillez les niveaux de l'enregistreur. Si les niveaux s'emballent quand il bouge, refixez le micro plus haut ou utilisez une boucle pour immobiliser le câble
Pour les micros à surface sur une table :
- Au centre de la table, à égale distance de tous les locuteurs
- Posé sur un tissu plié ou un carnet pour amortir les chocs transmis par la table
- À au moins 18 pouces des mains de chacun
- Loin des grilles de ventilation des ordinateurs portables
Pour les micros dynamiques tenus en main (l'approche micro canne) :
- De six à huit pouces de la bouche du locuteur
- Légèrement hors axe (incliné, non pointé directement vers la bouche) pour réduire les plosives
- Déplacez le micro lors des transitions entre locuteurs, jamais en pleine réponse
Les réglages d'enregistreur qui comptent
Ces réglages valent pour tout enregistreur de terrain de la série Zoom Essential ou équivalent :
- Format : WAV, 44,1 kHz, 16 bits minimum. Le 32 bits flottant (disponible sur la série Essential) est préférable car il rend la plupart des erreurs de gain rattrapables en post-production.
- Canaux : G et D affectés séparément. Avec la configuration 2, vérifiez que chaque micro cravate est bien routé vers son propre canal, et non sommé en mono.
- Gain : réglé pendant une conversation test de 30 secondes, pics entre -12 et -6 dB. Ne touchez plus au bouton de gain une fois l'interview lancée.
- Limiteur : activé. Il rattrape les éclats soudains, les rires et les coups sur la table avant saturation.
- Filtre coupe-bas : 80 Hz ou 100 Hz. Il supprime le grondement de la climatisation, les basses de la circulation et les bruits de manipulation sans toucher à la parole.
Choisir la pièce
Le choix de la pièce est sous-estimé. Quelques minutes passées à trouver le bon endroit rapportent plus que n'importe quelle mise à niveau de micro.
- Un coin ou une place contre le mur vaut mieux qu'une place au centre. Vous coupez le bruit réfléchi venant de deux directions.
- Placez-vous perpendiculairement aux sources de bruit (cuisines, entrées, couloirs de passage), pas parallèlement. En parallèle, les deux micros sont exposés au bruit de manière égale.
- Les surfaces dures renvoient le son. Une pièce avec moquette, meubles rembourrés ou même de lourds rideaux produit un audio plus intelligible qu'une salle de réunion en verre et carrelage.
- Si le bruit ambiant rivalise avec la parole, changez de lieu ou reportez. Aucune technique de micro ni aucun modèle d'IA ne récupère un audio où le bruit de fond atteint le même volume que le locuteur.
Enregistrez 20 à 30 secondes d'ambiance sonore de la pièce au début ou à la fin. Si vous utilisez ensuite un logiciel de réduction de bruit, cet échantillon fournit à l'algorithme un profil de bruit propre à soustraire.

Enregistrement de secours
Utilisez un second appareil. Toujours.
Le minimum : posez votre téléphone sur la table avec une application de mémo vocal en marche. Cela rattrape les batteries mortes, les cartes pleines et les plantages du firmware de l'enregistreur, qui arrivent toujours au pire moment.
Une installation redondante professionnelle utilise deux enregistreurs simultanément. Beaucoup d'enregistreurs de terrain de la gamme Zoom Essential et de la série H proposent des modes double enregistrement qui écrivent la même entrée dans deux fichiers à des réglages de gain différents, vous offrant une copie de sécurité à un niveau inférieur si la piste principale sature.
Perdre l'audio d'une interview est un problème qui peut marquer toute une carrière. Un appareil de secours coûte une minute d'installation.
Flux de travail de transcription après l'interview
Copiez les fichiers sur votre ordinateur portable. Pour un fichier stéréo à deux pistes (configuration 2), téléversez-le directement dans l'outil audio-vers-texte de ConvertAudioToText et sélectionnez votre langue. Les deux pistes distinctes donnent à l'étape de diarisation un signal solide sur lequel travailler.
Pour les fichiers mono-piste (configurations 1 et 3), téléversez-les de la même façon. La précision de la séparation des voix sur une piste mixte unique dépend fortement de la distinction entre les deux voix et du degré de chevauchement. Pièce plus silencieuse, moins de chevauchement, voix plus distinctes : meilleurs résultats. Pour approfondir le fonctionnement des calculs de précision, consultez notre explication de la précision de transcription.
Pour les chercheurs qui construisent une analyse structurée, le guide de transcription d'un enregistrement d'interview détaille le flux post-transcription pour extraire les thèmes et les citations clés. Pour les journalistes sous pression du temps, créer un compte rendu de réunion à partir d'un audio couvre l'étape d'extraction du résumé.
Si vous avez besoin d'une transcription sans créer de compte, ConvertAudioToText traite les fichiers audio directement, sans inscription requise pour les fichiers courts.
Le consentement avant d'appuyer sur enregistrer
Obtenez un consentement verbal sur l'enregistrement lui-même, avant que la conversation de fond ne commence. « Cette interview est enregistrée, cela vous convient-il ? », suivi d'un « oui » clair sur la bande, protège à la fois vous et votre interlocuteur.
La loi fédérale américaine et la plupart des États autorisent l'enregistrement avec le consentement d'une seule partie (seule la personne qui enregistre doit donner son accord). Depuis 2026, 12 États exigent le consentement de toutes les parties : Californie, Connecticut, Delaware, Floride, Illinois, Maryland, Massachusetts, Montana, New Hampshire, Oregon, Pennsylvanie et Washington. Le Connecticut et l'Oregon comportent des nuances : le Connecticut applique le consentement de toutes les parties aux appels téléphoniques mais celui d'une seule partie aux conversations en présentiel en droit pénal ; l'Oregon exige le consentement de toutes les parties spécifiquement pour les communications en présentiel. Le Reporters Committee for Freedom of the Press publie une enquête actualisée couvrant les 50 États et constitue la source de référence à consulter avant d'enregistrer dans une juridiction qui vous est peu familière.
Pour les interviews confidentielles ou sensibles, vérifiez ce que toute plateforme de transcription promet en matière de conservation et d'accès aux données avant de téléverser. Les politiques varient.
Un kit de terrain qui tient dans un sac à dos
Le kit qui couvre 90 % des scénarios :
- Enregistreur Zoom H4essential (~199 $)
- Deux micros cravate filaires économiques avec connecteurs XLR ou TRS (~30 à 60 $ pièce)
- Piles AA de rechange et carte SD 32 Go neuve
- Un câble rallonge XLR court (permet à votre interlocuteur de s'asseoir plus loin de l'enregistreur)
- Téléphone en mode avion, mémo vocal en marche, posé sur la table en secours
Total : environ 280 à 350 $, selon le choix du micro cravate. Durera des années pour tous les formats, du bureau calme au hall de congrès bruyant.
Faites un test de 60 secondes au début de chaque interview avant de passer à vos vraies questions. Vérifiez les niveaux, les deux canaux, et écoutez s'il y a des frottements de tissu. Vous n'aurez jamais besoin de l'enregistrement de secours, sauf cette fois où il le faudra.
FAQ
Quelle configuration micro est la meilleure pour une interview en présentiel à deux ?
Deux micros cravate, un fixé sur chaque locuteur, reliés à des canaux séparés sur un enregistreur de terrain stéréo. Chaque locuteur dispose ainsi d'une piste propre et isolée, ce qui garantit une séparation fiable des voix au moment de la transcription. Un micro unique captant les deux locuteurs fonctionne aussi, mais il repose sur les différences acoustiques des voix pour distinguer les interlocuteurs, ce qui est moins constant.
À quelle distance de la bouche du locuteur faut-il placer un micro cravate ?
De six à huit pouces sous le menton, sur le revers ou le haut de la poitrine, avec la capsule légèrement inclinée vers le haut. À moins de quatre pouces, vous risquez des plosives et des bruits de respiration. Au-delà de dix pouces, le niveau baisse et le bruit ambiant entre en concurrence avec la voix.
Dois-je avertir quelqu'un que je l'enregistre ?
Aux États-Unis, la loi fédérale autorise l'enregistrement avec le consentement d'une seule partie, c'est-à-dire que vous pouvez enregistrer une conversation à laquelle vous participez sans en informer l'autre personne. Cependant, depuis 2026, douze États exigent le consentement de toutes les parties : Californie, Connecticut, Delaware, Floride, Illinois, Maryland, Massachusetts, Montana, New Hampshire, Oregon, Pennsylvanie et Washington. Obtenir un consentement verbal au début de l'enregistrement est la pratique la plus sûre dans toutes les juridictions et constitue la norme en journalisme.
Quels réglages d'enregistreur donnent l'audio le plus propre pour la transcription ?
Format WAV à 44,1 kHz, 16 bits ou plus, avec un gain réglé pour que les pics atteignent -12 à -6 dB pendant une conversation test. Activez le limiteur et un filtre coupe-bas à 80-100 Hz. Évitez de toucher au gain pendant l'interview. Si votre enregistreur prend en charge l'enregistrement en 32 bits flottant (c'est le cas de la série Zoom Essential), utilisez-le : il rend la plupart des erreurs de gain rattrapables en post-production sans réenregistrement.
Sources
- Gamme Zoom série H Essential (H1essential, H4essential, H6essential) : https://zoomcorp.com/en/us/handheld-recorders, consulté en juillet 2026
- Page produit Rode Wireless GO II : https://rode.com/en-us/products/wirelessgoii, consulté en juillet 2026
- Page produit Rode SmartLav+ et annonces des revendeurs : https://rode.com/en-us/products/smartlav-plus + https://sweetwater.com, consulté en juillet 2026
- Liste des États à consentement de toutes les parties : https://recordinglaw.com/party-two-party-consent-states, consulté en juillet 2026
- Reporters Committee for Freedom of the Press, « Reporters Recording Guide » : https://rcfp.org (enquête de référence couvrant les 50 États, vérifiez l'édition en cours)
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles
How to Add Timestamps to a Transcript
Learn how to add timestamps to a transcript with an audio-to-text tool, then export timestamped SRT or VTT subtitle files for easy navigation and editing.
How to Transcribe a Conference Talk to Text
Learn how to transcribe a conference talk or keynote to text, label speakers, and export SRT, VTT, or TXT using a straightforward upload or URL workflow.