Vidéo horizontale en verticale : passer une interview 16:9 en 9:16 sans couper les têtes
Tu as une vidéo 16:9 et il te faut du 9:16 pour TikTok, sans que les visages sortent du cadre. Voici les quatre méthodes possibles, ce que chacune coûte à l'image, et comment laisser le cadrage se faire tout seul.
Martinfondateur de Moqi··12 min de lecture
Passer une vidéo horizontale en verticale, c'est jeter environ 70 % de la largeur de l'image. La seule question qui compte : qu'est-ce que tu gardes. Quatre réponses existent. Recadrer sur une zone fixe, ajouter des bandes floues en haut et en bas, empiler deux personnes en écran partagé, ou suivre la personne qui parle plan par plan. Sur une interview à deux, seule la dernière tient la route.
Le réflexe habituel, recadrer au centre, est justement le pire choix sur un dialogue. En 16:9, deux interlocuteurs sont assis de part et d'autre du cadre. Le centre, c'est le mur derrière eux, la plante verte, le pied de micro. Tu obtiens un clip vertical propre techniquement et vide humainement.
On va voir comment décider méthode par méthode, ce que fait concrètement un suivi de locuteur, les cas où aucun outil ne s'en sort proprement, et comment obtenir une sortie 9:16 sans toucher aux réglages.
Pourquoi recadrer au centre est le pire choix pour une interview
Une caméra fixe qui filme deux personnes place les visages sur les tiers gauche et droit. C'est du cadrage de base, et c'est très bien en 16:9. Le problème arrive quand tu découpes une fenêtre verticale au milieu : cette fenêtre tombe pile sur l'espace vide entre les deux têtes.
Prends un podcast de 50 minutes filmé au plan large, deux invités face à face. Tu extrais un passage de 40 secondes, tu recadres au centre. À l'écran, on voit deux épaules coupées et un fond de studio. On entend un échange vivant, on regarde du décor. Sur TikTok, le pouce descend avant la deuxième phrase.
Même sur un plateau à une personne, le centre trahit. Beaucoup de conférenciers se tiennent décalés à droite du cadre parce que l'écran de projection occupe la gauche. Recadrage centré : tu obtiens une belle diapositive et une moitié de visage sur le bord.
Les quatre façons de rendre une vidéo verticale
Chacune a un usage précis. Le choix dépend du nombre de personnes à l'écran et de la fréquence des changements de plan.
Le recadrage fixe sur une personne
Tu choisis une zone du 16:9 et tu la gardes pendant tout le clip. C'est net, c'est stable, ça ne bouge jamais au mauvais moment. Ça marche parfaitement dans un cas : un monologue face caméra, une personne seule, un cadre qui ne change pas. Un extrait de cours, une prise de parole en solo, un unboxing.
Dès qu'un deuxième visage entre dans le champ, le recadrage fixe devient une frustration. L'invité répond hors champ. Tu peux le corriger à la main en posant des images clés sur la position du cadre, mais sur un podcast entier ça représente des dizaines de manipulations par clip.
Les bandes floues : garde tout, perd la moitié de l'écran
Tu poses la vidéo 16:9 au milieu, tu remplis le haut et le bas avec une version agrandie et floutée de la même image. Rien n'est coupé : les deux personnes restent visibles. C'est la solution de sécurité quand tu ne veux prendre aucun risque de cadrage.
Le coût est visuel. Ta vidéo occupe une bande centrale, les visages sont petits, et le regard n'a rien à accrocher sur un écran de téléphone. Les bandes floues se défendent quand l'image contient une information à ne pas perdre, un tableau blanc, un schéma, un partage d'écran. Sur un dialogue, tu payes plein tarif un plan large déjà trop large.
L'écran partagé : deux personnes empilées, quand c'est bien
Tu découpes deux zones du 16:9 et tu les empiles verticalement : une personne en haut, l'autre en bas. Les deux visages restent grands, le format est plein. C'est la meilleure option pour un enregistrement à deux caméras, un appel visio, ou un débat où les réactions comptent autant que les réponses.
Ça se gâte à trois personnes ou plus, où chaque case devient minuscule. Et sur un long passage où une seule personne parle, l'écran partagé garde la moitié de l'écran occupée par quelqu'un qui écoute en silence.
Le suivi de la personne qui parle : le seul qui marche sur un dialogue
Le cadre se déplace au fil de la conversation et se pose sur celui qui a la parole. Question de l'intervieweur, le cadre est sur elle. Réponse de l'invité, le cadre glisse sur lui. C'est exactement ce que ferait un cadreur derrière la caméra, et c'est ce que le spectateur attend sans y penser.
C'est aussi le plus difficile à obtenir. Il ne suffit pas de détecter des visages : il faut savoir lequel des deux produit le son qu'on entend. C'est là que la plupart des recadrages automatiques s'arrêtent, et c'est le sujet de la section suivante.
Méthode
Quand elle marche
Ce que tu perds
Recadrage fixe
Une personne seule, cadre stable
Tout ce qui sort de la zone choisie
Bandes floues
Schéma, partage d'écran, plan à préserver
La moitié de l'écran, la taille des visages
Écran partagé
Deux personnes, deux caméras, visio
Confort dès trois personnes ou monologue long
Suivi de la personne qui parle
Interview, podcast, table ronde
Précision sur plan très large ou de profil
Ce que fait un bon suivi
Derrière l'expression « recadrage automatique », les comportements sont très différents d'un outil à l'autre. Voici les cinq gestes qui séparent un cadrage regardable d'un cadrage qui donne le mal de mer.
Détecter les visages plan par plan
Une vidéo montée change de plan. Gros plan, plan large, insert, retour caméra. Un suivi qui analyse la vidéo comme une seule séquence continue traîne son cadre d'un plan à l'autre et se trompe à chaque coupe. L'analyse doit repartir de zéro à chaque changement de plan, et redétecter les visages présents.
Savoir qui parle en croisant le mouvement de la bouche avec le son
C'est le critère décisif, et il est rarement expliqué. Détecter deux visages est facile. Savoir lequel parle demande de croiser deux signaux : le mouvement des lèvres image par image, et la présence de parole dans la bande son au même instant. Quand les deux coïncident, on tient le locuteur. Quand ils ne coïncident pas, on ne devine pas.
Un outil qui suit seulement le mouvement le plus important dans l'image cadrera la personne qui gesticule, pas celle qui parle. Sur une interview où l'invité s'exprime avec les mains pendant que l'autre pose la question, la différence saute aux yeux.
Lisser le mouvement
Dans une conversation rapide, les tours de parole s'enchaînent en moins d'une seconde. Si le cadre saute à chaque réplique, le clip devient illisible. Un bon suivi amortit : il attend qu'une prise de parole s'installe avant de bouger, et il se déplace en glissant plutôt qu'en sautant.
Resserrer quand la personne est loin
Sur un plan large de conférence, un visage occupe une toute petite partie de l'image. Garder la même échelle de cadre donne une silhouette perdue au milieu du vide. Le cadre doit se resserrer, quitte à perdre en définition, pour que le visage tienne une place réelle sur un écran de téléphone.
Garder un plan de groupe stable en cas de doute
C'est le comportement le plus utile et le moins spectaculaire. Quand le signal est ambigu, plusieurs personnes qui parlent en même temps, rires, chevauchement, la bonne réaction est de garder un cadre large sur le groupe. Mieux vaut un plan un peu large qu'un cadre planté sur la mauvaise tête pendant huit secondes.
C'est la logique de le recadrage vertical automatique dans Moqi : visages détectés plan par plan, locuteur identifié en croisant la bouche et le son, suivi de 1 à 3 personnes, plan de groupe conservé en cas de doute. Le détail du fonctionnement est décrit dans comment les clips sont générés.
Colle un lien YouTube et regarde ce que donne le cadrage automatique sur ton propre plan large.
Aucun recadrage automatique ne réussit tout. Autant savoir à l'avance où il va rester prudent, ça évite de chercher un réglage qui n'existe pas.
Plan très large ou de profil
Une conférence filmée du fond de la salle, ou un invité cadré strictement de profil : les repères du visage sont partiels, le mouvement des lèvres est difficile à lire. Dans ce cas, le cadre reste large. Ce n'est pas une erreur, c'est le choix le moins risqué. Si ce type de plan domine ta vidéo, l'écran partagé ou les bandes floues restent parfois plus honnêtes.
Changements de plan incessants
Un montage nerveux, avec une coupe toutes les deux secondes, laisse très peu de matière à analyser par plan. Le suivi se recale sans arrêt et le résultat manque de stabilité. Sur ce genre de source, privilégie des extraits pris dans les passages posés, typiquement les moments de discussion sans habillage.
Gameplay avec caméra incrustée
Sur un live Twitch, tu as le jeu en plein écran et la webcam dans un coin. Empiler les deux est la seule mise en page qui garde le jeu lisible et la réaction visible. Moqi passe en écran partagé automatiquement quand il repère une caméra incrustée sur du gameplay.
Animation sans visage
Motion design, capture d'écran, tutoriel logiciel sans caméra : il n'y a pas de locuteur à suivre. Le cadre se pose au centre et n'en bouge plus. À toi de vérifier que l'information utile de ton image se trouve bien dans la bande centrale, sinon les bandes floues restent le bon choix.
Vidéo déjà verticale
Si ta source est déjà en 9:16, il n'y a rien à recadrer. Le travail se déplace ailleurs : choix des extraits, rythme, et les sous-titres TikTok qui portent la moitié de la lisibilité sur mobile.
Les outils
Plusieurs logiciels proposent un recadrage automatique. Ils ne suivent pas tous la même chose, et c'est ce détail qui détermine le résultat sur une interview.
CapCut propose un recadrage automatique. Adobe Premiere Pro propose Auto Reframe, qui suit le mouvement dans l'image. Filmora propose également un recadrage automatique. Ces outils suivent un sujet ou un mouvement, pas la personne qui parle (relevé sur leurs sites officiels le 3 septembre 2026). Pour leurs tarifs et le détail de leurs options, va voir leurs sites, je ne les invente pas ici.
Outil
Ce qu'il suit
Bon pour
CapCut
Un sujet dans l'image
Clip à une personne, retouches manuelles
Premiere Pro (Auto Reframe)
Le mouvement dans l'image
Montage complet, correction image par image
Filmora
Un sujet dans l'image
Montage grand public
Moqi
La personne qui parle, bouche plus son
Interview, podcast, table ronde à 2 ou 3
En pratique, si ton clip contient une seule personne, n'importe lequel de ces outils fera l'affaire et tu resteras dans ton logiciel de montage habituel. Si ton clip contient un dialogue, la question devient : est-ce que l'outil sait qui parle. C'est la seule différence qui se voit à l'écran.
Le second critère est le volume. Corriger un cadrage à la main sur trois clips par mois, c'est faisable. Sur un podcast hebdomadaire dont tu tires cinq à dix extraits, c'est un poste de travail à part entière. C'est l'intérêt d'une chaîne complète, comme celle décrite dans transformer un podcast en clips TikTok.
Étape par étape avec Moqi
Moqi est un logiciel français de clipping, en ligne, créé en 2026 par Martin, entrepreneur individuel à Paris. Il prend une vidéo longue et en sort des clips verticaux prêts pour TikTok, Reels et Shorts.
Colle un lien YouTube, ou importe un fichier MP4, MOV ou WEBM de moins de deux heures contenant de la parole. Les liens acceptés sont ceux de YouTube uniquement, hors direct en cours.
Ne règle rien pour le cadrage. Le passage en 9:16 est automatique : visages détectés plan par plan, locuteur identifié en croisant le mouvement de la bouche et le son, écran partagé quand il y a une caméra incrustée sur du gameplay, cadre au centre s'il n'y a pas de visage.
Laisse tourner le temps d'un café. Moqi choisit les moments forts, découpe sur des phrases entières, recadre et écrit les sous-titres depuis le son, animés mot par mot, en français, anglais ou espagnol.
Regarde les clips par note de potentiel sur 100, et publie d'abord ceux qui arrivent en tête.
Vérifie le clip sur ton téléphone avant publication, en plein écran. C'est le seul contrôle qui compte : un cadrage se juge sur l'écran où il sera vu, pas sur un moniteur 27 pouces.
La sortie est un fichier vertical prêt à publier. Tu peux le télécharger, ou publier directement sur un compte TikTok relié, avec programmation des publications à partir de la formule Pro.
L'essai est gratuit et sans carte bancaire : une vidéo, 3 clips d'une minute, le premier téléchargeable avec un filigrane, fichiers gardés 24 heures. Ensuite, Starter à 9 € par mois, Pro à 19 €, Studio à 39 €, sans engagement. Le premier mois de Pro est à 0,99 € pour un nouveau client. Un point à ne pas oublier : les conditions demandent que tu disposes des droits sur la vidéo que tu clippes.
Prends une interview 16:9 déjà en ligne et regarde la version verticale qui en sort.
Comment passer une vidéo 16:9 en 9:16 sans couper les visages ?+
Il faut un cadrage qui se déplace sur la personne qui parle plutôt qu'une fenêtre fixe au centre. Sur une interview à deux, le centre du 16:9 tombe presque toujours entre les deux têtes. Les alternatives sont l'écran partagé, qui empile les deux visages, ou les bandes floues, qui gardent l'image entière mais réduisent beaucoup sa taille à l'écran.
Le recadrage automatique de CapCut suit-il la personne qui parle ?+
CapCut propose un recadrage automatique qui suit un sujet dans l'image, comme Premiere Pro avec Auto Reframe qui suit le mouvement, et Filmora (relevé sur leurs sites officiels le 3 septembre 2026). Suivre un sujet et identifier le locuteur sont deux choses différentes : sur un dialogue, le cadre peut rester sur la personne qui bouge le plus, pas sur celle qui parle.
Vaut-il mieux des bandes floues ou un recadrage sur le visage ?+
Les bandes floues conviennent quand l'image contient une information à préserver, un schéma, un tableau, un partage d'écran. Dès qu'il s'agit d'une conversation filmée, elles font perdre la moitié de la hauteur pour rien. Sur du dialogue, un cadrage qui suit le locuteur donne des visages beaucoup plus lisibles sur téléphone.
Que se passe-t-il si la vidéo est filmée en plan très large ?+
Sur un plan très large ou de profil, les repères du visage sont partiels et le mouvement des lèvres devient difficile à lire. Un bon recadrage garde alors un cadre large et stable plutôt que de risquer de se poser sur la mauvaise personne. Si toute ta vidéo est filmée ainsi, l'écran partagé ou les bandes floues restent souvent plus lisibles.
Peut-on convertir une vidéo YouTube en format vertical automatiquement ?+
Oui, en collant le lien YouTube dans un outil de clipping. Moqi accepte les liens youtube.com/watch, youtu.be, Shorts, m.youtube et YouTube Music, hors direct en cours, et sinon l'import d'un fichier MP4, MOV ou WEBM de moins de deux heures. Une vidéo privée, réservée aux membres, restreinte par pays ou réservée aux majeurs ne peut pas être récupérée.
Essaie sur ta propre vidéo
Colle un lien YouTube ou importe ta vidéo : Moqi en sort des clips verticaux sous-titrés, recadrés sur la personne qui parle. Première vidéo offerte, sans carte bancaire.