Les images-clés expliquées : pourquoi votre coupe ne tombe pas toujours où vous l'aviez placée
Vous placez le début de l’extrait à exactement 4,2 secondes, vous exportez, et le résultat commence à 4,0. Rien n’est cassé : vous venez de rencontrer le fonctionnement réel de la compression vidéo.
Toutes les images ne se valent pas
Un fichier vidéo ne stocke pas une image complète pour chaque trame — ce serait énorme. La compression exploite le fait que des images consécutives sont presque identiques. Si quelqu’un parle devant une caméra fixe, l’arrière-plan ne change pas entre l’image 100 et l’image 101 : aucune raison de le stocker deux fois.
Les encodeurs produisent donc trois types d’images :
Les images I (intra-codées, appelées images-clés) contiennent une image complète et se décodent seules, sans référence à quoi que ce soit.
Les images P (prédites) ne stockent que les différences par rapport à une image précédente. Sans cette référence, elles ne veulent rien dire.
Les images B (bidirectionnelles) stockent les différences par rapport à des images antérieures et postérieures. Elles compressent encore mieux et dépendent encore plus de leurs voisines.
Un encodage typique place une image I toutes les une à dix secondes, avec des dizaines d’images P et B entre elles. Cet ensemble s’appelle un GOP.
Pourquoi cela limite les points de coupe
Pour démarrer la lecture à un instant donné, le décodeur a besoin d’une image complète comme point de départ, c’est-à-dire d’une image I. Si le point choisi tombe sur une image P, il n’y a rien pour la reconstruire, puisque les images dont elle dépend ont été écartées.
Restent deux options, et chaque outil en choisit une.
Option 1 : copie directe, ou découpage sans perte
L’outil copie les données compressées dans un nouveau fichier sans les décoder. Rien n’est recompressé : aucune perte de qualité, et c’est extrêmement rapide, souvent quasi instantané même sur de gros fichiers.
Le revers est que les coupes ne peuvent tomber que sur une image I. Vous demandez 4,2 secondes, vous obtenez l’image-clé précédente la plus proche, peut-être 4,0. Si l’encodage espace largement les images-clés, l’écart peut atteindre quelques secondes.
Option 2 : réencoder
L’outil décode la vidéo, écarte les images non voulues et encode un nouveau fichier avec une image-clé exactement au point choisi. La coupe est précise à l’image près.
Le coût est le temps et une perte générationnelle. Réencoder est bien plus lent, chaque image devant être décodée puis recompressée. Et comme le H.264 est un format avec pertes, recompresser de la vidéo déjà compressée retire encore un peu de détail. Une passe est généralement invisible ; les passes répétées s’accumulent.
Lequel choisir
Pour l’essentiel des découpages, la précision à l’image compte moins qu’on ne le pense. Si vous retirez quelques secondes de silence au début d’un enregistrement, tomber à 4,0 plutôt qu’à 4,2 n’a aucune importance, et la rapidité comme la préservation de la qualité valent bien davantage.
La précision compte quand la coupe fait un travail créatif : tomber sur un temps musical, sur un geste, sur un mot précis. Là, le réencodage justifie son coût.
Une habitude utile : découpez sans perte quand vous retirez du superflu, et réencodez quand l’image exacte porte du sens.
Obtenir des coupes plus précises
Si vous maîtrisez l’enregistrement d’origine, réduisez l’intervalle entre images-clés à l’encodage. La plupart des logiciels l’exposent sous « intervalle d’images-clés » ou « taille du GOP ». Une image-clé par seconde offre des points de coupe sans perte bien plus fins, pour un coût modeste en taille. Les enregistreurs d’écran utilisent souvent des intervalles longs par défaut, ce qui explique précisément pourquoi leurs fichiers sont difficiles à découper proprement.