Pourquoi vos fichiers MP4 grossissent plus vite que votre disque
Un MP4 n'est pas lourd par nature. Il le devient parce qu'un débit, un codec et une cadence ont été choisis sans tenir compte du contexte de diffusion. Un plan 4K à 60 images par seconde peut facilement dépasser 1 Go par minute une fois encodé en H.264 avec un débit confortable. Multiplié par un épisode, puis par une saison, cela représente des téraoctets, des envois qui échouent, des recompressions imposées par les plateformes et des sauvegardes impossibles à tenir.
Entre 50 et 80 % du poids peut disparaître sans que l'œil remarque la différence, à condition de comprendre trois choses : ce que le codec sait jeter, ce que l'œil ne perçoit pas, et ce que votre chaîne de production fait avant l'encodage. Les conseils du type « baisse le débit » produisent des images molles, des dégradés en bandes et des ciels pixelisés.
« Sans perte » : trois définitions à ne pas confondre
- Sans perte stricte : les pixels décodés sont identiques aux pixels encodés. Gains modestes, fichiers lourds, usage limité à l'archivage et aux masters.
- Visuellement sans perte : la différence est mathématiquement mesurable mais invisible dans des conditions de visionnage normales. C'est la cible réaliste de la majorité des projets.
- Perceptuellement optimisée : on accepte des écarts dans les zones peu regardées pour investir les données là où l'attention se porte.
Clarifier lequel de ces trois objectifs est visé évite des semaines de débats avec un client qui pensait recevoir une copie strictement identique.
Les fondations : ce que fait réellement un codec
Prédiction spatiale et temporelle
Un encodeur ne stocke pas des images : il stocke des différences. La prédiction intra exploite la ressemblance entre pixels voisins d'une même image ; la prédiction inter compare l'image courante aux images déjà transmises et décrit le mouvement par des vecteurs. Plus la scène est stable, plus cette description est compacte. Un plan fixe avec un fond uni se compresse admirablement ; une foule en mouvement, des confettis ou des feuilles agitées par le vent coûtent cher, car une grande quantité de détails change de position à chaque image.
Quantification : là où l'on perd vraiment
Après transformation en fréquences, l'encodeur divise les coefficients par un facteur de quantification. Les hautes fréquences — textures fines, grain, petits détails — sont les premières sacrifiées, car l'œil y est moins sensible. C'est aussi ce qui produit l'effet « plastique » typique des encodages trop agressifs : la peau perd son grain, les cheveux deviennent des aplats, l'herbe se transforme en masse verte uniforme.
Codecs : choisir le bon compromis
Quatre familles suffisent à couvrir la plupart des besoins :
- H.264/AVC : compatibilité maximale, efficacité moyenne. Toujours pertinent pour du 1080p destiné à des appareils anciens.
- H.265/HEVC : environ 40 à 50 % de données en moins à qualité égale par rapport au H.264, au prix d'un encodage plus lent et de questions de licences selon les usages.
- AV1 : excellent rendement, libre de redevances, idéal pour le web. L'encodage logiciel peut être lent, mais les implémentations matérielles récentes ont beaucoup progressé.
- VVC/H.266 : gains supplémentaires, écosystème encore restreint. À surveiller plutôt qu'à déployer partout.
Pour un même fichier source, passer de H.264 à AV1 à qualité visuelle équivalente représente souvent 30 à 50 % de poids en moins. C'est le levier le plus puissant, avant même de toucher aux réglages fins.
Structure GOP, images clés et cadence
Un flux est découpé en groupes d'images. Une image clé est autonome et coûte cher ; les images prédites s'appuient sur leurs voisines. Allonger la distance entre images clés réduit le poids, mais complique le montage, le défilement image par image et la reprise après erreur. Une valeur courante se situe entre 2 et 5 secondes, ou alignée sur la cadence lorsque le contenu change très vite.
Côté cadence, ne conservez que ce dont vous avez besoin. Du 60 i/s pour une interview ou un tutoriel est presque toujours du gaspillage : le 24 ou 25 i/s divise le nombre d'images à encoder et réduit le poids de 30 à 50 % à qualité par image constante. À l'inverse, un ralenti soigné se tourne à cadence élevée et se réinterprète à la baisse.
Le CRF : le réglage le plus rentable
Le mode à débit constant impose le même budget à toutes les scènes. Résultat : les scènes simples sont surdimensionnées, les scènes complexes sont massacrées. Le mode à débit variable avec facteur de qualité constant ajuste au contraire le débit scène par scène pour maintenir une qualité cible.
Choisir sa valeur
Repères pratiques pour du H.264 ou H.265 en 1080p :
- CRF 18 : qualité très élevée, poids important. Utile pour un master de travail.
- CRF 20-22 : meilleur compromis pour la plupart des livraisons, y compris les sites client et les plateformes de partage.
- CRF 23-25 : acceptable pour le web, les vidéos internes, les previews.
- CRF 28 et au-delà : visiblement dégradé sur les scènes difficiles, à réserver aux vignettes ou aux versions mobiles.
Pour AV1, les valeurs utiles sont souvent plus basses, généralement entre 24 et 32, car l'échelle diffère. Ne transposez jamais une valeur d'un codec à l'autre sans test comparatif.
Débit variable contraint
Le CRF pur peut produire des pics de débit qui saturent un lecteur ou dépassent un plafond d'hébergement. La solution consiste à combiner qualité cible, débit maximal et taille de tampon. C'est la configuration standard des livraisons professionnelles et des plateformes de diffusion.
Deux passes : encore utiles ?
Le mode deux passes reste pertinent quand la taille finale est imposée, par exemple « ne pas dépasser 500 Mo ». Il analyse d'abord tout le film pour répartir intelligemment le budget. Sans contrainte de taille, le CRF seul suffit et va plus vite.
Audio, conteneur et métadonnées : les kilos faciles
Beaucoup de gains négligés viennent de l'audio et du conteneur.
- Une piste audio en haute qualité peut peser bien plus lourd qu'on ne l'imagine. Un encodage AAC à 128-192 kb/s en stéréo est transparent pour la majorité des contenus parlés ; pour la musique, 256 kb/s constitue un bon garde-fou.
- Un flux multicanal inutilisé peut être supprimé ou remplacé par un mixage stéréo.
- Des pistes de sous-titres obsolètes et des métadonnées lourdes peuvent être nettoyées sans risque.
- Le choix du conteneur compte : MP4 pour la compatibilité large, MKV pour l'archivage souple. Choisir dès le départ évite des conversions inutiles.
Une vérification rapide s'impose : combien de pistes audio, à quel débit, pour quel usage ? Le simple nettoyage rend souvent 5 à 15 % du poids.
Ce que l'IA apporte réellement à la compression
Les modèles d'apprentissage ne remplacent pas les codecs : ils interviennent en amont et en aval de l'encodage.
Débruitage et pré-nettoyage
Le grain, le bruit de capteur et les artefacts de compression sont extrêmement coûteux : l'encodeur dépense des données pour reproduire du bruit aléatoire. Un débruitage temporel intelligent supprime ce bruit tout en préservant les textures importantes. Le gain typique se situe entre 20 et 40 % de poids à qualité perçue égale. Attention aux modèles trop agressifs, qui lissent les visages et donnent un rendu cireux difficile à corriger ensuite.
Détection de scènes et allocation dynamique
Les outils modernes détectent les changements de plan, les zones de mouvement et l'importance relative des régions de l'image : visages, texte à l'écran, produits. Cette analyse permet de placer les images clés au bon endroit et d'allouer plus de données aux segments critiques. Un plan large statique n'a pas besoin du même budget qu'un gros plan sur un visage en mouvement.
Super-résolution et restauration
Pour des sources anciennes ou de basse résolution, la super-résolution peut préparer une version propre avant réencodage, ou permettre d'obtenir un rendu 1080p lisible à partir d'une source 720p. Le piège classique : l'upscale inventé consomme beaucoup de données et peut sembler plus net sans contenir davantage d'information réelle. À utiliser quand l'objectif est la perception, pas l'archivage.
Analyse perceptuelle automatisée
Des métriques comme VMAF ou SSIM comparent la version compressée à la source et prédisent la qualité perçue. Elles permettent de départager objectivement plusieurs réglages au lieu de trancher à l'œil. Utilisez-les comme boussole, jamais comme verdict absolu : un visage légèrement lissé peut obtenir un excellent score et pourtant gêner un directeur photo.
Chaîne de travail pas à pas
Étape 1 : diagnostic
Mesurez avant d'agir : poids total, codec, débit, résolution, cadence, pistes audio, durée. Identifiez le maillon faible. Un débit de 80 Mb/s pour du 1080p indique un potentiel énorme ; un fichier déjà encodé en AV1 à 2 Mb/s n'a presque rien à gagner.
Étape 2 : prétraitement
Coupez ce qui ne sert pas : génériques, silences, plans redondants. Débruitez si nécessaire, stabilisez, corrigez l'exposition. Un fichier source propre se compresse toujours mieux qu'un fichier bruité.
Étape 3 : encodage
Choisissez le codec selon la cible, fixez la résolution et la cadence réelles, réglez la qualité cible, ajoutez des limites de débit si besoin, définissez la structure des groupes d'images. Encodez ensuite un extrait représentatif avant de lancer le fichier complet : un test de deux minutes sur les scènes les plus difficiles fait gagner des heures.
Étape 4 : contrôle qualité
Comparez côte à côte à 100 % sur des zones exigeantes : visages en mouvement, dégradés de ciel, texte fin, scènes sombres. Vérifiez la synchronisation audio, les métadonnées et la lecture sur plusieurs appareils — navigateur, téléphone, téléviseur.
Étape 5 : livraison et archivage
Conservez toujours un master intact et une version de travail à qualité élevée. Livrez la version optimisée au format demandé. Nommez clairement les fichiers pour éviter de confondre master et version compressée lors d'une prochaine demande.
Erreurs fréquentes
- Baisser le débit sans changer de codec : on perd de la qualité pour un gain médiocre.
- Réencoder un fichier déjà compressé, ce qui empile les artefacts.
- Appliquer un débruitage trop fort sur des visages ou des matières texturées.
- Utiliser une même valeur de qualité d'un codec à l'autre.
- Oublier la cadence : convertir du 60 i/s en 30 i/s sans réflexion peut créer des saccades.
- Ignorer les pistes audio inutiles, qui pèsent souvent plus que prévu.
- Juger la qualité sur un lecteur en plein écran plutôt qu'à 100 %.
- Supprimer le master après compression, privant toute révision ultérieure.
Trois profils, trois stratégies
Contenu social vertical : priorité à la compatibilité et à la fluidité de lecture. H.264 ou HEVC, qualité cible modérée, format 1080x1920, cadence 30 i/s, audio 128 kb/s. Le fichier doit rester léger et se téléverser rapidement depuis un téléphone.
Livraison client ou diffusion large : AV1 ou HEVC, qualité cible élevée, audio 192 à 256 kb/s, limites de débit douces, contrôle avec une métrique perceptuelle. Objectif : meilleure qualité perçue pour un poids raisonnable, avec une version de repli compatible.
Archivage : masters en codec intra ou sans perte, plus une version AV1 visuellement sans perte pour la consultation rapide et le transfert entre collaborateurs.
FAQ
Peut-on réduire un MP4 sans aucun réencodage ? Oui, si le fichier contient des pistes ou des données superflues : le remuxing supprime l'inutile sans toucher à la vidéo. Les gains restent limités, souvent quelques pourcents.
AV1 est-il prêt pour la production ? Pour le web et la lecture moderne, oui. Pour des appareils anciens, prévoyez systématiquement une version de repli en H.264.
Combien de poids peut-on économiser ? De façon réaliste, 40 à 70 % par rapport à un H.264 à haut débit, sans différence visible en visionnage normal sur un écran calibré correctement.
Faut-il toujours livrer en 4K ? Non. Un 1080p bien encodé est souvent plus net et plus léger qu'un 4K surcompressé, en particulier sur mobile.
Le débruitage est-il obligatoire ? Non, mais il est très rentable sur les sources bruitées. Testez toujours sur un extrait représentatif avant d'appliquer le traitement au film entier.
Pourquoi mon fichier est-il plus lourd après compression ? Codec moins efficace, qualité cible trop élevée, cadence conservée inutilement, ou réencodage d'une source déjà dégradée.
Les outils IA remplacent-ils les encodeurs ? Non. Ils améliorent la source et guident les décisions d'allocation, mais la compression finale reste le travail du codec.
Checklist finale
- Définir l'objectif : strictement sans perte, visuellement sans perte ou perceptuellement optimisé.
- Mesurer le fichier source avant toute chose.
- Choisir un codec adapté à la cible de lecture.
- Ajuster résolution et cadence à l'usage réel.
- Nettoyer les pistes audio et les métadonnées.
- Débruiter lorsque la source le justifie.
- Régler la qualité cible et, si besoin, des limites de débit.
- Tester sur un extrait difficile avant l'encodage complet.
- Comparer à 100 % et vérifier avec une métrique perceptuelle.
- Archiver le master séparément de la version livrée.
La réduction de taille n'est pas une opération unique mais un processus : comprendre ce que le codec jette, mesurer ce que l'œil perçoit, et n'utiliser l'intelligence artificielle que là où elle apporte un gain vérifiable. C'est cette discipline, plus que n'importe quel réglage magique, qui distingue une livraison légère et soignée d'un fichier simplement écrasé.



