Le son, une information à coder
Cours complet · enseignement scientifique (première), chapitre 12 · première, enseignement scientifique
Travailler ce chapitre sur Adloun Exercices corrigés de ce chapitre
12.1 Introduction : comment enfermer un son, qui est une vibration
continue, dans une suite finie de nombres entiers ?
Un son est un ébranlement de l'air. La pression monte, descend, remonte, des centaines ou des milliers de fois par seconde, et cela sans jamais sauter : à chaque instant, la pression a une valeur, et entre deux instants aussi proches qu'on voudra il y a encore une infinité d'instants. Une grandeur physique de ce genre est dite continue.
Un ordinateur, lui, ne sait rien manipuler d'autre que des suites finies de et de . Il n'a ni le temps ni la place d'écrire une infinité de valeurs, et chacune de celles qu'il écrit ne peut avoir qu'un nombre fini de décimales. Entre le son et la machine, il y a donc un fossé de nature, pas seulement de degré.
Le sujet de ce chapitre est le pont qu'on a jeté sur ce fossé, et le prix qu'on l'a payé. Car il y a un prix : numériser, c'est jeter de l'information. On la jette deux fois — une fois sur le temps, une fois sur l'amplitude — et une troisième fois si l'on comprime. Toute la question est de savoir ce qu'on peut jeter sans que l'oreille s'en aperçoive.
Trois fils courent dans ce chapitre.
- Découper. Échantillonner, c'est découper le temps ; quantifier, c'est découper l'amplitude. Deux opérations distinctes, deux réglages distincts, et deux façons différentes de trahir le son d'origine.
- Compter. Un fichier audio a une taille, et cette taille se calcule en trois multiplications. Savoir la calculer, c'est comprendre pourquoi un smartphone qui contenait vingt albums en en contient aujourd'hui vingt mille.
- Choisir ce qu'on perd. La compression du son n'est pas un tour de passe-passe informatique : elle repose sur un savoir sur nous, sur ce que notre oreille n'entend pas. Le MP3 est un objet de psychoacoustique autant que d'informatique.
Le son pur, le son composé, la fréquence fondamentale et les harmoniques, le spectre, l'intensité sonore et le niveau d'intensité en décibels ont été introduits dans le sous-thème « Son et musique ». On s'y appuiera librement. Les liens vers la partie mathématique du livre sont signalés par le symbole , comme dans le programme officiel : ici ce seront surtout les grandeurs et mesures, les puissances de , les proportions et pourcentages.
12.2 De l'air à la machine : la chaîne de numérisation
12.2.1 Trois maillons, deux traductions
Entre la voix d'une chanteuse et le fichier posé sur un téléphone, il y a une chaîne, et il vaut la peine d'en nommer chaque maillon. Chaque maillon transporte la même information sous une forme différente ; à chaque passage, un peu de fidélité se perd.
Un signal analogique est une grandeur qui varie de façon continue et dont les variations reproduisent (elles sont analogues à) celles de la grandeur physique représentée. La tension délivrée par un microphone est un signal analogique : à chaque instant, elle est proportionnelle à la variation de pression de l'air.
Un signal numérique est une suite finie de nombres, chacun écrit avec un nombre fini de chiffres binaires. Il ne varie pas : il se lit.
numérique-analogique
</div><div class='text-gray-700 leading-relaxed font-sans text-xs select-text'> Le convertisseur analogique-numérique (CAN, en anglais ADC) transforme une tension variable en une suite de nombres. Le convertisseur numérique-analogique (CNA, DAC) fait l'opération inverse : il reconstruit une tension à partir des nombres. Tout appareil qui enregistre du son contient un CAN ; tout appareil qui en restitue contient un CNA.l'information change de nature sont le CAN et le CNA. Une fois la traversée faite, le fichier peut être recopié un milliard de fois sans perdre un seul bit — c'est là l'avantage décisif du numérique sur le disque de vinyle, qui s'use, et sur la cassette, qui souffle un peu plus à chaque copie.</div>
Quand un enregistrement est mauvais, la faute n'est presque jamais là où on la croit. Un micro médiocre ruine un enregistrement en kHz / bits ; un excellent micro sauve un enregistrement en kHz / bits. Le maillon le plus faible fixe la qualité de la chaîne entière, et ce maillon est souvent le premier.
12.3 Échantillonner : découper le temps
12.3.1 L'opération
Échantillonner un signal, c'est relever sa valeur à des instants régulièrement espacés et oublier tout ce qui se passe entre deux relevés.
La durée qui sépare deux relevés est la période d'échantillonnage ; son inverse est la fréquence d'échantillonnage exprimée en hertz (Hz) ou, plus commodément ici, en kilohertz. Une fréquence d'échantillonnage de kHz signifie relevés par seconde, soit un relevé toutes les s.
retenu qu'aux instants marqués par les points violets, espacés de la période . Tout ce qui se passe entre deux points est perdu : le tracé orange est la seule chose que la machine connaisse du son. Plus les points sont serrés, plus il colle à la courbe.</div>
12.3.2 Combien de relevés par seconde ? Le critère de Shannon
Combien de fois par seconde faut-il regarder un signal pour ne rien manquer d'essentiel ? La réponse n'est pas « le plus souvent possible » : c'est une condition précise, établie en par l'ingénieur suédo-américain Harry Nyquist et démontrée en par Claude Shannon.
Pour qu'un signal ne contenant aucune fréquence supérieure à puisse être reconstruit exactement à partir de ses échantillons, il faut échantillonner à une fréquence En pratique on prend une marge : l'oreille humaine s'arrête vers kHz, ce qui imposerait kHz ; le disque compact retient kHz, soit de plus.
Si l'on désobéit à ce critère, il ne se produit pas simplement une perte de finesse : il se produit quelque chose de bien pire, une invention. Le signal reconstruit contient des fréquences qui n'existaient pas dans l'original. On appelle ce phénomène le repliement de spectre (aliasing), et la figure ci-dessous en montre le mécanisme.
échantillonné à kHz seulement, en violation du critère de Shannon. Les échantillons (points violets) sont exactement ceux qu'aurait donnés un son de kHz : la machine ne peut plus les distinguer. Un sifflement inaudible s'est changé en note grave bien audible — la numérisation n'a pas dégradé le son, elle a fabriqué un son qui n'existait pas.</div>
Les roues de diligence qui semblent tourner à l'envers dans les westerns sont exactement le même phénomène : la caméra échantillonne le mouvement fois par seconde, et la roue tourne trop vite pour ce rythme. Le repliement n'est donc pas une bizarrerie de l'audio : c'est une conséquence générale du fait de regarder par intermittence quelque chose qui change vite.
Pour s'en prémunir, tout CAN sérieux est précédé d'un filtre anti-repliement : un circuit qui coupe, avant l'échantillonnage, toutes les fréquences supérieures à . On préfère perdre franchement les aigus extrêmes plutôt que de les voir réapparaitre, déguisés, dans les graves.
12.4 Quantifier : découper l'amplitude
12.4.1 L'opération
L'échantillonnage a réglé le sort du temps. Reste l'amplitude. À chaque instant retenu, le CAN doit écrire un nombre — et un nombre écrit avec un nombre fini de chiffres binaires ne peut prendre qu'un nombre fini de valeurs. Il faut donc arrondir.
Quantifier un échantillon, c'est remplacer sa valeur exacte par la valeur la plus proche parmi une liste finie de valeurs autorisées, appelées niveaux.
Si l'on code chaque échantillon sur chiffres binaires, on dispose de L'entier est la résolution, ou profondeur de codage, du signal ; on parle d'une numérisation « sur bits ». L'écart entre deux niveaux voisins est le pas de quantification : si l'étendue des tensions admises va de à , alors
seulement, donc huit niveaux, dont le code binaire est écrit à gauche. Chaque échantillon (point bleu) est ramené au niveau le plus proche ; le segment violet qui l'en sépare est l'erreur commise, toujours inférieure à un demi-pas. Avec bits, il y aurait niveaux au lieu de huit, et l'escalier serait indiscernable de la courbe.</div>
L'erreur de quantification n'est pas silencieuse : elle s'entend, sous la forme d'un souffle rugueux qui accompagne le son utile — le bruit de quantification. Diviser le pas par deux, c'est-à-dire ajouter un bit, divise ce bruit par deux également : chaque bit supplémentaire gagne environ décibels de dynamique. D'où la règle mnémotechnique : un bit vaut six décibels. Sur bits on dispose d'environ dB de dynamique, sur bits d'environ dB — assez pour couvrir tout l'écart entre le murmure et l'orchestre au complet.
Les puissances de sont ici l'outil de base. Un enregistreur de dictée sur bits distingue niveaux de tension ; un disque compact en distingue ; un studio professionnel travaillant sur bits en distingue plus de seize millions. Passer de à bits ne multiplie pas la finesse par mais par .
Puissances de , et ordres de grandeur : voir l'annexe d'automatismes de la partie mathématique.
12.5 Fidélité contre taille : le compromis fondamental
12.5.1 Les deux savoirs du programme
Pour numériser un son, on procède à la discrétisation du signal analogique sonore (échantillonnage et quantification).
Ces deux opérations sont indépendantes l'une de l'autre. L'échantillonnage découpe le temps et décide quelles fréquences pourront être représentées ; la quantification découpe l'amplitude et décide de la finesse des nuances. On peut très bien échantillonner finement et quantifier grossièrement, ou l'inverse — et l'on n'obtiendra pas les mêmes défauts.
Plus la fréquence d'échantillonnage est élevée et la quantification est fine, plus la numérisation est fidèle, mais plus la taille du fichier audio est grande.
C'est le principe économique de tout le chapitre, et il n'a pas d'échappatoire : la fidélité se paie en octets. Toute la technique du son numérique, du CD au streaming, consiste à choisir un point dans ce compromis — puis, par la compression, à tricher intelligemment avec lui.
12.5.2 Estimer la taille d'un fichier audio
Méthode : Estimer la taille d'un fichier audio non comprimé
Le calcul tient en trois multiplications et une division.
- Compter les échantillons : , où est la durée en secondes. Attention : en hertz, pas en kilohertz.
- Compter les bits : chaque échantillon en occupe , et il y a autant de voies que de canaux (mono : , stéréo : ). D'où
- Convertir en octets : diviser par , puisqu'un octet vaut bits.
- Choisir un préfixe lisible : ko o, Mo o, Go o.
- Contrôler l'ordre de grandeur : une minute de qualité disque compact pèse environ Mo. Un résultat qui s'en écarte d'un facteur sans raison est faux.
On rencontre aussi la grandeur intermédiaire , appelée débit binaire, exprimée en bits par seconde. La taille est alors simplement .
Grandeurs et mesures, puissances de , conversions d'unités.
Paramètres du disque compact audio : Hz, bits, voies. Pour une minute, s : Un album de minutes pèse donc environ Mo, et les minutes que le disque compact peut contenir représentent près de Mo d'échantillons.
Parce que les Mo calculés ci-dessus ne sont pas seuls sur le disque : il faut y ajouter un lourd dispositif de correction d'erreurs, capable de reconstituer les données malgré une rayure. Sur un CD de données, où l'on ne peut tolérer aucune erreur, la protection est encore renforcée, et la capacité annoncée tombe à ou Mo. La différence entre les deux chiffres n'est pas une approximation commerciale : c'est le prix de la fiabilité.
Les informaticiens ont longtemps appelé « kilo-octet » octets, parce que les mémoires se comptent en puissances de . Les métrologues, eux, réservent le préfixe kilo au facteur . La norme internationale de a tranché en créant des préfixes distincts : face à ko o, Mo o, Go o. L'écart est de pour les kilos, pour les mégas, pour les gigas. C'est pourquoi un disque vendu « To » n'affiche que Gio une fois branché : le vendeur compte en puissances de , le système d'exploitation en puissances de . Personne n'a menti.
12.5.3 Justifier le choix des paramètres
Méthode : Justifier le choix des paramètres de numérisation d'un son
Devant un choix de et de , raisonner dans cet ordre.
- Quelle bande de fréquences faut-il conserver ? La parole intelligible tient dans – Hz ; la musique demande jusqu'à ou kHz ; l'analyse d'ultrasons de chauves-souris demande bien davantage. C'est cette réponse, et elle seule, qui fixe , par le critère de Shannon : .
- Quelle dynamique faut-il conserver ? Une dictée supporte bits ; une musique où le pianissimo doit rester audible sous le fortissimo demande bits ; un enregistrement de studio, qui sera ensuite retravaillé, prend bits pour se donner de la marge.
- Quelle place accepte-t-on ? Calculer la taille obtenue et la comparer à ce dont on dispose.
- Conclure par une phrase justifiée, du type : « on retient kHz car le son à enregistrer monte jusqu'à kHz et que ; et bits car la dynamique voulue dépasse dB ».
Erreur classique : croire qu'augmenter permet d'enregistrer des sons plus aigus. Non — ne joue que sur la finesse des niveaux. Seule fixe la fréquence maximale enregistrable.
- Téléphonie fixe numérique : Hz, bits, mono. Débit kbit/s, soit ko par minute. La bande conservée s'arrête vers Hz : c'est assez pour comprendre les mots, pas pour reconnaitre à coup sûr une voix chuchotée. On sait pourquoi une voix au téléphone « sonne téléphone ».
- Disque compact : Hz, bits, stéréo. Débit kbit/s, Mo par minute.
- Studio d'enregistrement : Hz, bits, stéréo. Débit kbit/s, soit Mo par minute — plus de trois fois le disque compact. Cette marge ne sert pas à l'écoute finale : elle sert aux traitements ultérieurs, qui dégradent le signal et qu'il faut pouvoir encaisser.
Il a l'air arbitraire, et il l'est à moitié. La moitié physique : l'oreille s'arrêtant vers kHz, il fallait dépasser kHz. La moitié historique : à la fin des années , le seul support capable d'écrire un tel débit était le magnétoscope. On rangeait donc les échantillons audio à la place des lignes d'image. Or trois échantillons par ligne, sur lignes utiles et images par seconde au standard américain, donnent ; et trois échantillons sur lignes à images par seconde au standard européen donnent également. Un seul nombre convenait aux deux mondes : ce fut lui. Le disque compact, normalisé en et commercialisé à partir d'octobre , en a hérité — et nous avec.
12.6 Comprimer : diminuer la taille sans perdre l'essentiel
12.6.1 Deux familles de compression
La compression consiste à diminuer la taille d'un fichier afin de faciliter son stockage et sa transmission.
Comprimer n'est pas « enlever du son » : c'est écrire la même information avec moins de bits, ou renoncer sciemment à une part d'information jugée inutile. Les deux voies existent et portent des noms différents.
Une compression est sans perte lorsque le fichier d'origine peut être reconstitué bit pour bit à partir du fichier comprimé. Elle exploite les redondances : passages silencieux, répétitions, corrélation entre les deux voies stéréo. Les formats FLAC et ALAC sont de ce type ; ils divisent typiquement la taille par à .
Une compression est avec perte lorsque des informations sont définitivement supprimées : le fichier d'origine est irrécupérable. Les formats MP3, AAC, Ogg Vorbis et Opus sont de ce type ; ils divisent la taille par et davantage.
Les techniques de compression spécifiques au son, dites « avec perte d'information », éliminent les informations sonores auxquelles l'oreille est peu sensible.
Cette phrase mérite qu'on s'y arrête, car elle dit quelque chose d'inhabituel : un format de fichier informatique fondé sur une connaissance de physiologie. Le compresseur ne cherche pas ce qui est petit dans le signal, il cherche ce qui est inaudible pour un être humain. Changez l'auditeur — un chien, une chauve-souris — et le MP3 devient un mauvais format.
12.6.2 Ce que l'oreille n'entend pas
Trois faits de psychoacoustique, tous mesurables sur des auditeurs volontaires, suffisent à fonder la compression du son.
- Le seuil absolu d'audition. À chaque fréquence correspond une intensité en dessous de laquelle on n'entend rien. Ce seuil est très bas vers – kHz et remonte fortement dans les graves et dans les aigus. Tout ce qui est sous cette courbe peut être jeté sans que personne s'en aperçoive.
- Le masquage fréquentiel. Un son fort relève le seuil d'audition dans son voisinage : à côté d'une note jouée à dB, une note voisine à dB devient inaudible. Elle n'est pas couverte au sens familier du terme — elle n'est physiologiquement pas perçue.
- Le masquage temporel. Le masquage déborde dans le temps : quelques millisecondes avant un son fort, et surtout une centaine de millisecondes après, l'oreille reste sourde aux sons faibles.
perçu ; un son fort à Hz relève localement ce seuil, et tout ce qui passe sous la courbe orange devient inaudible à son tour. Des quatre sons représentés, un seul sera écrit dans le fichier. Les deux qui sont jetés ne sont pas jetés parce qu'ils sont faibles, mais parce que nous ne les entendons pas : le compresseur code le monde tel que nous le percevons, pas tel qu'il est.</div>
Un fichier MP3 n'est donc pas une version « floue » de l'original, comme une photographie mal mise au point. C'est une version où certains sons ont été purement et simplement supprimés — et le résultat peut être, pour l'oreille, indiscernable de l'original, tout en étant, pour la machine, radicalement différent. Un logiciel qui compare les deux fichiers bit à bit conclura qu'ils n'ont rien à voir ; un auditeur en aveugle ne les distinguera pas. Les deux ont raison : ils ne mesurent pas la même chose.
12.6.3 Calculer un taux de compression
Soit la taille du fichier d'origine et celle du fichier comprimé. Le taux de compression est la proportion de la taille supprimée : que l'on exprime en pourcentage. Le facteur de compression est le rapport que l'on écrit sous la forme « pour ». Les deux disent la même chose : équivaut à .
Méthode : Calculer un taux de compression
- Ramener les deux tailles à la même unité avant tout calcul : comparer des mégaoctets à des kilooctets est l'erreur la plus fréquente.
- Se ramener à une même durée si les fichiers ne durent pas autant : on compare alors des débits, en kbit/s, plutôt que des tailles.
- Appliquer , et donner le résultat en pourcentage avec un ou deux chiffres significatifs.
- Contrôler : est compris entre et . Un taux supérieur à ou négatif signale une erreur d'unité — sauf pour un fichier déjà comprimé, qu'une seconde compression peut effectivement alourdir.
Proportions et pourcentages : voir le chapitre « Analyse de l'information chiffrée ».
Une minute de musique occupe Mo en WAV non comprimé. Convertie en MP3 à kbit/s, elle occupe Le taux de compression vaut soit : neuf dixièmes du fichier ont disparu. Le facteur de compression vaut , que l'on écrit « pour ». Et pourtant la plupart des auditeurs ne perçoivent pas la différence sur des enceintes ordinaires.
12.6.4 Comparer des fichiers audio comprimés
Méthode : Comparer des caractéristiques de fichiers audio comprimés
Cinq caractéristiques, et il faut les distinguer.
- Le format (WAV, FLAC, MP3, AAC, Opus) : dit surtout s'il y a perte ou non.
- Le débit binaire, en kbit/s : c'est le critère décisif de qualité à format donné. Il peut être constant (CBR) ou variable (VBR), le débit variable donnant une meilleure qualité à taille égale puisqu'il dépense plus de bits sur les passages difficiles.
- La fréquence d'échantillonnage et la résolution du signal d'origine.
- Le nombre de voies.
- La taille, qui découle des précédentes et de la durée.
Deux pièges. Premièrement, on ne compare des débits qu'entre formats comparables : Opus à kbit/s soutient la comparaison avec un MP3 à kbit/s, parce que son codage est plus efficace. Deuxièmement, une compression avec perte est irréversible : reconvertir un MP3 en WAV regonfle le fichier sans rien restituer, et enchainer les compressions dégrade à chaque passage.
dernières barres sont si basses qu'elles en deviennent illisibles : c'est précisément l'effet d'écrasement d'échelle contre lequel il faut se prémunir, et c'est pourquoi les valeurs sont écrites en toutes lettres. Le facteur de compression est indiqué sous chaque colonne.</div>
12.7 Stocker et échanger : ce que pèse le monde numérique
12.7.1 Un savoir de société
Une quantité énorme d'informations audio (et vidéo) est échangée, ce qui entraine un développement important des capacités de stockage.
L'énoncé décrit une boucle : la compression a rendu les fichiers assez légers pour être échangés, l'échange a créé une demande, la demande a exigé des capacités de stockage nouvelles, et ces capacités ont permis d'échanger davantage. Aucun des maillons n'aurait suffi seul. Le MP3 sans le réseau serait resté une curiosité de laboratoire ; le réseau sans le MP3 aurait mis six heures à transporter un album.
Quelques repères, pour mesurer le chemin parcouru en une génération.
- Une disquette de contenait Mo : moins de huit secondes de musique en qualité disque compact.
- Un disque compact () : environ Mo, soit minutes de musique — et rien d'autre.
- Un DVD () : Go sur une couche ; un Blu-ray () : Go. Il fallait cette capacité pour la vidéo, bien plus gourmande que l'audio.
- Une carte mémoire de la taille d'un ongle contient aujourd'hui plusieurs centaines de gigaoctets, et les disques d'un centre de données se comptent en dizaines de téraoctets pièce.
12.7.2 Ce que coute un fichier qui voyage
l'empreinte carbone du numérique français. La surprise est là : l'essentiel de l'impact ne se joue pas pendant l'écoute, mais bien avant elle, dans la fabrication des appareils. Changer de téléphone pèse plus lourd que des années de musique en ligne.</div>
Méthode : Discuter des échanges de fichiers audio et vidéo du point de
vue énergétique</h4><div class="text-gray-700 leading-relaxed font-sans text-xs select-text"> Le sujet est chargé d'affirmations spectaculaires et de chiffres douteux. Voici comment raisonner proprement.
- Séparer les trois postes : la fabrication des appareils, le fonctionnement des réseaux, le fonctionnement des centres de données. Un chiffre global qui ne dit pas de quoi il parle n'est pas exploitable.
- Comparer des grandeurs comparables. Une heure de musique en ligne à kbit/s représente Mo transférés ; une heure de vidéo en haute définition à Mbit/s en représente , soit environ quarante fois plus. Discuter de l'audio sans le comparer à la vidéo, c'est se tromper d'ordre de grandeur.
- Rapporter à une référence familière : un trajet en voiture, un repas, un vêtement. Un impact isolé ne veut rien dire.
- Se méfier des chiffres d'énergie par gigaoctet. Les estimations publiées varient d'un facteur considérable selon la méthode employée, et ont été révisées à la baisse à mesure que les réseaux gagnaient en efficacité. Une valeur unique et définitive de « l'énergie d'un gigaoctet » n'existe pas : le dire fait partie de l'honnêteté scientifique.
- Conclure sur ce qui est robuste, c'est-à-dire sur ce qui ne dépend pas des chiffres discutés : allonger la durée de vie d'un appareil, préférer le téléchargement d'un morceau écouté cent fois à cent écoutes en ligne, choisir une définition adaptée à l'écran.
Proportions, pourcentages, grandeurs et mesures : voir le chapitre « Analyse de l'information chiffrée ».
collective
<div style='margin-top:8px' class='text-gray-700 leading-relaxed font-sans text-xs select-text'> Un disque compact gravé chez soi se dégrade en quelques décennies ; une bande magnétique se démagnétise ; un disque dur tombe en panne. Mais le problème le plus sérieux n'est pas la dégradation du support : c'est la disparition du lecteur. Qui possède encore un lecteur de disquettes ? un magnétoscope ? un lecteur de Minidisc ? Une donnée intacte mais illisible est une donnée perdue.L'histoire donne un exemple saisissant du problème inverse. Le phonautogramme enregistré par Édouard-Léon Scott de Martinville le avril — une voix chantant « Au clair de la lune » — n'a jamais pu être écouté par son auteur : sa machine dessinait le son sur du papier noirci mais ne savait pas le restituer. En , une équipe américaine a numérisé ces tracés et les a fait sonner par calcul. Cent quarante-huit ans après l'enregistrement, on a entendu la première voix humaine enregistrée. Le support avait tenu ; c'est le lecteur qui avait manqué, et il a fini par être inventé.
12.8 Histoire des sciences : de l'analogique au numérique
groupes d'évènements correspondent à trois idées successives : graver la vibration sur une matière, penser le son comme une information mesurable, puis coder cette information de manière à la transmettre. La deuxième idée est la plus abstraite, et c'est elle qui a tout permis.</div>
12.8.1 Graver la vibration : le son devient une trace
— Scott de Martinville enregistre sans pouvoir écouter. L'imprimeur parisien Édouard-Léon Scott de Martinville dépose le brevet du phonautographe : un cornet, une membrane, un stylet qui trace la vibration sur un cylindre de papier noirci de fumée. Son but n'est pas de reproduire le son mais de l'écrire, comme on écrit une courbe de température. C'est une machine de savant, pas de salon.
— Edison ferme la boucle. Thomas Edison comprend que le sillon peut être relu : si le stylet suit à nouveau la trace, la membrane revibre et le son revient. Le phonographe enregistre et restitue. Pour la première fois dans l'histoire humaine, un son est conservé.
— Berliner invente le disque. Emile Berliner remplace le cylindre par un disque plat, qu'on peut presser en série à partir d'une matrice. L'enregistrement cesse d'être une pièce unique : il devient un produit reproductible. Toute l'industrie du disque tient dans ce changement de forme.
12.8.2 Penser le son comme une information
— Nyquist énonce la condition. Harry Nyquist, ingénieur chez Bell, étudie la télégraphie : combien de signaux distincts peut-on faire passer par seconde dans une ligne de bande passante donnée ? Il établit le rapport entre la bande passante et le nombre de valeurs indépendantes par seconde. Personne, alors, ne pense au son.
— Reeves invente le codage en nombres. L'ingénieur britannique Alec Reeves, en poste à Paris, dépose le brevet de la modulation par impulsions codées (MIC, en anglais PCM) : transmettre non plus une tension, mais la suite des nombres qui la décrivent. L'idée est exactement celle de ce chapitre. Elle a quarante ans d'avance sur les composants capables de la mettre en œuvre, et restera longtemps sans emploi.
— Shannon fonde la théorie de l'information. Dans A Mathematical Theory of Communication, Claude Shannon montre qu'une information, quelle qu'elle soit — un texte, une image, un son —, se mesure avec une seule unité, le bit, et que l'on peut la transmettre sans erreur à travers un canal bruité pourvu qu'on reste sous un certain débit. Il démontre l'année suivante le théorème d'échantillonnage. Après Shannon, le son n'est plus un phénomène : c'est un message.
Il faut mesurer la nouveauté de ce geste. Avant Shannon, une voix, une photographie et un télégramme étaient trois choses de natures différentes, étudiées par trois métiers différents. Après lui, ce sont trois quantités d'information, mesurables dans la même unité et transportables par les mêmes moyens. La convergence de la musique, du cinéma, du téléphone et du courrier dans un même appareil de poche est la conséquence, à soixante-dix ans de distance, d'une définition mathématique.
12.8.3 Coder et diffuser
- — le disque compact. Philips et Sony normalisent en un disque lu par un faisceau laser, sans contact ni usure, portant des échantillons à Hz sur bits. Les premiers lecteurs sont commercialisés à partir d'octobre au Japon. Le grand public découvre à cette occasion un fait contre-intuitif : une copie numérique n'est pas une copie « presque aussi bonne », c'est le même objet.
— le MP3. La norme MPEG-1, publiée en , comprend en sa troisième couche un codage audio perceptif issu de longs travaux menés en Allemagne, notamment à l'institut Fraunhofer autour de Karlheinz Brandenburg. Le principe est celui exposé plus haut : ne coder que ce qui s'entend. L'extension .mp3 est retenue en . Divisant les fichiers par dix, le format rend l'échange de musique possible sur les réseaux de l'époque et bouleverse en quelques années une industrie centenaire.
Depuis — Les formats se sont succédé (AAC, Ogg Vorbis, puis Opus, normalisé en et conçu pour l'écoute et la conversation en ligne), tous fondés sur la même idée perceptive, tous plus efficaces que le précédent. Le paradoxe final mérite d'être noté : la compression, inventée pour économiser des octets, a rendu l'échange si facile que le volume total échangé a été multiplié par des ordres de grandeur. Économiser une ressource peut en augmenter la consommation totale — un effet bien connu des économistes, et que l'histoire du son numérique illustre à merveille.
12.9 Bilan
Ce qu'il faut savoir
- Pour numériser un son, on procède à la discrétisation du signal analogique sonore : échantillonnage (découpage du temps) et quantification (découpage de l'amplitude).
- Plus la fréquence d'échantillonnage est élevée et la quantification fine, plus la numérisation est fidèle, mais plus le fichier est gros.
- La compression diminue la taille d'un fichier pour faciliter son stockage et sa transmission.
- Les compressions audio avec perte éliminent les informations auxquelles l'oreille est peu sensible : ce qui est sous le seuil d'audition, et ce qui est masqué par un son plus fort.
- Une quantité énorme d'informations audio et vidéo est échangée, ce qui entraine un développement important des capacités de stockage.
Ce qu'il faut savoir faire
- Justifier le choix des paramètres de numérisation d'un son : par la bande de fréquences à conserver et le critère , par la dynamique voulue.
- Estimer la taille d'un fichier audio : , en bits, puis diviser par .
- Calculer un taux de compression et un facteur .
- Comparer des fichiers audio comprimés : format, avec ou sans perte, débit binaire, fréquence d'échantillonnage, résolution, taille.
- Discuter des échanges de fichiers audio et vidéo du point de vue énergétique, en séparant fabrication, réseaux et centres de données, et en se méfiant des chiffres uniques.
Trois nombres à retenir
Hz et bits sont les réglages du disque compact ; ils donnent kbit/s et environ Mo par minute. est le nombre de niveaux d'une quantification sur bits. Un facteur environ sépare un WAV d'un MP3 courant, et un facteur environ sépare une heure de musique d'une heure de vidéo.
Ce que ce chapitre dit de la science elle-même
Le son numérique offre un cas rare : une technologie de masse dont on peut suivre toute la généalogie intellectuelle, et où chaque étape a un auteur, une date et une raison. Une condition de télégraphie énoncée en ; un brevet déposé en et resté sans usage pendant quarante ans ; une théorie mathématique publiée en qui décide que le son, l'image et le texte sont la même chose ; enfin, dans les années , des mesures de psychoacoustique faites sur des auditeurs volontaires, et qui déterminent aujourd'hui quels sons figurent dans les fichiers de la Terre entière.
Deux leçons en découlent. La première est que la connaissance la plus abstraite peut être la plus efficace : le mot « bit » n'a l'air de rien, et il a reconfiguré une industrie. La seconde tient dans la nature même de la compression : nos fichiers audio ne contiennent pas le monde tel qu'il est, ils contiennent le monde tel que nous le percevons. Un format de fichier n'est pas un objet neutre — c'est une hypothèse sur celui qui l'écoutera.