Principes du codage numérique
Principes du codage numérique
l'information
numérique
2 Stéphane Crozat
I Contexte
Durée : 2h
Environnement de travail : [Link], terminal
Pré-requis : Aucun
On peut utiliser un ordinateur pour afficher des photographies, modifier un texte ou effectuer des
calculs sur des nombres. Il paraît évident à un être humain qu'une image est un ensemble de
formes ou de points, ou encore qu'un texte est une suite de lettres. Mais ce n'est pas une réalité
accessible directement par l'ordinateur.
Il faut donc un moyen de représenter les informations quelles qu'elles soient (un pixel, une lettre, un
nombre, etc.) d'une façon qui soit manipulable par l'ordinateur. On appelle cela le codage de
l'information.
Comme un ordinateur ne sait manipuler que des nombres binaires (c'est à dire des séquences de 0
et de 1), il est nécessaire de représenter les informations que l'on souhaite manipuler par de telles
séquences de 0 et de 1.
Ce module présente les principes du codage informatique :
la conversion des informations analogiques en informations numériques (c'est à dire en
nombres),
la représentation binaire (la seule que la machine sait manipuler),
les formats (qui permettent d'associer du sens aux séquences binaires).
Nous illustrerons ces concepts avec deux cas pratiques que nous rencontrons tous les jours sur
nos écrans : le codage du texte et le codage des images.
Stéphane Crozat 3
II Principes du codage
Objectifs
Découvrir la notion de codage ;
Découvrir l'intérêt du codage ;
Découvrir des exemples de codeur.
Mise en situation
Un ordinateur ne sait interpréter que des séquences de symboles. Afin d'interagir avec lui il faut
donc trouver une manière de représenter les informations que l'on manipule en une forme
interprétable et compréhensible par l'ordinateur. C'est l'objet du codage.
Codage Définition
»
contenu mais seulement à la forme et à la taille des informations à coder.
[Link]
Remarque
Il existe plusieurs codages pour le même concept, par exemple le nombre « douze » se code
« XII » en chiffres romains.
4 Stéphane Crozat
Principes du codage
À retenir
Pour manipuler de l'information, on utilise un codage qui formalise cette information sous
forme de symboles.
Stéphane Crozat 5
[solution n°1 p. 37]
Exercice : Appliquer la notion
Selon l'apocryphe de Camus :
« Mal nommer les choses c'est ajouter au malheur du monde. »
Dans la langue française, on utilise des concepts que l'on représente par des mots pour
s'exprimer. On dispose de plusieurs codages avec chacun leurs symboles. Mettez en
correspondance ces symboles et ces codages.
On peut écrire les mots : On peut dire les mots : on On peut mimer les mots :
on dispose donc d'un dispose d'un codage vocal on dispose d'un codage —
codage écrit composé de composé de symboles qui la langue des signes —
symboles qui sont sont composé de symboles qui
sont
6 Stéphane Crozat
IV Discrétisation et numérisation de
l'information
Objectifs
Découvrir la notion de signal discret ;
Découvrir la notion de convertisseur analogique numérique.
Mise en situation
Notre interaction avec le monde physique se fait via de nombreux signaux continus (comme le son
ou la lumière), dits analogiques. Pour traiter ces signaux avec un ordinateur, il faut effectuer une
conversion afin d'obtenir une représentation numérique : on parle de discrétisation et de
numérisation de l'information.
La discrétisation consiste à découper le signal en petits morceaux (par exemple des pixels pour
une image) et la numérisation consiste à associer à chacun de ces morceaux un nombre qui
représente l'information (par exemple une couleur pour une image).
Stéphane Crozat 7
Discrétisation et numérisation de l'information
x[t]
7
6
5
4
3
2
1
0 1 2 3 4 5 6 7 8 9 10 11 12 13 t
Échantillonnage : Passage d'un signal analogique à un signal discrétisé
Après avoir réalisé cette discrétisation, on peut numériser le signal : pour chaque échantillon,
on lui associe une valeur numérique.
À la fin de ce processus, on obtient un signal numérisé.
»
rapport au temps.
[Link]
8 Stéphane Crozat
Discrétisation et numérisation de l'information
À retenir
Les signaux analogiques – ceux du monde réel – sont convertis en signaux numérisés par
l'intermédiaire de convertisseurs analogiques numériques qui réalisent :
leur échantillonnage,
et leur numérisation.
1. [Link]
Stéphane Crozat 9
V Exercice : Appliquer la notion
On se donne la plage suivante d'un signal analogique observé.
Signal analogique
Indice :
Par exemple, 0 est le multiple de 5 inférieur le plus proche de 0.3 mais aussi de 0.0.
De même, -5 est le multiple de 5 inférieur le plus proche de -2.1 et de -4.00001
10 Stéphane Crozat
VI Base numérique
Objectifs
Découvrir la notion de base numérique ;
Découvrir l'écriture de nombres dans une base numérique.
Mise en situation
On a l'habitude de représenter les nombres avec des chiffres de 0 à 9. C'est ce que l'on appelle le
système décimal. Ce système de représentation n'est pas le seul possible, on pourrait également
décider par exemple de n'utiliser que les chiffres de 0 à 5. Dans ce cas le nombre six s'écrirait 10.
Les ordinateurs ne manipulent que des données binaires, c'est à dire qu'ils représentent tous les
nombres avec uniquement deux chiffres : le 0 et le 1.
Si ces systèmes sont différents, ils partagent néanmoins le même système mathématique de
codage : la base.
Ainsi notre système décimal est un système en base 10, et que le binaire est un système en base
2.
Stéphane Crozat 11
Base numérique
Puissance 6 5 4 3 2 1 0
1 000
Nombre 100 000 10 000 1000 100 10 1
000
Puissances de 10 en base 10
12 Stéphane Crozat
Base numérique
À retenir
On peut représenter des nombres sous plusieurs bases.
La base que l'on utilise dans la vie de tous les jours est la base 10 mais on peut en utiliser
d'autres.
Stéphane Crozat 13
[solution n°5 p. 38]
Exercice : Appliquer la notion
La représentation de vingt-trois dans la base 10 est 23.
Puissance 3 2 1 0
Puissances de 10 en base 10
Puissance 3 2 1 0
Nombre 125 25 5 1
Puissances de 5 en base 10
Donner la représentation de vingt-trois dans la base 5. On rappelle que la base 5 est composée
des chiffres 0, 1, 2, 3 et 4.
On ne donnera que les chiffres de l'écriture de vingt-trois dans cette base.
14 Stéphane Crozat
VIII Représentation binaire
Objectifs
Découvrir la base binaire ;
Découvrir la représentation binaire ;
Découvrir la notion de bit et d'octet.
Mise en situation
Un ordinateur ne sait interpréter que des séquences de symboles. Les données qu'il manipule sont
donc toujours numérisées, c'est-à-dire transformées en nombre.
Et ces nombres ne sont représentés qu'avec les chiffres 0 et 1 : l'ordinateur ne manipule que du
code binaire.
Il est utile de comprendre la méthode de conversion des nombres décimaux en nombres binaires.
C'est ainsi que l'on verra que si on décide de représenter la lettre A par le nombre 65 (c'est la valeur
numérique qui lui est associée dans le format ASCII) alors il faudra coder un A par la séquence
binaire : 1 0 0 0 0 0 1.
Binaire Définition
»
1.
Wikipédia2
2. [Link]
Stéphane Crozat 15
Représentation binaire
Puissance
9 8 7 6 5 4 3 2 1 0
de 2
Nombre en
512 256 128 64 32 16 8 4 2 1
base 10
Puissances de 2 en base 10
Syntaxe
Pour dénoter la base d'un nombre, on l'indique en indice après le nombre.
Le nombre 7 en base 10 s'écrit 111 en base 2. Cette relation se note : 710 = 1112
Bit Définition
Chaque chiffre d'une représentation binaire s'appelle un bit.
C'est aussi une unité de mesure de l'information que l'on note b.
Octet Définition
On appelle octet un ensemble de huit bits.
C'est aussi une unité de mesure de l'information que l'on note B, pour bytes.
Un octet est capable de représenter les nombres entiers de 0 à 255.
Synonymes : on parle aussi de mot.
16 Stéphane Crozat
Représentation binaire
À retenir
La base utilisée par les ordinateurs est la base 2 : soit on a de l'information, soit on a pas
d'information,
Bit et octet sont les unités utilisées pour quantifier l'information.
Stéphane Crozat 17
[solution n°6 p. 38]
Exercice : Appliquer la notion
Exercice
Quelle est le codage binaire représentant le nombre deux ? On écrira uniquement les bits.
Après avoir trouvé la réponse, on pourra la vérifier avec l'instruction Python suivante, sur [Link] :
1 print("{0:b}".format(2))
Exercice
Quelle est le codage binaire représentant le nombre cinq ? On écrira uniquement les bits.
Après avoir trouvé la réponse, on pourra la vérifier avec l'instruction Python suivante, sur [Link] :
1 print("{0:b}".format(5))
Exercice
On représente la lettre A par le nombre soixante-cinq dans un standard de codage des
caractères nommé ASCII.
Quelle est la représentation de soixante-cinq en binaire ? On écrira uniquement les bits.
Après avoir trouvé la réponse, on pourra la vérifier avec l'instruction Python suivante, sur [Link] :
1 print("{0:b}".format(65))
18 Stéphane Crozat
X Représentation des images bitmaps
Objectifs
Découvrir des représentations de données d'images ;
Découvrir la différence entre format de compression avec pertes et format de compression
sans pertes.
Mise en situation
La numérisation permet de coder l'information de telle façon qu'elle soit manipulable par les
ordinateurs. Les images numérisées sont ainsi affichées sur les écrans, créées par des appareils
photographiques, modifiés par des logiciels de retouche ou partagées sur les réseaux.
Il existe plusieurs façons de numériser une image. Les formats bitmap que l'on utilise pour les
photographies se basent sur un tableau de points (ou pixels), chacun étant associé à un nombre
qui représente une couleur.
Image matricielle
Pour cela, on peut utilise le codage RGB : on stocke pour chaque pixel une information sur
l'intensité de rouge, vert et bleu dans le pixel.
Stéphane Crozat 19
Représentation des images bitmaps
Cette intensité est comprise entre 0 et 255. Ce système de codage permet de représenter
plus de 16 millions de teintes de couleurs.
À retenir
La représentation la plus simple pour les images est la représentation matricielle.
Un système de codage populaire pour les couleurs est le format RGB.
Il existe deux types de représentations pour les signaux numérisés : les représentations avec
compression sans pertes et celles avec compression avec pertes.
20 Stéphane Crozat
XI Exercice : Appliquer la notion
Binaire Couleur
000 noir
001 blanc
010 vert
011 cyan
100 rouge
101 magenta
110 marron
111 gris
Stéphane Crozat 21
XII Représentation du texte
Objectif
Découvrir des représentations de données textuelles.
Mise en situation
Lorsqu'on écrit un texte avec un ordinateur, les caractères, à l'instar des autres informations
manipulées par la machine, sont représentés par des nombres. Historiquement le premier standard
est ASCII qui permet de représenter 128 caractères : les lettres minuscules, majuscules, les
chiffres, l'espace, des symboles comme le signe « % », et des caractères spéciaux comme le saut
de ligne ou la tabulation.
ASCII est un standard américain qui n'inclut pas les caractères d'autres alphabets. Il n'y a pas les
caractères accentués européens, ni les caractères arabes, ni les idéogrammes asiatiques par
exemple.
Le standard Unicode, largement utilisé aujourd'hui, permet en théorie de représenter plus de 4
milliards de caractères. En pratique, il comporte aujourd'hui plus de 130.000 caractères qui
permettent de traiter la quasi-totalité des langues connues.
22 Stéphane Crozat
Représentation du texte
C'est un choix suffisant pour de simples textes en anglais, néanmoins il ne peut pas être
utilisé pour les accentuations et les caractères d'autres alphabets.
À retenir
Il existe plusieurs manières de représenter les caractères, appelées encodages.
ASCII fut le premier et laisse aujourd'hui la place à UTF-8, UTF-16 et UTF-32 pour
l'internationalisation.
Stéphane Crozat 23
XIII Exercice : Appliquer la notion
Le fichier [Link] contient un contenu que nous allons découvrir.
Enregistrer le fichier [Link] sur votre ordinateur
(cf. [Link])
Indice :
1 cat [Link]
Indice :
1 file -i message_converti.txt
1 cat message_converti.txt
24 Stéphane Crozat
XIV Format de fichiers
Objectifs
Découvrir la différence entre format propriétaire et format ouvert ;
Découvrir la convention d'extension de fichiers ;
Découvrir la structure des fichiers.
Mise en situation
Le codage en binaire n'est pas suffisant pour représenter de l'information dans un ordinateur. Il est
également nécessaire de définir des formats. Un format décrit la façon de coder l'information, par
exemple le fait que l'on va associer le nombre 65 à la lettre A est défini par le format ASCII.
Dans la machine, l'information est stockée sous forme de fichiers. Ces fichiers ont donc un format
qui permet de définir comment les utiliser. Il existe une grande variété de formats de fichiers, par
exemple :
pour l'audio : MP3 ou FLAC,
pour le texte : DOC ou ODT,
pour la vidéo : MP4 ou AVI.
Stéphane Crozat 25
Format de fichiers
Remarque
Il faut remarquer la différence entre l'organisation d'un fichier et le codage des informations
qu'il contient. Un format de fichier définit à la fois l'organisation des informations nécessaires
pour représenter la ressource et leur codage.
Extension Fondamental
Chaque format de fichier possède une ou plusieurs extensions qui facilitent son
identification.
Format Extension
Images
26 Stéphane Crozat
Format de fichiers
Le header comporte toute l'information nécessaire pour pouvoir interpréter les données dans
le segment suivant : on retrouve par exemple la version du format MP3 à utiliser et la
fréquence d'échantillonnage.
Un fichier peut comporter un en-tête général qui spécifie des méta-données. Dans le cas de
MP3, ces méta-données sont typiquement les informations sur l'enregistrement tel que
l'auteur, l'album, une référence vers la pochette de l'album, etc.
Stéphane Crozat 27
Format de fichiers
À retenir
Il existe beaucoup de formats de fichiers que l'on peut classer en deux types : les formats
propriétaires et les formats ouverts.
L'extension d'un fichier n'est qu'une convention : elle n'est là que pour aider à identifier le
format.
Les formats de fichiers complexes sont souvent structurés en segments.
28 Stéphane Crozat
XV Exercice : Appliquer la notion
On s'intéresse ici au format PNG qui est un format générique d'image très utilisé.
Pour cela on parcourt l'article Wikipédia associé : [Link]
raphics
Indice :
Référez-vous à la section Structure d'un fichier PNG.
Lire maintenant la page francophone du format PNG : [Link]
Stéphane Crozat 29
XVI Essentiel
Le codage binaire est le processus qui permet de représenter les informations du monde qui nous
entoure en séquences de 0 et de 1 que l'ordinateur peut manipuler.
Il est possible de coder en binaire n'importe quelle information. Il suffit pour cela de la discrétiser,
c'est à dire de la découper en petits morceaux, puis de la numériser c'est à dire de représenter
chaque morceau par un nombre.
Par exemple, on peut découper un texte selon chacun de ses caractères et associer chaque
caractère existant à un nombre binaire. Nous disposons ainsi d'une méthode pour coder un texte
en une séquence binaire.
Mais il faut également se doter d'un format qui permet de fixer une façon standard de coder
l'information. Par exemple le standard ASCII pose que le Z majuscule est associé au nombre 90,
qui s'écrit 101 1010 en binaire. Ainsi tous les programmes qui utilisent le format ASCII
interpréteront la séquence 101 1010 comme le caractère Z.
Le même principe est appliqué pour coder les images, les sons ou les vidéos. On utilise
simplement des méthodes de codage différentes. Par exemple pour les images bitmaps on
découpe l'image en pixels et on associe chacun d'eux à un nombre qui représente sa couleur.
30 Stéphane Crozat
Essentiel
[Link]/des-zeros-et-des-uns
Stéphane Crozat 31
XVII Quizz
[solution n°14 p. 41]
Exercice 1 : Quiz - Culture
Exercice
Parmi les formats suivants, quels sont les formats d'images ?
A PNG
B SQ
C TXT
D PDF
E RAW
F AAC
Exercice
Parmi les formats suivants, quels sont les formats ouverts ?
A TXT
B PDF
C JPEG
D 3DXML
E WMA
F FLAC
Exercice
Quelles sont les propriétés des images vectorielles et images matricielles ?
A Les images vectorielles sont composées de flèches que l'on appelle vecteurs.
32 Stéphane Crozat
Quizz
C
Les images vectorielles ont leurs propriétés de formes et de styles décrites
textuellement.
F
Les images matricielles ont une palette de couleurs bien plus grande que les images
vectorielles.
Exercice
Parmi les appareils ci-dessous, lesquels contiennent des convertisseurs analogique numérique ?
C Smartphone
D Four micro-onde
E Télévision
F Lecteur MP3
G Liseuse
H Scanner de documents
A
Vous les convertissez sous un format d'image vectorielle car ce type de format permet
d'avoir des fichiers plus légers.
Stéphane Crozat 33
Quizz
Exercice
Vous venez d'inventer un format de compression révolutionnaire et voulez lancer une entreprise
sur celui-ci. Vous avez fait le choix d'appeler votre entreprise "Pied Piper" mais vous n'avez pas
encore choisi le type de format à utiliser. En tant que jeune entrepreneur, vous voulez garder la
parenté et la maîtrise entière sur ce format afin d'avoir et maintenir un avantage concurrentiel.
Quel est le mieux pour vous ?
Exercice
Vous êtes une équipe de scientifiques en biologie. Vous réalisez des expériences et vous voulez
en publier les résultats pour la communauté à des fins d’accessibilité et de reproductibilité.
Cependant, il n'existe vraiment pas de format de fichier disponible pour votre type de données.
Quel est le mieux pour vous ?
34 Stéphane Crozat
Quizz
Parmi les propositions suivantes, quels sont les mots clefs en début de ligne associés aux méta-
données (date, titre, commentaire, etc.) du fichier ?
A AUTHOR
B HEADER
C ATOM
D PRO
E HETATM
F REMARK
G EXPDTA
Exercice
À quel format de fichier correspond le contenu ci-dessous ?
1 <svg height="100" width="100">
2 <circle cx="50" cy="50" r="40" stroke="black" stroke-width="3" fill="red" />
3 </svg>
A SVG
B TXT
C PDF
D MP3
Exercice
On dispose d'un fichier sans extension et dont on ne connaît pas le format dont voici les
premières lignes.
1 %PDF-1.4
2 %äüöß
3 2 0 obj
4 <</Length 3 0 R/Filter/FlateDecode>>
5 stream
6 x�=��
7 ?1 E����v?���0??�~��?�
Stéphane Crozat 35
Quizz
C Il contient un en-tête.
E
On ne pourra jamais récupérer le contenu du fichier puisque l'on ne peut pas modifier
l'extension.
36 Stéphane Crozat
Solutions des exercices
Solution n°1 [exercice p. 6]
On peut écrire les mots : on On peut dire les mots : on On peut mimer les mots : on
dispose donc d'un codage dispose d'un codage vocal dispose d'un codage — la langue
écrit composé de symboles composé de symboles qui des signes — composé de
qui sont sont symboles qui sont
On obtient 8 valeurs du signal aux temps : 0, 5, 10, 15, 20, 25, 30, 35.
Signal analogique
On obtient les valeurs suivantes : 0, 5, 5, 0, -5, - 15, -5, 5.
Stéphane Crozat 37
Solutions des exercices
Puissance 3 2 1 0
Puissances de 10 en base 10
Puissance 3 2 1 0
Nombre 125 25 5 1
Puissances de 5 en base 10
Donner la représentation de vingt-trois dans la base 5. On rappelle que la base 5 est composée
des chiffres 0, 1, 2, 3 et 4.
On ne donnera que les chiffres de l'écriture de vingt-trois dans cette base.
43
Vingt-trois contient 4 fois la puissance première (5) et 3 fois 1, donc s'écrit (43)_5.
Exercice
Quelle est le codage binaire représentant le nombre deux ? On écrira uniquement les bits.
Après avoir trouvé la réponse, on pourra la vérifier avec l'instruction Python suivante, sur [Link] :
1 print("{0:b}".format(2))
10
38 Stéphane Crozat
Solutions des exercices
Exercice
Quelle est le codage binaire représentant le nombre cinq ? On écrira uniquement les bits.
Après avoir trouvé la réponse, on pourra la vérifier avec l'instruction Python suivante, sur [Link] :
1 print("{0:b}".format(5))
101
Cinq contient :
1 fois la puissance seconde de 2 ("4" en base 10)
0 fois la puissance première de 2 ("2" en base 10)
1 fois l'unité ("1" en base 10)
On a donc la représentation suivante de cinq dans la base 2 : 1012
Exercice
On représente la lettre A par le nombre soixante-cinq dans un standard de codage des caractères
nommé ASCII.
Quelle est la représentation de soixante-cinq en binaire ? On écrira uniquement les bits.
Après avoir trouvé la réponse, on pourra la vérifier avec l'instruction Python suivante, sur [Link] :
1 print("{0:b}".format(65))
1000001
Soixante-cinq contient :
la puissance sixième (2⁶ = 64)
l'unité (1)
On a donc la représentation suivante de soixante-cinq dans la base 2 : 10000012
Stéphane Crozat 39
Solutions des exercices
Ce codage de couleur nécessite tout simplement beaucoup moins de bits pour représenter les
couleurs.
Il faut dans ce format 3 bits pour représenter toutes les couleurs de l'image
Dans le cas de RGB il faut 3 octets, soit 3 × 8 = 24 bits, c'est à dire 8 fois plus de bits.
On dit que le premier fichier était mal encodé. En effet, le format ISO-8859-1, ou plus
communément appelé latin1, ne permet pas de représenter les caractères accentués. Ceux-ci
s'affichent mal.
On a un fichier de taille minimale s'il n'a pas de contenu. Dans le cas de PNG, si le fichier ne
contient pas d'information, le chunk IDAT est vide.
En additionnant la taille des autres chunks, on trouve une taille minimale de :
8 + 15 + 12 = 35 octets.
Une première raison de la création de PNG était le remplacement des images aux format GIF qui
était propriétaire et qui ne permettait pas une utilisation libre.
Une seconde raison de la création de PNG était la nécessité d'un format d'images aux
spécifications plus simples et aux capacités techniques améliorées.
40 Stéphane Crozat
Solutions des exercices
Exercice
A PNG
Exercice
A TXT
B PDF PDF est un exemple de format propriétaire qui a été ouvert et standardisé en 2008.
C JPEG
D 3DXML C'est un format propriétaire de Dassault Systèmes pour son logiciel Catia
F FLAC
Exercice
A Les images vectorielles sont composées de flèches que l'on appelle vecteurs.
C
Les images vectorielles ont leurs propriétés de formes et de styles décrites textuellement.
Stéphane Crozat 41
Solutions des exercices
F
Les images matricielles ont une palette de couleurs bien plus grande que les images
vectorielles.
Exercice
Parmi les appareils ci-dessous, lesquels contiennent des convertisseurs analogique numérique ?
B
Une vieille Une radio convertit une onde radio en une onde sonore sans numériser de
radio signal.
C
Smartphone Un smartphone dispose de plusieurs convertisseurs analogiques
numériques.
D Four micro-onde
E
Télévision Une télévision reçoit une onde infrarouge à partir de la télécommande et
dispose d'un convertisseur pour numériser le signal.
F Lecteur MP3
G Liseuse
H Scanner de documents
Exercice
Vous disposez de nombreuses photos de vacances sous formes d'images matricielles dans un
format de compression sans pertes. Vous voulez stocker ces images sur un disque dur vierge,
cependant celui-ci ne contient pas assez d'espace mémoire. Vous voulez tout de même mettre les
photos sur celui-ci en gardant une bonne qualité d'image ; que réalisez-vous ?
42 Stéphane Crozat
Solutions des exercices
A
Vous les convertissez sous un format Il n'est souvent pas possible de réaliser la
d'image vectorielle car ce type de conversion d'images matricielles vers des images
format permet d'avoir des fichiers vectorielles : cela est particulièrement vrai dans le
plus légers. cas de photos.
B
Vous réduisez leur C'est une solution qui fonctionne mais elle est brutale : cela
résolution pour réduire réduit drastiquement la taille des fichiers mais vous perdez
leur taille mémoire. directement en qualité d'images.
C
Vous utilisez un format C'est la meilleure solution : vous pouvez gagner beaucoup
d'image avec compression en espace mémoire tout en gardant une qualité très bonne
avec pertes. d'image.
Exercice
Vous venez d'inventer un format de compression révolutionnaire et voulez lancer une entreprise
sur celui-ci. Vous avez fait le choix d'appeler votre entreprise "Pied Piper" mais vous n'avez pas
encore choisi le type de format à utiliser. En tant que jeune entrepreneur, vous voulez garder la
parenté et la maîtrise entière sur ce format afin d'avoir et maintenir un avantage concurrentiel.
Quel est le mieux pour vous ?
Le format propriétaire est le plus adapté ici : il vous permet de rester entièrement maître
de votre création.
Exercice
Vous êtes une équipe de scientifiques en biologie. Vous réalisez des expériences et vous voulez
en publier les résultats pour la communauté à des fins d’accessibilité et de reproductibilité.
Cependant, il n'existe vraiment pas de format de fichier disponible pour votre type de données.
Quel est le mieux pour vous ?
Un format reposant sur un standard ouvert est le plus adapté dans cette situation : il
permet d'avoir une représentation des données facilement exploitable, favorise la
collaboration et la transparence.
Stéphane Crozat 43
Solutions des exercices
C'est par exemple historiquement ce qui s'est passé avec le format PDB (Protein Data
Bank) pour la représentation de protéines. Plus d'informations ici : [Link]
g/documentation/file-format-content/format33/[Link]
Exercice
Voici un extrait issu d'un fichier PCB qui décrit l'agencement des atomes d'une protéine.
1 HEADER EXTRACELLULAR MATRIX 22-JAN-98 1A3I
2 TITLE X-RAY CRYSTALLOGRAPHIC DETERMINATION OF A COLLAGEN-LIKE
3 TITLE 2 PEPTIDE WITH THE REPEATING SEQUENCE (PRO-PRO-GLY)
4 ...
5 EXPDTA X-RAY DIFFRACTION
6 AUTHOR [Link],[Link],[Link],[Link],[Link],
7 AUTHOR 2 [Link],[Link],[Link]
8 ...
9 REMARK 350 BIOMOLECULE: 1
10 REMARK 350 APPLY THE FOLLOWING TO CHAINS: A, B, C
11 REMARK 350 BIOMT1 1 1.000000 0.000000 0.000000 0.00000
12 REMARK 350 BIOMT2 1 0.000000 1.000000 0.000000 0.00000
13 ...
14 SEQRES 1 A 9 PRO PRO GLY PRO PRO GLY PRO PRO GLY
15 SEQRES 1 B 6 PRO PRO GLY PRO PRO GLY
16 SEQRES 1 C 6 PRO PRO GLY PRO PRO GLY
17 ...
18 ATOM 1 N PRO A 1 8.316 21.206 21.530 1.00 17.44 N
19 ATOM 2 CA PRO A 1 7.608 20.729 20.336 1.00 17.44 C
20 ATOM 3 C PRO A 1 8.487 20.707 19.092 1.00 17.44 C
21 ATOM 4 O PRO A 1 9.466 21.457 19.005 1.00 17.44 O
22 ATOM 5 CB PRO A 1 6.460 21.723 20.211 1.00 22.26 C
23 ...
24 HETATM 130 C ACY 401 3.682 22.541 11.236 1.00 21.19 C
25 HETATM 131 O ACY 401 2.807 23.097 10.553 1.00 21.19 O
26 HETATM 132 OXT ACY 401 4.306 23.101 12.291 1.00 21.19 O
Parmi les propositions suivantes, quels sont les mots clefs en début de ligne associés aux méta-
données (date, titre, commentaire, etc.) du fichier ?
A AUTHOR
B HEADER
C ATOM
D PRO
E HETATM
F REMARK
G EXPDTA
44 Stéphane Crozat
Solutions des exercices
Les mots clefs HEADER, TITLE, AUTHOR et EXPDTA définissent les informations sur les
méta-données du fichier, dans le cas ici : nom de la molécule, date, auteur, information
sur l'expérience.
Exercice
A SVG
B TXT
C PDF
D MP3
C'est un fichier SVG : on voit simplement cela avec la balise <svg> par exemple.
Exercice
On dispose d'un fichier sans extension et dont on ne connaît pas le format dont voici les
premières lignes.
1 %PDF-1.4
2 %äüöß
3 2 0 obj
4 <</Length 3 0 R/Filter/FlateDecode>>
5 stream
6 x�=��
7 ?1 E����v?���0??�~��?�
C Il contient un en-tête.
E
On ne pourra jamais récupérer le contenu du fichier puisque l'on ne peut pas modifier
l'extension.
Stéphane Crozat 45
Solutions des exercices
Il y a une signature en haut du fichier qui indique que c'est un document PDF.
De plus il dispose d'un petit en-tête qui indique les informations sur le format du
contenu.
Il contient aussi des données binaires qui ne sont pas interprétables directement si on
l'ouvre avec un éditeur de texte.
Enfin, on peut renommer le fichier avec l'extension correcte .pdf et ensuite l'utiliser.
46 Stéphane Crozat
Crédits des ressources
p. 3
Attribution - Partage dans les Mêmes Conditions - stph à partir de dessins de Gee3
([Link]/gknd-creator)
Image matricielle p. 19
Universel - Transfert dans le Domaine Public - Gringer, [Link]/wiki/Image_matricielle
[Link]/des-zeros-et-des-uns p. 31
Attribution - Partage dans les Mêmes Conditions - Gee
3. [Link]
Stéphane Crozat 47
Crédits des ressources
48 Stéphane Crozat