Archiver les Titres de Créances sur une Molécule d'ADN Synthétique, à l'Ère de la Monnaie Scripturale
Ce texte est l'étude que j'ai soumise le 19 septembre 2024 au Prix spécial du Trésor Public du Bénin, sous le thème « Fonction bancaire du Trésor et optimisation de la gestion de la trésorerie de l'État », sous la supervision de Bruno Monkoun, biologiste.
Résumé
La transition vers une économie numérique vient avec son lot de contraintes, en grande partie prévisibles grâce à la mise en place d'une politique de gestion efficace des données.
C'est dans ce cadre que s'inscrit cette étude, en proposant une nouvelle approche d'optimisation de la gestion de la trésorerie de l'État, avec un focus particulier sur la fonction bancaire du Trésor Public et l'archivage des titres de créance.
Pour ainsi dire, elle examine les limites des méthodes actuelles de stockage des données, que ce soit à travers les systèmes traditionnels ou les bases de données modernes, dans un contexte de croissance exponentielle du volume des données et de contraintes environnementales.
Pour y remédier, une solution innovante a été trouvée : l'utilisation de la molécule d'ADN synthétique comme support d'archivage à long terme.
L'étude explore les avantages de cette technologie, notamment sa capacité à stocker de grandes quantités de données dans un espace réduit, ainsi que ses bénéfices en termes de durabilité et d'efficacité énergétique, sans oublier de conclure sur des recommandations de mise en œuvre de cette technologie et sur ses implications stratégiques pour l'avenir.
Mots-clés de l'étude : Trésor, monnaie scripturale, base de données, archivage, acide désoxyribonucléique (ADN).
Introduction Générale
Dans un monde où la gestion des données revêt un enjeu crucial pour les gouvernements et les institutions financières, le Trésor Public, en tant que garant de la bonne gestion des fonds publics, se trouve confronté à un double défi : d'une part, la nécessité de moderniser ses outils de gestion pour suivre l'évolution des technologies financières, et d'autre part, celle de réduire son empreinte écologique tout en optimisant l'efficacité de ses processus.
En parallèle, avec la mondialisation, les États ont sans doute dû réinventer en continu leur modèle économique, en introduisant notamment la possibilité pour le Trésor d'émettre des titres de créance, pour répondre aux besoins de l'État en termes de financement.
De ce fait, l'archivage des titres de créance, des transactions financières et des documents comptables, historiquement réalisé sur des supports physiques et numériques, présente aujourd'hui des limites en termes de coût, de durabilité et de sécurité.
En outre, le volume croissant des données nécessite des infrastructures massives et énergivores, c'est-à-dire les data centers, dont la consommation électrique et les besoins en refroidissement posent d'importants défis environnementaux.
Face à ces défis, cette étude explore la possibilité d'une solution innovante et prometteuse qu'est l'archivage des données sur une molécule d'ADN synthétique. Cette technologie, bien qu'encore à ses débuts, offre des capacités de stockage extrêmement denses et durables, tout en ne consommant que très peu de ressources.
En prenant comme cas d'étude la fonction bancaire du Trésor et l'optimisation de la gestion de la trésorerie de l'État, cette étude vise à démontrer comment la molécule d'ADN synthétique pourrait non seulement répondre aux besoins actuels en matière de stockage, mais aussi permettre de concevoir des stratégies de gestion des données basées sur les technologies d'intelligence artificielle, durables et efficaces dans le futur.
La Revue de Littérature
La Monnaie et l'État
L'Évolution de la Monnaie
À l'origine, la valeur d'une pièce de monnaie était déterminée par la valeur intrinsèque des matériaux utilisés pour sa fabrication, tels que l'or ou le cuivre. Par exemple, un dollar valait autrefois environ 1,5 gramme d'or (l'once d'or, soit 31,1 g, était fixée à 20,67 dollars). C'est le concept de l'étalon-or.
Cela signifiait que tout détenteur de dollars dans le monde pouvait, à tout moment, échanger ses dollars contre la quantité d'or correspondante. Ce système reposait notamment sur l'idée que chaque unité de monnaie était soutenue par une réserve en or réelle, garantissant ainsi sa valeur. Les pièces d'or sont une monnaie-marchandise, et les billets convertibles une monnaie représentative : leur valeur tenait à la promesse d'échange contre de l'or. Le terme de monnaie fiduciaire (du latin fides, confiance) s'applique surtout à ce qui vient après : une monnaie qui ne vaut que par la confiance qu'on lui accorde.
Cependant, tous les pays n'ont pas pu suivre ce modèle, en raison de la difficulté à regrouper suffisamment de réserves d'or. Dès lors, la solution qui avait été trouvée consistait à ce que les autres monnaies soient indexées sur le dollar américain, et que ce dernier soit à son tour indexé sur l'or : c'est le fondement des accords de Bretton Woods (1944).
Sous ce système, le dollar restait convertible en or, à 35 dollars l'once depuis 1934, mais pour les seules banques centrales étrangères ; les États-Unis devaient donc détenir assez d'or pour honorer ces demandes. Mais au fur et à mesure que les besoins mondiaux en dollars augmentaient, les États-Unis ont été contraints d'émettre plus de dollars qu'ils n'avaient d'or pour les soutenir. Ce qui a sans doute conduit à la fin des accords de Bretton Woods, en 1971.
Après la fin des accords de Bretton Woods, le dollar et les autres monnaies ont cessé d'être directement convertibles en or. Cela a levé la dernière contrainte physique sur la création de monnaie ex nihilo, c'est-à-dire ne reposant sur rien. La monnaie n'avait donc plus besoin d'être adossée à une réserve physique. Sans cette borne, la monnaie peut être émise sans limite, et perdre de la valeur si elle l'est en excès : c'est l'inflation.
Aujourd'hui, le caractère fiduciaire de la monnaie repose sur la confiance que les gens ont dans les banques centrales. C'est-à-dire que si la banque centrale affirme qu'un billet vaut 20 dollars, ce billet pourra être utilisé pour acheter des biens ou des services d'une valeur de 20 dollars. Et c'est de son ressort de garantir la stabilité de la monnaie, en jouant un rôle de régulateur.
Avec la révolution informatique, on a assisté à toute une digitalisation du secteur financier, le faisant passer d'un système papier vers une économie digitale. De ce fait, la monnaie scripturale, reposant sur des écritures comptables, c'est-à-dire une série de chiffres écrits dans un ordinateur, est devenue courante. Cette monnaie repose sur la promesse que votre banque vous remboursera l'équivalent en monnaie physique lorsque vous en aurez besoin.
Ainsi, lorsque vous déposez de l'argent dans votre banque habituelle (une banque de détail), il s'agit en réalité d'un prêt que vous lui faites. Et cette dernière vous promet en retour de vous restituer cet argent à tout moment.
En cas de transfert interbancaire, les deux banques de détail s'appuient sur la banque centrale, qui joue le rôle de tiers de confiance. Cette dernière a le droit de prêter aux banques de détail, tout comme celles-ci le font avec les particuliers. Pour ainsi dire, l'établissement d'envoi se débrouille pour avoir l'équivalent de la somme à envoyer en promesse de la banque centrale, qu'il envoie à l'autre.
Mais dans la réalité, les banques de détail détiennent toutes un compte à la banque centrale, et les transferts interbancaires se réalisent par un mécanisme de compensation, qui consiste à ajuster les soldes de ces comptes.
Ceci dit :
- les particuliers font confiance aux banques de détail pour gérer leur comptabilité ;
- les banques de détail font confiance à la banque centrale pour gérer la leur ;
- mais qui gère la comptabilité de l'État ?
Le Trésor
Le Trésor est l'organe responsable de la gestion des finances publiques, en ce qu'il retrace les recettes et les dépenses de l'État. Il joue un rôle crucial au sein de l'économie, en permettant à l'État de lever des fonds par l'émission de titres de créance, tels que les bons du Trésor. Ces titres, émis pour le compte de l'État, peuvent ensuite être achetés par des entreprises ou des particuliers, dans l'optique de réaliser un bénéfice futur.
Par exemple :
- l'État a besoin de 100 millions de francs pour financer un projet ;
- le Trésor peut émettre 100 titres de créance d'une valeur de 1 million chacun ;
- ces divers titres seront ensuite achetés par des entreprises ;
- l'achat se fait moyennant un contrat, avec les avantages inhérents.
Au nombre des titres de créance émis par le Trésor, nous avons les :
- bons du Trésor : échéances à court terme (jusqu'à 1 an, et jusqu'à 2 ans sur le marché de l'UEMOA) ;
- obligations d'État : échéances à moyen et long terme (de 2 ans à plus de 10 ans) ;
- obligations indexées sur l'inflation : protégées contre l'inflation, avec des échéances à moyen ou long terme.
Les documents physiques, comme les reçus ou contrats, font office de preuve au cours d'une transaction liée à l'émission d'un produit du Trésor.
Cependant, la gestion financière est principalement numérique, avec des enregistrements dans des bases de données, qui suivent le cycle de vie de la transaction.
Les Bases de Données
Utilisation des Fichiers pour Stocker les Données
Depuis l'apparition des premiers ordinateurs et jusqu'aux années 1960, les données dans les entreprises étaient traditionnellement organisées sous forme de fichiers.
Exemple :
Mais cette façon de faire a rapidement atteint ses limites.
À l'échelle d'un unique utilisateur, il devenait compliqué de maintenir l'équilibre des lignes, ou encore de rechercher des enregistrements complexes.
Cette situation se compliquait davantage avec l'augmentation du nombre d'utilisateurs, pour la simple et bonne raison que chacun usait d'une version différente du fichier, entraînant des conflits et des erreurs, faute de synchronisation des informations.
De plus, l'organisation même des fichiers posait un autre défi : chaque fichier était souvent adapté à un traitement particulier.
Tout ceci créait de nombreuses redondances de données, alourdissant inutilement le système, entraînant des retards dans le traitement des données et augmentant ainsi les risques d'inexactitudes.
Vers 1965, une nouvelle idée est apparue : séparer les données de leurs traitements, avec l'avènement des bases de données. Les bases de données corrigent non seulement le problème d'intégrité des données, mais permettent également une organisation plus centralisée et une gestion plus efficace des données.
Transition vers les Bases de Données
Une base de données est conçue pour enregistrer des faits et événements au sein d'une organisation, afin soit de les restituer à la demande, soit d'en tirer des conclusions en croisant plusieurs informations.
Dans le cas du Trésor Public, il est essentiel de stocker toutes les informations relatives aux transactions financières, en centralisant dans une base de données les :
- recettes : montants perçus par le gouvernement via les impôts, taxes, amendes, etc. ;
- dépenses : détails des paiements effectués pour les salaires, achats de matériel, subventions, etc. ;
- comptes publics : suivi des soldes des comptes publics et des mouvements financiers.
En plus de centraliser ces données, la base de données permet d'établir des liens entre elles, afin de faciliter des analyses complexes. Par exemple :
- une dépense est liée à un compte public spécifique, ce qui montre de quel compte l'argent a été prélevé ;
- une recette est associée à un type de taxe, permettant de voir la contribution de chaque type de taxe aux recettes globales.
Vu sous l'angle des anciennes méthodologies de conception, chaque volet de ce cas d'exemple nécessiterait une nouvelle application, avec ses propres fichiers et ses propres programmes. Ainsi, la création d'une base de données va à l'encontre de cette façon de faire, en rendant possible la centralisation, la coordination, l'intégration et la diffusion de l'information.
Plus généralement, les systèmes de gestion de bases de données (SGBD) offrent plusieurs avantages significatifs par rapport à la simple gestion de données sous forme de fichiers. Au nombre de ceux-ci, on peut citer :
- Organisation et structuration des données : les SGBD permettent de définir des schémas qui structurent les données sous forme de tables, avec des colonnes définies par des types de données spécifiques. Cela garantit la cohérence et l'intégrité des données.
- Accès simplifié et efficace : les SGBD offrent un langage de requête (comme SQL) qui permet de récupérer, insérer, mettre à jour ou supprimer des données de manière efficace et rapide, même pour des ensembles de données volumineux.
- Évolutivité : les SGBD sont conçus pour évoluer et gérer des quantités massives de données, que ce soit en termes de stockage ou de performance des requêtes.
- Support multi-utilisateur : ils gèrent efficacement l'accès simultané de multiples utilisateurs, garantissant que les opérations sont exécutées de manière coordonnée et sans interférences.
La Base de Données Remplace-t-elle les Fichiers ?
Pour répondre à cette question, il nous faut comprendre la structure même d'un système de gestion de bases de données (SGBD). Un SGBD se compose de trois couches de fonctions, empilées depuis les mémoires secondaires jusqu'aux utilisateurs :
- Système de gestion de fichiers (SGF) : permet de stocker les données sur des mémoires secondaires (comme des disques durs).
- SGBD interne : assure la gestion des liens entre les données stockées dans les fichiers, qui deviennent invisibles pour les programmes d'application.
- SGBD externe : s'occupe de l'analyse et de l'interprétation des requêtes des utilisateurs, ainsi que de la mise en forme des données échangées avec l'extérieur.
De ce fait, la base de données ne remplace pas les fichiers, mais offre une couche d'abstraction par-dessus. Cela signifie que les fichiers existent toujours en arrière-plan, mais que la base de données permet de les gérer de manière plus structurée et plus efficace. En d'autres termes, au sein de la base de données elle-même, ce sont des fichiers qui sont gérés, mais de manière transparente pour l'utilisateur.
Le Cycle de Vie de la Donnée
Dans une vision macro du système d'information du Trésor, la gestion des données suit plusieurs étapes importantes, celles de la gestion du cycle de vie de l'information, dont la gestion électronique de documents (GED) est le pendant pour les pièces et contrats.
Collecte des Données
C'est la première étape, où les données sont recueillies et stockées dans une base de données active (données à chaud). En d'autres termes, il s'agit d'une approche systématique qui consiste à rassembler et à mesurer différentes informations qui proviennent de sources variées. Cette approche aide à obtenir une vue d'ensemble sur le métier, comme expliqué dans la partie 1.2.
Sauvegarde (Snapshot et Backup)
À intervalles réguliers, les données sont déchargées dans d'autres emplacements, généralement sous forme de fichiers, indépendamment des données d'origine. Un instantané de la base de données est créé, en lecture seule par défaut, pour préserver l'état des données à cet instant t. L'action de capturer l'état d'un système à un moment précis est qualifiée de snapshot, tandis que le backup symbolise l'action de copier la donnée, ici le snapshot, dans un autre emplacement.
La sauvegarde des données est une fonction de protection des données, essentielle pour réduire le risque de perte totale ou partielle des données en cas d'événements imprévus. Elle offre aux organisations la possibilité de restaurer les systèmes et les applications dans un état antérieur souhaité. Pour réduire l'espace de stockage des données à sauvegarder, il est souvent recommandé de procéder en amont à une compression des fichiers, afin de réduire leur taille.
La sauvegarde ne retire rien de la base active : elle en garde une copie restaurable. Le retrait des données anciennes hors de la base est une opération distincte, décidée à part. Cet allègement profite surtout aux futures opérations qui parcourent toute une table (rapports, sauvegardes…).
Méthodes de Sauvegarde des Données
Les données peuvent être sauvegardées de diverses manières. Certaines méthodes sauvegardent une copie complète des données à chaque fois, tandis que d'autres ne copient que les modifications apportées aux données. Chaque méthode a ses avantages et ses inconvénients.
- Sauvegarde complète : les sauvegardes complètes prennent une copie complète de toutes les données à chaque fois, stockées telles quelles, ou compressées et chiffrées. Les sauvegardes complètes synthétiques créent des sauvegardes complètes à partir d'une sauvegarde complète et d'une ou de plusieurs sauvegardes incrémentielles.
- Sauvegarde incrémentielle : les sauvegardes incrémentielles copient toutes les données qui ont été modifiées depuis la dernière sauvegarde, quelle que soit la méthode de cette dernière. Les sauvegardes incrémentielles inversées ajoutent toutes les données modifiées à la dernière sauvegarde complète.
- Sauvegarde différentielle : les sauvegardes différentielles copient toutes les données modifiées depuis la dernière sauvegarde complète, qu'une autre sauvegarde ait été effectuée entre-temps avec une autre méthode ou non.
- Sauvegarde en miroir : une sauvegarde en miroir est stockée dans un format non compressé, qui reflète tous les fichiers et configurations des données sources. Elle est accessible au même titre que les données d'origine.
Historisation (Versioning)
L'historisation des versions sauvegardées s'avère utile lorsque la méthode de sauvegarde choisie n'est pas la sauvegarde complète, et plus encore si la donnée est apurée de la base de données active à chaque sauvegarde.
Ainsi, lorsque certaines modifications apportées au système entraînent des résultats indésirables (car la structure des données est susceptible de changer au fil du temps), le Trésor peut restituer un instantané du système à un moment donné.
La fréquence d'historisation cadence avec celle de la sauvegarde (quotidienne, hebdomadaire, etc.). Il s'agit là des données fréquemment consultées.
Archivage
L'historique des versions, bien qu'essentiel, ne peut pas être conservé indéfiniment. Au fil du temps, les versions conservées peuvent remonter à plusieurs mois, voire à des années. Il devient alors nécessaire d'archiver les données les plus anciennes, ce qui demande de mettre en place un plan d'archivage.
Un plan d'archivage est un ensemble de pratiques et de règles visant à gérer et à conserver durablement les documents et les données d'une organisation, qu'ils soient physiques ou numériques.
Historiquement, l'archivage concernait principalement des documents physiques, tels que des contrats, mais avec l'avènement des outils numériques, de nombreuses entreprises privilégient désormais l'archivage électronique.
Cette transition est motivée par une problématique de réduction des coûts, et non de risque, puisque si l'archivage physique expose les documents à une éventuelle dégradation, liée aux conditions météorologiques ou aux conditions de conservation des archives, l'archivage numérique expose lui aussi les données aux cyberattaques, ou encore aux pannes du matériel informatique.
Cette seconde option peut également s'appliquer aux documents physiques. Il faut juste veiller à les numériser en amont : c'est la dématérialisation des données, ou numérisation des documents.
Cependant, contrairement à une simple sauvegarde de données, l'archivage répond à des exigences réglementaires. Par exemple, dans l'espace OHADA, dont le Bénin fait partie, les livres comptables et les pièces justificatives doivent être conservés dix ans (Acte uniforme relatif au droit comptable et à l'information financière, art. 24), comme en France (Code de commerce, art. L123-22) ; pour la comptabilité publique, les durées relèvent de la réglementation nationale des archives.
Les Approches Big Data et Cloud Computing
Le plan d'archivage nécessite un espace centralisé, doté d'une grande capacité de stockage pour conserver les données : un data center. Au sein d'un data center, on trouve aussi bien les éléments matériels (disques durs…) que logiciels (un système de gestion de bases de données…).
Pour ainsi dire, le data center nous servira à héberger la donnée dans tous ses états durant son cycle de vie : de la génération de la donnée jusqu'à son archivage.
Le Big Data
Malgré l'efficacité des data centers pour le plan d'archivage traditionnel, le développement rapide des technologies et l'explosion des volumes de données ont poussé les entreprises à dépasser les capacités des systèmes de gestion de bases de données (SGBD) classiques.
Google, en particulier, a été pionnier en repoussant ces limites des SGBD classiques et en participant à la réinvention du secteur, avec de nouveaux outils pour le big data (données massives).
De nouveaux types de SGBD ont donc émergé dans la couche logicielle, pendant que, dans la couche matérielle, le traitement de ces vastes volumes de données a été réparti sur des grappes de machines ordinaires, plutôt que confié à des processeurs toujours plus puissants.
Le Cloud Computing
Pour mettre en place un système big data, une infrastructure robuste est primordiale. Ce qui peut entraîner des coûts élevés pour son acquisition et sa maintenance…
D'un autre côté, les premiers acteurs à avoir été confrontés à ces défis (Google, Amazon, Microsoft) ont rapidement dû trouver des solutions, voire mettre en place des infrastructures dépassant l'entendement. Un peu plus tard leur est venue l'idée du cloud computing.
En essence, le cloud computing permet d'utiliser l'infrastructure de data centers d'autres entreprises. Il offre les mêmes avantages de stockage et de traitement des données, sans avoir à gérer soi-même l'infrastructure. C'est comme avoir accès à un data center complet sans en posséder un, moyennant un abonnement : c'est l'Infrastructure as a Service (IaaS).
Les principaux services de cloud aujourd'hui sont :
- GCP : Google Cloud Platform, de Google ;
- AWS : Amazon Web Services, d'Amazon ;
- Azure : détenu par Microsoft.
En choisissant l'IaaS, le Trésor se voit mettre à sa disposition uniquement l'infrastructure du data center. La gestion du plan d'archivage, par contre, reste sous sa responsabilité.
Cependant, certains services cloud iront encore plus loin, en proposant des logiciels intégrés sur la plateforme cloud qui prendront en charge le processus d'archivage en quelques clics : c'est le Software as a Service (SaaS).
La Méthodologie
Dans le chapitre précédent (partie 1.2.3), on s'est intéressé aux couches interne et externe des SGBD. Mais dans celui-ci, on va descendre un peu plus en profondeur, à la couche d'en bas : le système de gestion des fichiers.
Pour ce faire, il est essentiel de comprendre d'abord comment la machine écrit l'information sur le disque.
En effet, chaque fichier, avant d'être exploité par la machine, doit être converti en langage binaire, composé uniquement de 0 et de 1, le seul que les ordinateurs comprennent.
Mais avant, il est important de souligner qu'à chaque lettre du clavier est associé un code ASCII, et c'est plutôt la liste de ces correspondances qui sera traduite en binaire. Convertir l'ASCII en binaire revient donc à passer du système décimal au système binaire.
L'ASCII ne code que 128 caractères, sans lettres accentuées ; un texte en français passe aujourd'hui par Unicode, dont l'encodage UTF-8 conserve les codes ASCII sur un octet et en utilise deux à quatre pour les autres caractères. Le fichier exemple ci-dessous n'emploie que des caractères ASCII : un octet chacun.
Traduction du fichier exemple en binaire :
| Caractère | Code ASCII | Code ASCII en binaire (8 bits) |
|---|---|---|
| C | 67 | 01000011 |
| o | 111 | 01101111 |
| t | 116 | 01110100 |
| o | 111 | 01101111 |
| n | 110 | 01101110 |
| o | 111 | 01101111 |
| u | 117 | 01110101 |
| , | 44 | 00101100 |
| espace | 32 | 00100000 |
| l | 108 | 01101100 |
| e | 101 | 01100101 |
| espace | 32 | 00100000 |
| 0 | 48 | 00110000 |
| 5 | 53 | 00110101 |
| espace | 32 | 00100000 |
| j | 106 | 01101010 |
| u | 117 | 01110101 |
| i | 105 | 01101001 |
| n | 110 | 01101110 |
| espace | 32 | 00100000 |
| 2 | 50 | 00110010 |
| 0 | 48 | 00110000 |
| 2 | 50 | 00110010 |
| 4 | 52 | 00110100 |
Le binaire écrit sur 8 bits, c'est-à-dire avec 8 chiffres (0 ou 1), représente un octet.
La séquence qui sera finalement écrite dans la machine est la suivante (la concaténation de tous ces octets à la chaîne) :
0100001101101111011101000110111101101110011011110111010100101100
0010000001101100011001010010000000110000001101010010000001101010
0111010101101001011011100010000000110010001100000011001000110100
Une fois cette séquence binaire correspondant au fichier en entrée obtenue, il devient alors possible de l'enregistrer sur un support de stockage à long terme, tel qu'un périphérique externe.
Écriture du Fichier Binaire sur un Support Optique
Traditionnellement, l'écriture d'un fichier binaire sur un disque optique, comme un DVD ou un Blu-Ray, consistait à graver le binaire sur sa surface à l'aide d'un graveur.
Le graveur en question utilise un faisceau laser pour enregistrer les informations sous forme de petits points, qui peuvent ensuite être lus par un lecteur compatible.
Pour produire les 1 et les 0, le graveur de DVD allume et éteint le faisceau.
En effet, le laser, quand il s'allume, chauffe certaines parties de la couche enregistrable pour créer des creux (ou « pits »). Les zones non gravées, appelées « lands », restent intactes.
Ces différences entre les creux et les zones plates sont ce que le lecteur laser interprète comme des 1 et des 0 lors de la lecture des données.
Précision : sur un disque pressé, ce sont en réalité les transitions entre creux et plats qui codent les 1, la longueur de chaque zone codant une suite de 0 ; et sur un disque enregistrable, le laser ne creuse pas la surface, il modifie la réflectivité d'une couche de colorant. Le principe reste le même : deux états, lisibles par le faisceau.
En récupérant le binaire de « Cotonou, le 05 juin 2024 », on le grave comme ceci :
L'ADN comme Support de l'Information
Notre corps est en majorité composé de cellules, qui elles-mêmes contiennent des organites, dont le noyau, où se trouve notre matériel génétique.
Ce matériel génétique est constitué de molécules d'ADN (acide désoxyribonucléique) naturelles enroulées sur elles-mêmes, formant des chromosomes dans le noyau.
Chaque molécule d'ADN porte l'information génétique essentielle à la croissance, au développement et au fonctionnement de tous les organismes vivants.
Zoom sur la Molécule d'ADN Naturelle
L'ADN est une molécule composée de deux brins enroulés l'un autour de l'autre, ce qui forme une double hélice. Les brins sont composés de quatre nucléotides différents, avec leurs bases azotées tournées vers l'intérieur de la molécule : adénine (A), thymine (T), cytosine (C) et guanine (G).
Les bases A d'un brin sont toujours en face des T de l'autre brin, alors que les bases G sont toujours en face des C : c'est la complémentarité des bases.
L'information génétique est déterminée par l'ordre des bases dans la séquence d'ADN, c'est-à-dire que la composition spécifique de cette séquence définit les gènes, qui ne sont rien d'autre que les instructions déterminant les caractéristiques d'un individu, ou de tout être vivant en général.
L'ADN Vu à travers les Systèmes de Numération
L'ADN peut être considéré comme un long texte rédigé à l'aide d'un alphabet de quatre lettres (A, T, G, C), représentant les quatre bases azotées.
Mathématiquement parlant, notre système d'écriture numérique par défaut est le système décimal, composé de 10 chiffres (0, 1, 2, 3, 4, 5, 6, 7, 8, 9).
Mais en dehors de ce système, nous avons également :
- le système binaire, avec un alphabet de 2 chiffres (0, 1) ;
- le système quaternaire, avec un alphabet de 4 chiffres (0, 1, 2, 3) ;
- …
Un nombre exprimé dans un système de numération donné peut toujours être converti dans un autre système, et vice versa : décimal → binaire, binaire → décimal.
L'écriture de l'ADN, utilisant quatre symboles, suit donc un système quaternaire.
Mais pour passer du quaternaire standard (0, 1, 2, 3) au quaternaire ADN (A, T, C, G), il est nécessaire d'établir une correspondance entre ces deux ensembles de symboles :
0→A 1→T 2→C 3→G
Sur la base de cette convention, « Cotonou, le 05 juin 2024 » devient :
| Caractère | Code ASCII | ASCII en quaternaire standard | ASCII en quaternaire ADN |
|---|---|---|---|
| C | 67 | 1003 | TAAG |
| o | 111 | 1233 | TCGG |
| t | 116 | 1310 | TGTA |
| o | 111 | 1233 | TCGG |
| n | 110 | 1232 | TCGC |
| o | 111 | 1233 | TCGG |
| u | 117 | 1311 | TGTT |
| , | 44 | 0230 | ACGA |
| espace | 32 | 0200 | ACAA |
| l | 108 | 1230 | TCGA |
| e | 101 | 1211 | TCTT |
| espace | 32 | 0200 | ACAA |
| 0 | 48 | 0300 | AGAA |
| 5 | 53 | 0311 | AGTT |
| espace | 32 | 0200 | ACAA |
| j | 106 | 1222 | TCCC |
| u | 117 | 1311 | TGTT |
| i | 105 | 1221 | TCCT |
| n | 110 | 1232 | TCGC |
| espace | 32 | 0200 | ACAA |
| 2 | 50 | 0302 | AGAC |
| 0 | 48 | 0300 | AGAA |
| 2 | 50 | 0302 | AGAC |
| 4 | 52 | 0310 | AGTA |
En concaténant tous ces quaternaires à la chaîne, on obtient le premier brin :
TAAGTCGGTGTATCGGTCGCTCGGTGTTACGAACAATCGATCTTACAA
AGAAAGTTACAATCCCTGTTTCCTTCGCACAAAGACAGAAAGACAGTA
Il faut ensuite prendre le complémentaire de cette séquence (A en face de T, C en face de G) pour obtenir le second brin :
ATTCAGCCACATAGCCAGCGAGCCACAATGCTTGTTAGCTAGAATGTT
TCTTTCAATGTTAGGGACAAAGGAAGCGTGTTTCTGTCTTTCTGTCAT
Précision : cet encodage direct, une base par paire de bits, est simplifié à des fins pédagogiques ; notre propre séquence en porte la marque, avec la répétition « ACAAAGAAAG ». Les systèmes réels évitent ces homopolymères, sources d'erreurs de séquençage, équilibrent la proportion de G et de C, et ajoutent des codes correcteurs d'erreurs ainsi que des adresses permettant de retrouver un fragment donné (Goldman et al., 2013 ; Erlich et Zielinski, 2017 ; Organick et al., 2018).
Nous venons ainsi d'encoder notre fichier sur une molécule d'ADN. Pour retrouver le texte initial, il faut faire le chemin inverse.
Les Résultats
Écrire en quaternaire plutôt qu'en binaire n'est pas en soi un avantage : chaque base ADN porte 2 bits, ni plus ni moins que la même information répartie sur deux fois plus d'unités binaires. L'encodage de la phrase « Cotonou, le 05 juin 2024 » a ainsi nécessité 192 bits en binaire (partie 2.1), soit exactement 96 bases en quaternaire ADN : la même quantité d'information, sous une forme deux fois plus compacte en nombre d'unités, puisque chaque base en porte deux. Le brin complémentaire ne change rien à ce compte : il ne porte pas d'information supplémentaire, il double la matière, pas la capacité. Dans les systèmes réels, les données sont d'ailleurs écrites sur des brins simples courts, de 150 à 200 bases, et non sur une double hélice complète.
Ce qui distingue réellement l'ADN, c'est la taille physique de son unité de mémoire, pas le nombre de symboles de son alphabet. Dans le stockage ADN, l'unité de mémoire est le nucléotide, qui porte deux bits ; dans une mémoire flash, c'est la cellule, qui en porte aujourd'hui trois ou quatre. Ce qui fait la différence, c'est la taille de l'unité : une cellule de flash mesure quelques dizaines de nanomètres et s'empile sur des centaines de couches, une base d'ADN occupe 0,34 nanomètre le long d'une molécule large de 2 nanomètres. Rapportée au volume ou à la masse, la densité théorique de l'ADN est de l'ordre de plusieurs centaines d'exaoctets par gramme (Church et al., 2012), et 215 pétaoctets par gramme ont été atteints en laboratoire (Erlich et Zielinski, 2017) : plusieurs ordres de grandeur au-dessus des supports actuels.
Ce qui rend davantage cette technologie prometteuse, c'est que les data centers aujourd'hui consomment non seulement d'énormes quantités d'électricité (environ 460 TWh en 2022, soit près de 2 % de l'électricité mondiale selon l'Agence internationale de l'énergie, ce qui les placerait autour du dixième rang mondial des pays consommateurs s'ils en étaient un), mais également des centaines de milliards de litres d'eau pour leur refroidissement.
Ainsi, le secteur numérique à lui seul produit autant de gaz à effet de serre que le trafic aérien, ce qui soulève des questions de responsabilité sociétale des entreprises (RSE), avec un impact environnemental à la fois physique (consommation d'eau) et numérique (consommation d'électricité).
Tant de problématiques que le stockage sur ADN peut atténuer : une fois écrite, la molécule ne consomme rien, là où un disque ou une bande doivent être alimentés, refroidis et remplacés. L'écriture (la synthèse) et la lecture (le séquençage) restent, elles, coûteuses en énergie et en réactifs, et la conservation demande le froid ou une encapsulation (partie 6). Ce qui contribuerait donc à une réduction significative de l'empreinte carbone du secteur numérique dans son ensemble. Et le Trésor, en tant qu'organisme public, a cette responsabilité de montrer l'exemple et de promouvoir les meilleures pratiques.
Les Implications
Pour donner suite à la partie 1.3.5, posons-nous la question de savoir : que fait-on de la donnée, passé le délai d'archivage réglementaire ?
En effet, ces données « froides » peuvent suivre par la suite un processus de destruction, pour libérer de l'espace de stockage. Mais la molécule d'ADN synthétique se présente comme une solution innovante pour le stockage à long terme, offrant la possibilité de conserver les informations pendant des siècles, et des millénaires si la molécule est encapsulée dans de la silice et gardée au froid (Grass et al., 2015).
Petite précision : la molécule d'ADN synthétique ne va pas remplacer les data centers traditionnels, qui se trouvent être toujours très efficaces pour la gestion opérationnelle des données. Mais elle pourrait s'intégrer dans l'architecture globale, comme le support de stockage des données « froides » : les archives.
Mais pour Quoi Faire ?
Avec l'essor de l'intelligence artificielle (IA), conserver les données à long terme est essentiel pour élaborer une bonne stratégie d'intelligence artificielle. En d'autres termes, il n'y a pas d'IA sans les données. En gardant les données historiques, le Trésor peut accumuler des ensembles de données riches et diversifiés, ce qui peut lui permettre d'améliorer la précision des algorithmes, lui offrant par conséquent une base solide pour des analyses approfondies et des décisions plus éclairées.
En outre, contrairement à l'archivage standard, où les données sont souvent intégrées dans une seule image ou un seul système, cette nouvelle approche de stockage implique l'encodage des informations dans des capsules d'ADN, chaque capsule étant indépendante des autres. Cela signifie que les données sont décentralisées et protégées contre les pertes ou les corruptions d'informations, ainsi que contre les cyberattaques qui pourraient affecter un système centralisé.
De plus, cette méthode de stockage améliore la souveraineté des données, en offrant une alternative aux solutions de cloud computing, d'autant plus qu'il s'agit de données étatiques et sensibles. En utilisant l'ADN comme support de stockage, le Trésor s'inscrit dans une dynamique de sécurité accrue et de contrôle total sur ses données.
Les Actions de Mise en Œuvre
De la même façon qu'on a présenté le graveur, dans la partie 2.1, comme l'outil qui traduit des données numériques en une forme physique sur un support, il nous faut un outil pour synthétiser exactement la molécule correspondant à la séquence obtenue en quaternaire ADN : c'est le synthétiseur d'ADN. Et, comme le lecteur pour le disque, il nous faut un second outil pour la relire : c'est le séquenceur.
Ainsi :
- le synthétiseur réalise l'encodage, en fabriquant la molécule base par base ;
- le séquenceur réalise le décodage, en lisant les informations encodées sur la molécule.
Ce qui libère l'humain de cette tâche technique.
Le principal défi réside dans la vitesse de synthèse et de lecture des données. Actuellement, la synthèse de données sur ADN est lente et très coûteuse.
Toutefois, la création en 2020 de la « DNA Data Storage Alliance » par quatre entreprises américaines (Western Digital, Microsoft, Twist Bioscience et Illumina), qui a vocation à promouvoir cette technologie et à standardiser l'encodage des données, montre l'intérêt porté à la question. Il serait ainsi judicieux de voir davantage d'États investir dans cette technologie innovante, afin d'en accélérer le développement et de soutenir son évolution.
Les Recommandations
Au fil du temps, les technologies de stockage, de la disquette au DVD, ont émergé puis disparu, nous forçant à migrer constamment nos données vers de nouveaux supports.
Cependant, l'ADN, en tant que support de stockage, se présente comme une alternative potentiellement éternelle. Contrairement aux technologies numériques, l'ADN existe depuis des milliards d'années, et son interprétation sera toujours possible tant qu'il y aura des formes de vie.
Toutefois, il faudrait veiller à conserver les molécules d'ADN synthétisées au froid, au sec et à l'abri de la lumière, isolées de l'eau, de l'oxygène et des enzymes qui les dégradent : en pratique, encapsulées dans des billes de silice, ce qui a été démontré comme la protection la plus durable.
Enfin, bien que cette technologie soit encore à ses débuts, son potentiel pour un stockage de données ultra-durable est immense.
Conclusion Générale
La transition vers l'archivage sur ADN synthétique constituera un bond technologique majeur pour le Trésor Public. En permettant une gestion des données plus efficace et plus durable, cette innovation répond aux défis posés par la croissance exponentielle des données, et par la nécessité pour les organismes de l'État de disposer d'une empreinte écologique réduite.
En adoptant ces nouvelles technologies, l'État se positionne non seulement comme un acteur moderne et avant-gardiste dans la gestion de ses finances, mais aussi comme un modèle de responsabilité environnementale pour les institutions publiques.
Bibliographie
- Cours bases de données
- Cours complet pour apprendre les systèmes de gestion de bases de données
- What Is Data Quality and Why Is It Important?
- Qu'est-ce que la sauvegarde de données ?
- Plan d'archivage : comment le mettre en place ?
- Les avantages et inconvénients de l'archivage physique et électronique
- Quels sont les délais de conservation des documents pour les entreprises ?
- Politique d'archivage de l'Inspection générale des finances, juin 2021
- Archives nationales du Bénin
- Politique nationale de développement des archives 2021-2030
- L'ADN
- L'ADN, support de l'information génétique
- Les chromosomes, structures universelles des cellules eucaryotes
- Le stockage de données sur ADN synthétique : une révolution nécessaire ?
- Agence internationale de l'énergie, Electricity 2024, janvier 2024. iea.org
- DNA Data Storage Alliance
- G. M. Church, Y. Gao, S. Kosuri, « Next-generation digital information storage in DNA », Science, vol. 337, n° 6102, p. 1628, 2012.
- N. Goldman et al., « Towards practical, high-capacity, low-maintenance information storage in synthesized DNA », Nature, vol. 494, p. 77–80, 2013.
- R. N. Grass, R. Heckel, M. Puddu, D. Paunescu, W. J. Stark, « Robust chemical preservation of digital information on DNA in silica with error-correcting codes », Angewandte Chemie International Edition, vol. 54, n° 8, p. 2552–2555, 2015.
- Y. Erlich, D. Zielinski, « DNA Fountain enables a robust and efficient storage architecture », Science, vol. 355, n° 6328, p. 950–954, 2017.
- L. Organick et al., « Random access in large-scale DNA data storage », Nature Biotechnology, vol. 36, p. 242–248, 2018.
- L. Ceze, J. Nivala, K. Strauss, « Molecular digital data storage using DNA », Nature Reviews Genetics, vol. 20, p. 456–466, 2019.
- OHADA, Acte uniforme relatif au droit comptable et à l'information financière, 2017, art. 24.
Illustrations : toutes les figures sont redessinées en SVG d'après celles de l'étude (cours de bases de données pour les couches d'un SGBD, manuels de biologie pour la cellule et la molécule d'ADN, schéma d'un lecteur optique pour le graveur, schéma du MinION d'Oxford Nanopore pour le séquenceur). Les figures qui montrent le fichier exemple, les deux tableaux et les séquences sont calculés à partir du texte « Cotonou, le 05 juin 2024 » ; la trace de courant du séquenceur est simulée pour les vingt premières bases du brin. Les références 15 à 23 ont été ajoutées lors de la correction.
Envie d'en discuter ?
Écrivez-moi à merlix@monkoun.com
ou retrouvez-moi sur LinkedIn.