Sorry, you need to enable JavaScript to visit this website.
Partager

Stocker et conserver ses données de recherche

La conservation des données doit impérativement être pensée en même temps que le projet de recherche. Cela permet de faciliter le projet de recherche tout au long de son déroulement en anticipant le cycle de vie du projet, mais aussi de prévenir les problèmes potentiels (perte ou indisponibilité de données). 
Nous différencions ici :

  • Le stockage : comme le lieu ou le support sur lequel les données sont conservées (un ordinateur personnel ; un disque dur externe ; un serveur distant...
  • La conservation : comme les pratiques comprenant non seulement les choix de stockage mais aussi les modalités d’accès aux fichiers et de documentation afin de maintenir la disponibilité, l’intégrité, la confidentialité et l’intelligibilité des données. La conservation doit être adaptée et tenir compte des risques qui pèsent sur les données et le projet. 
  • L’archivage (ici appelé « archivage définitif ») : comme un mode de conservation qui vise la conservation à long terme des données dans le cadre réglementaire.

Outre la question de la volumétrie de données nécessaire pour le projet, il est nécessaire de considérer au moins trois aspects : la temporalité de la conservation des fichiers, la sécurité de leur stockage et l’organisation de leur conservation. L’élaboration d’un Plan de Gestion de Données est l’occasion de formaliser les besoins et les solutions identifiées.
 

Il est possible de distinguer trois périodes relatives à la conservation des données de recherche. Là encore le Plan de Gestion de Données a vocation à vous aider à anticiper ces trois moments.

  1. La base active, pour une utilisation intensive ou régulière 

Il s’agit ici de conserver les données pour une utilisation intensive ou régulière, de sorte à ce qu’il soit facilement possible d’accéder et/ou de modifier les informations. Cela correspond aux phases de collecte, de nettoyage, ou d’analyse des données. 

  1. En base intermédiaire, pour des utilisations ponctuelles

A l’issue de cette première phase, lorsque les données ne font plus l’objet d’un usage régulier, elles peuvent être conservées en base dite « intermédiaire ». Il s’agit de les conserver pour des usages ponctuels, par exemple, pour les transmettre à des potentiels évaluateurs lors d’une procédure de publication, ou à des collègues pour une réutilisation ou pour un projet futur. Si cela est possible, la mise à disposition des données sur un entrepôt de données de confiance disciplinaire (ou recherche-data-gouv à défaut) est particulièrement pertinente lors de cette étape (voir la page « Publier ses données »). 

  1. En archivage définitif ou pérenne, une conservation pour le long terme 

« L’archivage des données de recherche peut être défini comme l’ensemble des pratiques visant à préserver des données dans le temps, en garantissant leur intégrité, leur authenticité et leur intelligibilité, pour des besoins de preuve, de mémoire ou d’intérêt public. » (Recherche Data Gouv (2025) L’archivage, nouveau point d’attention pour les données de la recherche.). L’archivage dit définitif a pour objectif de conserver sur un temps long les données et les documents de la recherche tout en assurant qu’ils restent compréhensibles et réutilisables. En cela l’archivage définitif nécessite un travail constant par des équipes spécialisées.

Au sens du Code du Patrimoine (article L211-1 et suivants), les données produites par la recherche publiques sont à considérer comme des archives publiques. Ces documents et bases de données sont susceptibles d’être versés aux archives compétentes après leur utilisation s’ils présentent un intérêt historique ou patrimonial. De même, leur destruction doit être encadrée par le service d’archives.

Attention, le dépôt sur une plateforme de mise à disposition de données (Recherche Data Gouv, Nakala, Zenodo…) n’est pas équivalent à un archivage définitif, car ne garantit jamais la conservation sur un temps long.

Pour identifier ses besoins de stockage, il peut être pertinent de formuler une série de questions en termes de Disponibilité, d’Intégrité, de Confidentialité et enfin de Traçabilité (Bras, 2017). Ces questions sont à étudier tant pour envisager la conservation en base active qu’en base intermédiaire. Nous proposons pour chaque catégorie une série d’exemples de questions pour définir ses besoins. Ces exemples ne sont pas exhaustifs.

La Disponibilité est la capacité du stockage ou du système d’information utilisé à permettre l’accès et la modification des données. Il faut alors anticiper au maximum le format et le type de stockage et d’usage qui sera utilisé.

  • Quel volume faut-il pour conserver l’ensemble des données ?
  • Quelle puissance faut-il pour transférer la quantité de données en un temps qui correspond aux usages ?
  • Peut-on se contenter d’extractions partielles ou faut-il tout extraire en même temps 
  • Le format du fichier est-il un format propriétaire ou pourrait-on y accéder via un autre logiciel ?

La Confidentialité est la capacité du stockage à ne permettre l’accès aux informations qu’aux personnes autorisées. Certains cadres réglementaires peuvent imposer des obligations (RGPD, droit de la propriété intellectuelle…). Il est donc indispensable d’anticiper et de définir le niveau de confidentialité nécessaire.

  • Le stockage doit-il être chiffré ?
  • Qui doit être autorisé à accéder aux données ?
  • Doit-on compartimenter les informations pour réduire la gravité d’une perte de confidentialité ?
  • Doit-on faire appel à un prestataire extérieur ? Si oui, quels sont les éléments contractuels à mettre en place ?
  • Des supports différents doivent-ils être utilisés pour séparer des données personnelles et des données anonymisées ou pseudonymisées ? 

L’Intégrité du stockage ou du système d’information est leur capacité à pouvoir maintenir et communiquer une information complète et non altérée. Du point de vue des archives, « un document ou une donnée est réputé intègre si son empreinte à un temps t+1 est identique à l'empreinte prise à un temps t » (Béchard, Fuentes Hashimoto, Edouard Vasseur, 2020). Il s’agit ici de s’assurer que la conservation et son usage n’influe ni sur l’accès aux données, ni sur leur exactitude ainsi que de définir les mesures permettant d’anticiper ou de résoudre les potentiels problèmes d’intégrité.

  • A-t-on des sauvegardes ? A quelles fréquences sont-elles réalisées ? Est-il possible de facilement comparer les sauvegardes pour identifier les modifications accidentelles ?
  • Quelle documentation accompagne les données ? Est-elle sauvegardée au même endroit ? Permet-elle d’identifier les erreurs potentielles ?
  • A-t-on des tests ou des indicateurs permettant de surveiller l’intégrité des données ?

Enfin la Traçabilité vient compléter la notion d’intégrité. Elle est la capacité du support à pouvoir rendre compte avec une confiance suffisante de ses évolutions et des modifications de ses documents. Il est nécessaire de définir en amont le niveau et les types de traçabilité qui sont souhaités.

  • A-t-on besoin de suivre les modifications ?
  • A-t-on besoin d’identifier l’auteur ou l’autrice de chaque modification ?
  • A-t-on besoin d’une sauvegarde des versions précédentes ?
  • Qui peut accéder à quelles versions ?

Concernant l’usage de sauvegardes, nous conseillons l’usage de la règle du « 3 - 2 - 1 » pour 3 copies des données, sur 2 supports différents, dont une hors site (et si possible déconnectée du système d’information).

Plusieurs réflexes sont à garder en tête pour optimiser et faciliter l’organisation des fichiers:

  • De la même manière qu’il est impératif de documenter les données pour faciliter la réutilisation par d’autres comme par soi, il est nécessaire de documenter dans le Plan de Gestion de Données les choix d’organisation et de stockage réalisés. 
  • L’arborescence de votre stockage doit idéalement être facile à comprendre et correspondre aux besoins. Il existe parfois des standards disciplinaires ou d’organisation qui peuvent faciliter l’organisation. Pour des projets ayant un volet numérique, l'atelier de la donnée de Strasbourg a mis en ligne un exemple d'arborescence.
  • Le nommage des documents doit être rigoureux et s’appuyer sur un système documenté. Un format unique de nommage (par exemple yyyymmdd_nom-du-fichier) doit permettre d’organiser chronologiquement et automatiquement les versions des documents selon la date inscrite dans le nom

Après avoir vérifié si votre laboratoire possède déjà des usages ou des politiques sur la conservation données, le guichet unique d’IP Paris (scienceouverte@ip-paris.fr)est à disposition pour orienter individuellement ou collectivement les chercheurs et les équipes. Il peut ainsi répondre à vos questions, accompagner à la réalisation d’un Plan de Gestion des Données, ou rediriger vers les interlocuteurs pertinents tels que :