Provenance des données

La provenance des données décrit l’origine d’une information et les opérations qui l’ont produite ou transformée. Elle relie des entités, comme un fichier ou un échantillon, à des activités, comme une mesure ou un calcul, et aux personnes, organismes ou logiciels responsables. Elle permet de reconstituer la chaîne allant de la source au résultat utilisé.

Éléments décrits

Un enregistrement de provenance peut identifier l’instrument, la méthode, la date, la version d’un logiciel, les paramètres, les jeux de données d’entrée et les étapes de nettoyage ou d’agrégation. Le modèle W3C PROV structure ces informations autour des entités, activités et agents, avec des relations telles que « a été généré par » ou « dérive de ».

La provenance complète les métadonnées descriptives d’un ensemble de données. Le titre et le sujet indiquent ce que contient l’ensemble ; la provenance explique comment ces données ont pris leur forme actuelle.

Utilité scientifique

Une chaîne explicite facilite la reproduction d’une analyse, l’évaluation de sa qualité, l’attribution des responsabilités et la détection d’une erreur propagée. Elle ne garantit pas que les données soient exactes : une procédure entièrement documentée peut rester biaisée ou inadaptée. Dans un contexte sanitaire, elle est voisine de la traçabilité sanitaire, mais porte d’abord sur l’histoire informationnelle des objets numériques et des traitements.

Besoin d’un éclairage vétérinaire ?

Contactez Vetofish pour un avis spécialisé en santé des animaux aquatiques.

Échanger avec nous