> For the complete documentation index, see [llms.txt](https://cleyrop.gitbook.io/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://cleyrop.gitbook.io/docs/v-4.5/gouvernance-de-donnees/datasets-et-meta-donnees.md).

# Datasets et méta-données

Les **Datasets** sont au cœur de la gouvernance des données dans Cleyrop.

Ils représentent les unités de stockage et de traitement des données structurées : chaque dataset contient un ensemble de lignes et de colonnes, issues de sources internes ou externes, et constitue la base de tout flux de transformation, d’analyse ou de visualisation.

***

Un dataset est un ensemble de données structurées stocké sous forme tabulaire (lignes et colonnes).

Il peut provenir :

* d’une source externe (fichier Excel, CSV, base de données, API, etc.), ou
* d’une source interne (autre dataset, dataflow, collecte depuis un dépôt).

Chaque dataset dispose :

* d’un **schéma** (colonnes, types, format),
* de **métadonnées** (propriétaire, origine, sensibilité, labels, dernière mise à jour),
* et d’un **historique de rafraîchissements** retraçant ses mises à jour.

## États d’un dataset

Chaque dataset peut se trouver dans un état fonctionnel, reflétant sa disponibilité :

| État                      | Description                                                                                  |
| ------------------------- | -------------------------------------------------------------------------------------------- |
| Initialisé                | Le dataset a été créé, mais n’a pas encore été alimenté.                                     |
| Rafraîchissement en cours | Une mise à jour des données est en cours d’exécution.                                        |
| Valide                    | Le dernier rafraîchissement a réussi. Le dataset est utilisable.                             |
| Avertissement             | Le dernier rafraîchissement a rencontré des erreurs partielles. Le dataset reste utilisable. |
| Erreur                    | Tous les rafraîchissements ont échoué. Le dataset n’est pas utilisable.                      |

## Rafraîchissements

Un rafraîchissement met à jour les données du dataset à partir de sa source.

Il peut être déclenché :

* automatiquement, selon une planification définie,
* manuellement, par le responsable du dataset.

**Historique** : tous les rafraîchissements sont tracés depuis l’onglet *Historique*, permettant d’analyser les échecs, les durées d’exécution et les volumes traités.

### Statuts d’un rafraîchissement

| Statut        | Signification                                                               |
| ------------- | --------------------------------------------------------------------------- |
| Créé          | Le rafraîchissement a été enregistré mais pas encore lancé.                 |
| En attente    | Le rafraîchissement est en file d’exécution.                                |
| En cours      | L’importation des données est en cours.                                     |
| Succès        | Le dataset a été mis à jour avec succès.                                    |
| Avertissement | Des anomalies ont été détectées (fichiers partiels, incohérences mineures). |
| Échec         | Le rafraîchissement a échoué (connexion, format, droit d’accès…).           |
| Ignoré        | Le rafraîchissement a été annulé ou ignoré.                                 |

## Sensibilité et classification

### Niveaux de sensibilité

La sensibilité détermine la confidentialité et les conditions d’accès au dataset.

Elle est définie à la création et hérite automatiquement de sa source (datasource ou autre dataset).

| Niveau    | Description                                  |
| --------- | -------------------------------------------- |
| Interne   | Accessible à tous les utilisateurs           |
| Sensible  | Accessible aux membres des projets autorisés |
| Restreint | Accessible aux membres des projets autorisés |

**Héritage depuis une source**

* Si la datasource ou le dataset source est **interne**, le nouveau dataset est **interne**.
* Si l’origine est sensible, le dataset hérite du niveau sensible.
* Si l’origine est restreinte, il reste restreint.
* Si plusieurs datasets sources sont utilisés dans un dataflow, le niveau de sensibilité du résultat est le plus **restrictif des origines**.

### Niveaux de classification

La classification décrit la maturité et la transformation des données :

<table><thead><tr><th width="370.046875">Niveau</th><th>Signification</th></tr></thead><tbody><tr><td>🥉 Bronze</td><td>Données brutes non transformées.</td></tr><tr><td>🥈 Argent</td><td>Données nettoyées et prêtes à être analysées.</td></tr><tr><td>🥇 Or</td><td>Données finales prêtes à être diffusées (tableaux de bord, API, assistants IA).</td></tr></tbody></table>

## Labels et métadonnées

Les utilisateurs peuvent ajouter des labels à un dataset lors de sa création afin de faciliter la recherche et la compréhension des données dans la bibliothèque.

* Les labels sont configurés dans l’étape *Métadonnées*.
* Ils peuvent être choisis dans une **liste existante ou créés librement.**

**Exemples de labels** :

\[finance], \[RH], \[open-data], \[production], \[ref-géographique]

## Stockage et export

Les datasets sont stockés au format tabulaire optimisé (parquet) et consultables dans la plateforme via la vue *Dataset*.

Chaque dataset contient :

* un schéma (colonnes, types, contraintes),
* des métadonnées (origine, propriétaire, fréquence de mise à jour),
* un lien vers ses dataflows d’origine ou descendants.

{% hint style="info" %}
Les exports se font au format CSV.
{% endhint %}

***

## Bonnes pratiques de gouvernance

* **Nommer** clairement vos datasets (préfixes métier, version, domaine).
* **Automatiser** les rafraîchissements pour garantir l’actualité des données.
* Utiliser les **labels** pour assurer une bonne compréhension.
* Suivre l’historique des **rafraîchissements** pour détecter les anomalies.
* **Classifier** vos datasets (bronze, argent, or) pour organiser les flux de transformation.
