> For the complete documentation index, see [llms.txt](https://cleyrop.gitbook.io/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://cleyrop.gitbook.io/docs/le-druide/interroger-des-datasets.md).

# Interroger des datasets

L'outil Cleyrop Recherche Dataset traduit automatiquement vos questions en requêtes SQL et les exécute sur les datasets auxquels vous avez accès.

***

## Prérequis

Avant d'utiliser l'outil Recherche Dataset depuis Le Druide :

1. **Disposer d'un dataset accessible** : le dataset doit être disponible dans votre projet ou dans le catalogue et vos droits utilisateurs doivent vous permettre d'y accéder.
2. **Configurer le token** : l'outil Recherche Dataset nécessite un token d'accès. Générez-le depuis votre **Espace personnel → Profil & Tokens**, puis renseignez-le dans la configuration du tool via le bouton ⚙️ dans Le Druide.

## Datasets accessibles

Vous pouvez interroger **tout dataset auquel votre compte utilisateur a accès** sur la plateforme. L'outil respecte vos droits d'accès : il ne peut pas interroger des datasets pour lesquels vous n'avez pas les permissions de lecture.

Vous pouvez demander à l'outil de lister vos datasets disponibles avant de commencer.

{% hint style="warning" %}
Plus vous avez accès à de datasets, plus la liste peut prendre du temps à s'afficher.
{% endhint %}

## Fonctionnalités disponibles

L'outil Recherche Dataset vous permet d'interagir avec vos données de plusieurs façons :

| Capacité                      | Ce que l'outil fait                                                     | Exemple de question                                                 |
| ----------------------------- | ----------------------------------------------------------------------- | ------------------------------------------------------------------- |
| **Exploration du schéma**     | Décrit la structure d'un dataset (colonnes, types, exemples de valeurs) | Décris-moi le schéma du dataset sales\_results.                     |
| **Récupération de données**   | Génère une requête `SELECT` sur vos données                             | "Montre-moi les 10 dernières ventes."                               |
| **Filtrage**                  | Construit une clause `WHERE` pour filtrer les résultats                 | "Liste les ventes avec un revenue supérieur à 5 000 €."             |
| **Agrégations**               | Utilise `GROUP BY` et `SUM`, `AVG`, `COUNT`...                          | "Quel est le revenue total par région pour 2024 ?"                  |
| **Jointures**                 | Joint plusieurs tables et agrège les résultats                          | "Donne-moi les catégories de produits et leur revenue total."       |
| **Requêtes temporelles**      | Utilise des fonctions de date pour grouper par période                  | "Combien de ventes par mois en 2023 ?"                              |
| **Statistiques**              | Calcule `AVG`, `STDDEV` et autres indicateurs                           | "Quelle est la valeur moyenne et l'écart-type du revenue ?"         |
| **Top-N / Bottom-N**          | Utilise `ORDER BY ... DESC LIMIT N`                                     | "Quelles sont les 5 meilleures ventes ?"                            |
| **Logique conditionnelle**    | Ajoute des conditions `CASE` ou `WHERE` sur des critères complexes      | "Quelles ventes ont été réalisées un vendredi ?"                    |
| **Comparaisons multi-tables** | Lance plusieurs requêtes et compare les résultats                       | "Compare le revenue de l'année dernière avec celui de cette année." |

{% hint style="info" %}
**À noter :**

* Lecture seule : l'outil ne peut que lire les données, il ne peut pas les modifier ni les supprimer.
* SQL simplifié : les requêtes très complexes (CTEs récursives, sous-requêtes imbriquées) peuvent être tronquées ou simplifiées.
  {% endhint %}

## Télécharger le résultat d'une requête sur un dataset

Lorsqu'une question porte sur un dataset auquel vous avez accès, Le Druide exécute des requêtes SQL pour retrouver l'information demandée. Le déroulé de cette recherche est visible dans la conversation, et le résultat peut être récupéré sous forme de fichier.

1. Depuis Le Druide, formulez une demande en mentionnant le **techname** du dataset concerné.
2. Consultez le détail de la recherche dans le **bloc dépliable** : datasets analysés et requêtes SQL exécutées.
3. Téléchargez le **fichier** correspondant au résultat de la requête.

{% hint style="warning" %}
Cette fonctionnalité s'appuie sur le Tool **Cleyrop Dataset**. Un fichier fourni en pièce jointe n'est pas interprété comme un dataset : aucune requête SQL n'est générée et le résultat n'est pas téléchargeable dans ce cas.
{% endhint %}

***

## Bonnes pratiques

* **Mentionnez le nom du dataset** : si vous le connaissez, précisez-le dans votre question (ex : `sales_results`). Sinon, demandez à l'outil de lister les datasets disponibles ou de décrire le schéma d'un dataset.
* **Nommez les colonnes** : si vous avez besoin d'une métrique précise, citez son nom exact (ex : "Montre-moi `customer_id` et `revenue_usd` pour les clients ayant plus de 5 achats").
* **Posez des questions naturelles** : inutile d'écrire du SQL, formulez votre question comme vous le feriez à un collègue (ex : "Quels produits se sont le mieux vendus au Q2 2024 ?").
* **Ajoutez des limites** : pour les grands volumes de données, précisez une limite dans votre question (ex : "les 20 premières lignes") pour obtenir une réponse plus rapide.
