> For the complete documentation index, see [llms.txt](https://cleyrop.gitbook.io/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://cleyrop.gitbook.io/docs/projet-data-and-ia/studio-ai/corpus-de-documents.md).

# Corpus de documents

Un corpus est un ensemble de documents textuels non structurés servant de base de connaissances pour les assistants IA.

Les documents sont **vectorisés** et stockés dans une base optimisée pour la recherche sémantique grâce à la technologie **RAG** (Retrieval-Augmented Generation).

Un corpus permet ainsi d’extraire des insights et de générer du contenu en langage naturel à partir de documents internes.

***

## Créer un corpus

1. Depuis le Studio IA, ouvrez l’onglet Corpus.
2. Cliquez sur `+ Créer` .
3. Choisissez la **langue principale** (français, anglais) ou activez la **détection automatique** (anglais, français, espagnol, allemand).
4. Sélectionnez les documents à inclure
5. Enrichissez les métadonnées si nécessaire.
6. Donnez un nom et une description au corpus.
7. Cliquez sur Créer : le processus d’embedding démarre.

   Une fois le statut passé à *Valide*, le corpus devient utilisable dans le projet.

{% hint style="warning" %}
Les **fichiers** à interroger doivent être **déposés dans les Données de Travail** avant de démarrer la création du Corpus

Les formats supportés : **PDF, DOCX, TXT, PPTX**

Le modèle d'embedding utilisé est BGE-M3
{% endhint %}

#### Enrichir les Métadonnées

**Extraites automatiquement**

* Chemin d’accès, format, titre, auteur, sujet, mots-clés, créateur, producteur, date de création/modification, nom du fichier, langue, nombre de pages.

**Enrichies (optionnelles)**

Vous pouvez ajouter des métadonnées par :

* condition (ex. si le chemin contient “contrats”),
* extraction (texte présent dans le document),
* ou combinaison des deux.

Ces métadonnées serviront ensuite de filtres dans les assistants IA pour affiner les recherches.

{% hint style="info" %}
Un corpus valide est accessible à tous les membres du projet depuis les assistants IA.
{% endhint %}

### États et statuts d'un Corpus <a href="#etats-dun-corpus" id="etats-dun-corpus"></a>

#### États

Un corpus peut être dans l'un des états suivants :

* **Créé** : le Corpus a été créé mais les fichiers n'ont pas encore été vectorisés
* **Valide :** le Corpus est valide et peut être utilisé par les utilisateurs de la plateforme pour créer des assistants et les interroger. Au moins un document a été vectorisé avec succès
* **En erreur** : le Corpus est en erreur et ne peut pas être utilisé par les utilisateurs de la plateforme. Aucun fichier n'a été vectorisé en succès.

#### Statuts d'un fichier <a href="#statuts-dun-fichier" id="statuts-dun-fichier"></a>

Les documents du corpus peuvent avoir plusieurs statut :

* **Créé** le fichier a été sélectionné mais n'a pas encore été vectorisé
* **En cours** : la vectorisation est en cours d'exécution
* **Succès** : la vectorisation a été exécuté avec succès
* **Echec** : la vectorisation a échoué

## Interroger un corpus avec un assistant IA

Une fois le corpus créé :

1. Associez-le à un assistant lors de la création ou de la modification de celui-ci.
2. Les utilisateurs peuvent **poser des questions en langage naturel.**
3. L’assistant analyse le corpus **vectorisé** et fournit une réponse basée sur le contenu des documents.
4. Les métadonnées permettent de **filtrer** les documents et d’obtenir des réponses ciblées.

## Modifier un corpus

Vous pouvez enrichir ou nettoyer un corpus à tout moment.

#### Ajouter des documents

1. Sélectionnez le corpus à enrichir.
2. Cliquez sur **Ajouter des documents.**
3. Sélectionnez les fichiers à intégrer (les documents déjà présents sont grisés).
4. Lancez l’intégration : les fichiers sont vectorisés et les métadonnées mises à jour.

Chaque ajout est historisé avec :

* la date et l’heure,
* le statut (*succès* ou *échec*).

#### Supprimer des documents

1. Sélectionnez le corpus à modifier.
2. Cliquez sur Supprimer des documents.
3. Choisissez les fichiers à retirer.
4. Validez la suppression.<br>

Les documents supprimés sont retirés des résultats d’assistants et leurs métadonnées supprimées.

L’historique des suppressions reste consultable (date, heure, statut).

{% hint style="info" %}
Tant qu’une suppression ou un ajout est en cours, aucune nouvelle action ne peut être initiée sur le corpus.
{% endhint %}

## Supprimer un corpus

Pour supprimer un corpus, cliquez sur l’icône 🗑️ de la carte correspondante dans l’onglet Corpus.

La suppression est définitive et retire immédiatement la base de connaissances du projet.

***

## Bonnes pratiques

* Regroupez les documents par thématique (ex. “Contrats clients”, “Procédures internes”).
* Vérifiez la langue et la qualité des fichiers pour optimiser la vectorisation.
* Évitez les fichiers excessivement volumineux ou bruités (OCR approximatif, scans).
* Mettez à jour régulièrement vos corpus pour maintenir la pertinence des réponses IA.
