Connecteur S3
Configuration du connecteur
Le connecteur S3 permet de synchroniser les fichiers et documents stockés dans un bucket compatible S3 (AWS S3, OVH, Scaleway, ou tout autre provider compatible) vers Wikit Semantics.
| Nom du champ | Format / Type | Obligatoire | Commentaire |
|---|---|---|---|
| URL de l'endpoint S3 | URL | ✅ | URL du point d'accès de votre provider S3 (ex : https://s3.gra.io.cloud.ovh.net) |
| Nom du bucket | Texte libre | ✅ | Nom du bucket S3 à synchroniser |
| Identifiant de clé d'accès | Mot de passe / Token | ✅ | Access Key ID pour l'authentification |
| Clé d'accès secrète | Mot de passe / Token | ✅ | Secret Access Key associée à l'identifiant de clé d'accès |
| Région | Texte libre | ➖ | Identifiant de région requis par certains providers (ex : gra pour OVH, fr-par pour Scaleway) |
| Préfixe | Texte libre | ➖ | Chemin de base pour limiter la synchronisation à un sous-dossier du bucket (ex : documents/public/) |
| Chemins à inclure | Liste de textes | ➖ | Limite la synchronisation aux dossiers listés. Format attendu : Nom-de-la-bibliotheque/Nom-du-dossier |
| Chemins à exclure | Liste de textes | ➖ | Exclut les dossiers listés de la synchronisation. Format attendu : Nom-de-la-bibliotheque/Nom-du-dossier |
| Forcer le mode path-style | Oui / Non | ➖ | Activé par défaut. À désactiver uniquement si votre provider requiert le mode virtual-hosted |
| Désactiver l'URL source | Oui / Non | ➖ | Lorsqu'activé, aucune URL source ne sera associée aux documents synchronisés |
| Champ de métadonnée URL source | Texte libre | ➖ | Nom du champ de métadonnée S3 contenant l'URL source à associer au document |
| Champ de métadonnée date de modification | Texte libre | ➖ | Nom du champ de métadonnée S3 contenant la date de modification (format ISO). Si absent ou invalide, la date native de l'objet S3 est utilisée |
💡 Les champs marqués ✅ sont obligatoires pour que le connecteur puisse fonctionner.
Fonctionnement du connecteur
Le connecteur S3 fonctionne en synchronisation intelligente (smart sync) :
- Détection des changements : il insère, met à jour ou supprime les documents en comparant l'état actuel du bucket avec l'état déjà indexé dans Wikit Semantics.
- Détection des modifications : la date de modification est récupérée depuis le champ de métadonnée configuré (
Champ de métadonnée date de modification), au format ISO. Si ce champ est absent ou invalide, la date de modification native de l'objet S3 est utilisée. - Filtres de chemin :
Préfixelimite la synchronisation à un sous-dossier du bucket.Chemins à inclureetChemins à exclurepermettent de cibler finement les dossiers à synchroniser. - URL source : par défaut, une URL source est associée à chaque document synchronisé. Vous pouvez désactiver cette association (
Désactiver l'URL source) ou la personnaliser en précisant le champ de métadonnée S3 contenant l'URL à utiliser (Champ de métadonnée URL source).
FAQ
Comment trouver l'URL de l'endpoint S3 ?
L'URL de l'endpoint dépend de votre provider. Quelques exemples :
- OVH :
https://s3.<region>.io.cloud.ovh.net - Scaleway :
https://s3.<region>.scw.cloud - AWS :
https://s3.<region>.amazonaws.com
Référez-vous à la documentation de votre provider pour retrouver l'endpoint exact associé à votre bucket.
Comment générer une clé d'accès (Access Key / Secret Key) ?
Chaque provider dispose de son propre espace de gestion des clés d'accès (IAM ou équivalent). Vous devez y créer ou récupérer :
- un Identifiant de clé d'accès (Access Key ID)
- une Clé d'accès secrète (Secret Access Key)
Ces identifiants doivent disposer au minimum des droits de lecture sur le bucket à synchroniser.
Quelle différence entre le mode path-style et virtual-hosted ?
- Path-style (défaut) : l'URL d'accès au bucket est de la forme
https://endpoint/bucket/objet. Compatible avec la majorité des providers S3. - Virtual-hosted : l'URL est de la forme
https://bucket.endpoint/objet. Requis par certains providers ou configurations spécifiques.
Si votre provider supporte et requiert le mode virtual-hosted, désactivez l'option Forcer le mode path-style.
Comment limiter la synchronisation à un sous-dossier du bucket ?
Utilisez le champ Préfixe pour indiquer le chemin de base (ex : documents/public/). Seuls les objets dont le nom commence par ce préfixe seront synchronisés. Pour un ciblage plus fin, vous pouvez combiner Préfixe avec les champs Chemins à inclure et Chemins à exclure.
Les documents supprimés dans le bucket S3 sont-ils supprimés dans Wikit Semantics ?
Oui. Lors de chaque cycle de synchronisation, le connecteur compare l'état du bucket avec les documents déjà indexés. Tout document absent du bucket est automatiquement supprimé de Wikit Semantics.