Outil · Exécution locale
Nouveau
Générateur de robots.txt pour les crawlers IA
En bref
Cet outil produit un fichier robots.txt commenté qui distingue trois familles de robots : ceux qui indexent pour citer, ceux qui récupèrent une page à la demande d’un utilisateur, et ceux qui collectent des données d’entraînement. Il s’adresse à tout éditeur qui veut être cité par les moteurs IA sans nourrir gratuitement l’entraînement des modèles. La génération est entièrement locale.
L’outil
Générateur de robots.txt pour les crawlers IA
Googlebot n’est pas un crawler IA. Ne le bloquez jamais : cela retirerait votre site de Google Search. Pour Gemini, le jeton à utiliser est Google-Extended.
Certains crawlers ignorent robots.txt. Ce fichier exprime une intention, il n’applique pas une interdiction technique.
Préréglage
Robots — une case cochée bloque le robot
robots.txt
Et maintenant
Cet outil vous a servi ? Il est gratuit et le restera. Le partager est la seule contrepartie demandée.
Mode d’emploi
Comment ça marche
Choisissez un préréglage
Visibilité IA maximale, « citer oui, entraîner non », ou blocage total selon votre stratégie.
Ajustez robot par robot
Chaque user-agent reste modifiable individuellement, avec le nom de son éditeur et son rôle réel.
Ajoutez vos chemins privés
Indiquez les répertoires à exclure, un par ligne, par exemple /wp-admin/ ou /panier/.
Téléchargez le fichier
Déposez le robots.txt obtenu à la racine de votre domaine, jamais dans un sous-dossier.
Contexte
Pourquoi c’est important pour le GEO
Le robots.txt est devenu un levier stratégique du GEO. Bloquer GPTBot n’a pas le même effet que bloquer OAI-SearchBot : le premier collecte des données d’entraînement, le second alimente l’index qui permet à ChatGPT de vous citer avec un lien. Confondre les deux revient souvent à se rendre invisible en croyant se protéger.
La distinction la plus utile est celle entre entraînement et citation. Un éditeur de contenu a généralement intérêt à autoriser les robots de recherche et les récupérations déclenchées par un utilisateur, tout en refusant l’entraînement, qui n’apporte ni trafic ni attribution.
Enfin, l’orthographe des user-agents est critique. Une majuscule oubliée ou un tiret manquant rend la directive silencieusement inopérante : le robot ne reconnaît pas la ligne et poursuit sa collecte comme si de rien n’était.
Questions
Questions fréquentes
Bloquer Googlebot protège-t-il des IA ?
Non, et c’est une erreur grave : cela retire votre site de Google Search. Pour l’usage de vos contenus par Gemini, le jeton dédié est Google-Extended.
Quelle différence entre GPTBot et ChatGPT-User ?
GPTBot collecte des pages pour l’entraînement. ChatGPT-User récupère une page précise parce qu’un utilisateur l’a demandée dans une conversation.
Le robots.txt est-il contraignant ?
Non. C’est une déclaration d’intention respectée par les acteurs sérieux. Certains robots l’ignorent : seule une protection côté serveur bloque techniquement.
Où placer le fichier ?
À la racine du domaine, accessible à l’adresse /robots.txt. Un fichier placé dans un sous-dossier n’est jamais lu.
Poursuivre
Autres outils
autoriser ou bloquer GPTBot
Générez un robots.txt qui distingue les crawlers de citation, les agents déclenchés par un utilisateur et les robots d’entraînement.
4 étapes
produire un JSON-LD de FAQ
Créez un balisage JSON-LD FAQPage valide à partir de vos questions-réponses. Génération locale, échappement correct, validation immédiate.
5 étapes
convertir un sitemap en llms.txt
Créez un fichier llms.txt conforme à la spécification llmstxt.org : H1, blockquote, sections et liens absolus, avec contrôle du poids.
5 étapes