OUTIL GRATUIT · DISTINCTION ENTRAÎNEMENT / CITATION

Vos règles robots.txt face aux robots d'IA

Onze robots vérifiés, et la seule distinction qui compte : ceux qui collectent du corpus d'entraînement, et ceux qui vont chercher votre page au moment de répondre à un utilisateur.


Vos règles robots.txt face aux robots d'IA

Vous le trouverez à l'adresse votredomaine.com/robots.txt. Copiez-collez son contenu entier.

Diagnostic


Entraînement et citation ne sont pas la même chose

C'est la confusion la plus coûteuse du moment. GPTBot collecte du corpus pour entraîner de futurs modèles. OAI-SearchBot et ChatGPT-User, eux, vont chercher votre page en direct, pendant que l'assistant rédige sa réponse à un utilisateur.

Beaucoup d'entreprises ont bloqué « les robots d'IA » en bloc, souvent sur le conseil d'une agence, puis se sont étonnées de ne jamais apparaître dans les réponses. Elles avaient bloqué les deux familles. Bloquer l'entraînement est un choix défendable ; bloquer la citation revient à se retirer volontairement du canal de recherche qui croît le plus vite.

Ce que l'outil vérifie exactement

Il applique les règles telles qu'un robot les applique : recherche du groupe User-agent correspondant au nom exact, repli sur * si aucun groupe ne le nomme, puis application de la règle au chemin le plus long — avec priorité à Allow en cas d'égalité.

Le verdict indique aussi d'où vient la règle : explicite, héritée du joker, ou absente. C'est souvent là qu'est la surprise — un site croit autoriser un robot alors qu'il hérite d'un Disallow: / posé des années plus tôt.

Un robots.txt n'est pas un dispositif de sécurité

Il exprime une demande, que les acteurs sérieux respectent et que les autres ignorent. Il ne protège rien : une page listée en Disallow reste accessible à quiconque connaît son adresse.

Un pare-feu ou un réglage de CDN peut aussi bloquer un robot sans que rien n'apparaisse dans votre robots.txt. Si le diagnostic ici est bon mais que vous n'êtes toujours pas cité, c'est la piste suivante à explorer.


Questions courantes

Faut-il autoriser les robots d'entraînement ?

C'est un arbitrage, pas une règle. Les bloquer protège votre contenu d'un usage que vous ne contrôlez pas ; les autoriser augmente la probabilité que votre marque soit connue des modèles. Aucune des deux réponses n'est fausse — l'erreur est de ne pas décider.

Et les robots de citation ?

Les bloquer n'a presque jamais de sens si vous vendez quelque chose. Ils ne conservent pas votre contenu : ils le lisent au moment de répondre, exactement comme un moteur de recherche classique, et vous créditent dans la réponse.

Pourquoi mon robot n'est-il pas dans la liste ?

La liste couvre les onze agents les plus fréquents. D'autres existent et apparaissent régulièrement. Si un robot ne figure pas ici, il suit la règle de votre ligne User-agent: *.

Mon fichier est-il envoyé quelque part ?

Non. L'analyse se fait entièrement dans votre navigateur, sans requête réseau.


L'accès n'est que le premier des six leviers.

Autoriser les robots ne suffit pas : encore faut-il que votre contenu existe dans le HTML servi, que vos passages soient délimités et votre balisage juste. C'est l'objet de Visibilité IA.