Aller au contenu
Français English

Guide GEO

Cloudflare et les robots IA : quand le proxy bloque vos crawlers avant votre serveur

Par · Dernière mise à jour : 10 septembre 2026 · Documentation Cloudflare consultée le 8 septembre 2026

Un robots.txt qui autorise tous les robots IA ne garantit rien quand le site est derrière Cloudflare : le proxy peut renvoyer un défi ou un 403 avant que le robot n'atteigne votre serveur, et rien de cela n'apparaît dans le fichier. Cette page explique quels réglages Cloudflare arrêtent les robots des assistants, comment le constater depuis l'extérieur, et comment laisser passer ceux que vous voulez.

1. Proxy orange ou gris

Ce que le fournisseur documente. Quand un enregistrement DNS est proxied, « Cloudflare se place entre vos visiteurs et votre serveur, en optimisant, en mettant en cache et en protégeant le trafic ». Quand il est DNS only, « Cloudflare répond avec l'adresse IP réelle de votre serveur et ne fait pas transiter le trafic HTTP/HTTPS par son réseau ». Les configurations de produits, « règles WAF, cache, règles de redirection », ne s'appliquent qu'au trafic proxié (Cloudflare, statut du proxy).

Ce que nous recommandons. Commencer par là : si le nuage est gris, aucun réglage Cloudflare ne peut bloquer un robot, et le problème est ailleurs. S'il est orange, tout ce qui suit s'applique, y compris aux sous-domaines dont on a oublié l'existence. Le statut se lit dans l'onglet DNS, enregistrement par enregistrement.

2. Bot Fight Mode

Ce que le fournisseur documente. Bot Fight Mode « émet des défis coûteux en calcul qui forcent le client à effectuer des calculs intensifs » sur le trafic qui correspond à des motifs de robots connus. Il « ne peut pas être personnalisé, ajusté ou reconfiguré via des règles WAF personnalisées » sur l'offre gratuite, et « vous ne pouvez pas contourner ou ignorer Bot Fight Mode avec des règles WAF ou des Page Rules », parce qu'il s'exécute hors du moteur de règles. Pour un contrôle fin avec listes d'autorisation, Cloudflare renvoie vers Super Bot Fight Mode ou Bot Management (Cloudflare, Bot Fight Mode).

Ce que nous recommandons. Sur un site qui veut être cité par les assistants, Bot Fight Mode en offre gratuite est un interrupteur binaire : soit il est éteint, soit vous acceptez que des robots légitimes reçoivent un défi qu'ils ne peuvent pas résoudre. Nous le désactivons, et nous traitons les abus réels par des règles de limitation de débit, qui, elles, se ciblent.

3. Le réglage « robots IA »

Ce que le fournisseur documente. Le réglage historique de blocage des robots IA bloque « les bots vérifiés classés comme explorant à des fins d'entraînement, plus des bots non vérifiés au comportement similaire », et « exclut les bots à usage mixte, utilisés à la fois pour l'entraînement et pour la recherche ». Trois options : bloquer sur toutes les pages, bloquer sur les pages avec publicité, ou autoriser. Cloudflare annonce sa dépréciation « le 15 septembre 2026 » au profit de politiques distinctes par classification : recherche, agent, entraînement (Cloudflare, bloquer les robots IA).

Ce que nous recommandons. Avec les nouvelles politiques par classification, la configuration cohérente avec un robots.txt ouvert est : recherche et agent autorisés, entraînement selon votre choix éditorial, le même que dans le fichier. Un site qui refuse GPTBot dans robots.txt et l'autorise dans Cloudflare, ou l'inverse, envoie deux messages contradictoires ; le plus restrictif gagne, en silence.

4. Bots vérifiés et défis

Ce que le fournisseur documente. Un bot vérifié est « un bot ou un agent dont Cloudflare a confirmé qu'il est transparent sur qui il est et ce qu'il fait », avec deux exigences : s'identifier honnêtement, par signature cryptographique ou validation d'adresse IP, et se comporter sans abus en respectant robots.txt. Les classifications comportementales incluent recherche, agent, entraînement, collecte de données ; les bots vérifiés « ont été exclus des configurations de bots par défaut » et les clients peuvent désormais définir leurs propres politiques (Cloudflare, bots vérifiés).

Ce que nous recommandons. Vérifier dans l'annuaire des bots vérifiés que les robots qui vous importent y figurent, puis écrire vos règles sur la catégorie plutôt que sur le user-agent : la catégorie repose sur une vérification, le user-agent se copie en une ligne. Un défi, qu'il soit géré ou interactif, sert « à vérifier qu'un visiteur est un humain réel » : un robot d'assistant ne le résoudra pas, quelle que soit sa bonne foi.

Dans notre étude de septembre 2026 sur 1 000 sites de PME européennes, 91 des 936 sites atteints étaient derrière Cloudflare : 9 % d'entre eux refusaient au moins un robot IA dans robots.txt (contre 3 % des sites sans CDN détecté) et 5 sur 91 opposaient un défi à au moins une identité de robot d'assistant, alors qu'aucun site sans CDN n'en servait. Ces chiffres décrivent des zones existantes ; Cloudflare documente de nouveaux réglages par défaut pour les nouveaux domaines à partir du 15 septembre 2026, entraînement et agents bloqués sur les pages avec publicité, recherche autorisée (Cloudflare, bloquer les robots IA), ce qui déplacera ces proportions pour les zones créées ensuite.

5. La règle WAF qui laisse passer

Ce que le fournisseur documente. « Utilisez l'action Skip dans une règle personnalisée pour ignorer une ou plusieurs fonctions de sécurité » : les règles de limitation de débit, les règles gérées et les règles de Super Bot Fight Mode peuvent être ignorées, mais pas Bot Fight Mode. Les champs cf.verified_bot_category et http.user_agent sont disponibles dans l'expression (Cloudflare, action Skip).

Ce que nous recommandons. Une règle Skip, placée avant les autres, qui exempte les robots de réponse des défis et des règles gérées, sur la catégorie de bot vérifié quand elle existe, sur le user-agent en repli. Elle ne remplace pas le robots.txt, elle l'accompagne : le fichier dit ce que le robot peut lire, la règle lui permet d'arriver jusqu'au fichier.

Comment le corriger

# Règle WAF personnalisée, action : Skip (règles gérées, Super Bot Fight Mode, limitation de débit)
(cf.verified_bot_category in {"Search Engine Crawler" "AI Search" "AI Assistant"})
or (http.user_agent contains "OAI-SearchBot")
or (http.user_agent contains "ChatGPT-User")
or (http.user_agent contains "Claude-SearchBot")
or (http.user_agent contains "Claude-User")
or (http.user_agent contains "PerplexityBot")

Les libellés de catégorie se lisent dans le sélecteur de la règle au moment où vous l'écrivez ; nous n'en garantissons pas la liste, elle évolue avec les politiques par classification.

6. Vérifier si Cloudflare bloque ChatGPT, de l'extérieur

Ce que le fournisseur documente. « Les défis sont des mécanismes de sécurité utilisés par Cloudflare pour vérifier qu'un visiteur de votre site est un humain réel et non un bot ou un script automatisé » (Cloudflare, défis). La documentation décrit le mécanisme ; elle ne publie pas la liste des codes de statut ou des en-têtes qu'un client automatisé reçoit, et nous ne l'inventons pas.

Ce que nous recommandons. Faire la requête soi-même, avec le user-agent du robot, et lire trois choses : le code de statut, la taille du corps, et si ce corps est votre page ou une page Cloudflare. Un 200 avec votre HTML est le seul résultat acceptable. Un 403 ou un 503 avec un corps qui n'est pas votre page vient du proxy, pas de votre serveur. La procédure complète, robot par robot et journaux compris, est dans vérifier l'accès de ChatGPT à votre site.

Comment le vérifier

Le test GEO s'annonce avec son propre user-agent et rapporte « Notre crawler (SEOForge-GEO-Test) autorisé sur la page d'accueil » quand il a pu entrer ; mais il lit le robots.txt, pas la configuration du proxy, et sa méthodologie le dit : un blocage au niveau du CDN ou du pare-feu n'est pas visible dans robots.txt. En ligne de commande :

for ua in "OAI-SearchBot" "ChatGPT-User" "Claude-SearchBot" "PerplexityBot" "GPTBot"; do
  printf "%-18s " "$ua"
  curl -A "$ua" -s -o /tmp/body.html -w "%{http_code} %{size_download} octets\n" https://votre-site.fr/
  grep -qi "cloudflare" /tmp/body.html && echo "   corps : page Cloudflare, pas la vôtre"
done

Ce que nous avons fait sur seoforge.fr

seoforge.fr utilise Cloudflare uniquement comme hébergeur DNS : les enregistrements A et www sont en mode « DNS only », sans proxy. Les robots IA atteignent donc directement le serveur Azure, et aucun réglage Cloudflare (Bot Fight Mode, blocage des robots IA, règles WAF) ne s'applique. Ce que cette page décrit vient de nos interventions chez des clients dont le robots.txt était correct et dont le proxy renvoyait des défis. Le test GEO le rappelle dans ses limites publiées, et l'Audit GEO inclut la lecture des journaux serveur qui seule tranche.

Pour aller plus loin

Cette page détaille le paragraphe sur les CDN de la première dimension du guide du référencement IA. Le fichier robots.txt lui-même, robot par robot, est dans Crawlers IA et robots.txt. Si le proxy laisse passer et que vous restez absent des réponses, l'Audit GEO lit vos journaux et reprend les six dimensions.

Questions fréquentes

Cloudflare bloque-t-il les robots IA par défaut ? La documentation que nous avons consultée décrit un réglage de blocage des robots IA avec trois options, bloquer partout, bloquer sur les pages avec publicité, ou autoriser, et annonce son remplacement par des politiques par classification. Elle ne dit pas quelle option s'applique à votre zone : c'est dans votre tableau de bord, et une requête avec le user-agent du robot le confirme de l'extérieur.

Appeler Réserver 20 min