Le 15 septembre, les robots d'exploration polyvalents utilisés par Google, Microsoft et Apple seront bloqués par défaut selon les nouvelles règles de Cloudflare.

Le fournisseur de services informatiques et réseau Cloudflare a annoncé de nouvelles règles conçues pour donner aux propriétaires de sites Web plus de contrôle sur les types de robots d'exploration Web qui seront autorisés ou bloqués sur leurs sites – ainsi que des plans pour bloquer par défaut les robots d'exploration polyvalents sur les pages financées par la publicité.

Traditionnellement, les moteurs de recherche et les sites Web entretenaient une sorte de « relation symbiotique », comme le dit Cloudflare, dans laquelle les propriétaires de sites Web autorisaient les moteurs de recherche à explorer leurs sites et, en retour, les moteurs de recherche renvoyaient les utilisateurs vers leurs pages.

La société a expliqué que ce processus d'exploration jusqu'au référencement, une fois équilibré, aiderait les sites à générer les pages vues nécessaires pour maintenir la publicité, les revenus d'affiliation et les abonnements.

Cependant, la montée en puissance des robots d'exploration et des agents IA a changé la donne, car les chatbots IA fouillent les sites pour synthétiser les réponses et contourner les sources originales, ce qui conduit souvent à des ratios d'exploration/référence déséquilibrés. Les propres recherches de Cloudflare de l'année dernière ont noté des ratios allant de 118 : 1 à près de 50 000 : 1, ce qui signifie qu'un robot d'exploration IA aurait pu gratter un site des dizaines de milliers de fois et ne renvoyer qu'un seul utilisateur.

De nos jours, bon nombre de ces robots d’exploration sont utilisés à des fins multiples – notamment la formation à l’IA et l’indexation de recherche – ce qui place les propriétaires de sites Web dans une position difficile, car la désactivation de toute automatisation et de l’accès des robots à leurs sites pourrait diminuer leurs chances d’apparaître dans les résultats de recherche.

Cloudflare espère résoudre ce problème avec ses nouvelles règles, qui incluent des options de gestion de l'accès des robots en établissant trois catégories d'objectifs pour les robots : recherche, agent et formation.

« Recherche » fait référence aux robots d'exploration utilisés pour l'indexation de la recherche, « Agent » fait référence aux comportements automatisés utilisés par des chatbots et des agents utilisant le navigateur, et « Formation » fait référence aux robots d'exploration qui récupèrent le contenu pour affiner les modèles d'IA.

Avec ces trois classifications, les propriétaires de sites Web pourront autoriser ou bloquer de manière sélective les robots d'exploration utilisés pour chacune des trois classifications. Cela signifie que si un propriétaire de site Web souhaite autoriser les robots d'exploration de recherche mais bloquer les robots d'exploration d'agent et de formation, il pourra désormais le faire.

Dans le cadre de ces nouvelles règles, Cloudflare bloquera également par défaut les robots d'exploration de formation et d'agent sur les pages qui affichent des publicités.

Les paramètres de blocage par défaut, qui s'appliqueront à tout nouveau domaine intégré à Cloudflare à partir du 15 septembre, ne s'appliqueront pas aux robots d'exploration utilisés pour l'indexation des recherches, tandis que les robots d'exploration polyvalents – en particulier ceux utilisés à la fois à des fins de recherche et de formation – seront autorisés ou bloqués « en fonction de tous leurs comportements ».

En conséquence, les robots d'exploration polyvalents utilisés par Google, Microsoft et Apple seront bloqués par défaut le 15 septembre.

« Nous pensons qu'il devrait être simple pour tous les propriétaires de sites Web de gérer l'accès à ces trois cas d'utilisation centrés sur l'IA », lit-on dans un article de blog de Cloudflare. « Nous pensons que les opérateurs de robots devraient séparer leurs robots d'exploration, car cela crée plus de transparence pour les propriétaires de sites Web, leur permettant de mieux comprendre pourquoi un robot d'exploration donné les visite ainsi que de mieux gérer l'accès qu'ils étendent à ce robot.

« Si une entreprise exécute une automatisation qui crée des index de recherche, agit en tant qu'agent et collecte des données pour former ses modèles, nous encourageons fortement cette entreprise à diviser l'automatisation en trois robots d'exploration distincts. »

À l'approche de la date limite par défaut de septembre, les clients Cloudflare peuvent désactiver les paramètres par défaut s'ils le souhaitent.

Les nouvelles règles de Cloudflare sont les dernières tentatives de l'entreprise pour lutter contre l'utilisation abusive des robots d'exploration.

À la même époque l'année dernière, la société a introduit de nouveaux contrôles d'exploration pour les propriétaires de sites Web, notamment un système de « paiement par exploration » conçu pour s'intégrer à l'infrastructure Web existante et exploiter les codes de statut HTTP et les mécanismes d'authentification établis pour créer un cadre pour l'accès au contenu payant.

L’année précédente, Cloudflare avait introduit un outil permettant aux propriétaires de sites Web de bloquer tous les robots en même temps.

A lire également