quest_ratio_scrape_to_referral_crawlers_ia.exe
_
×

Ratio scrape-to-referral : 6 000 aspirations IA pour 1 visite

Le ratio scrape-to-referral affiche 6 000 scrapes pour 1 visite. Calculez-le sur vos propres données, repérez ses biais et décidez quoi bloquer, bot par bot.

ratio-scrape-to-referral crawlers-ia microsoft-clarity visibilite-ia geo guide

Six mille aspirations pour une seule visite renvoyée. C’est le chiffre que Microsoft a mis en avant le 13 août 2026 en lançant sa carte AI Scrape-to-Referral Ratio dans Clarity. Il est spectaculaire, il est partageable, et il faut le dire tout de suite : ce n’est pas un benchmark publié, c’est une capture d’écran produit. Six semaines plus tôt, le 1er juillet, Cloudflare avait ouvert son Attribution Business Insights avec des ratios réels, par opérateur, allant de 118 pour 1 à près de 50 000 pour 1. Deux acteurs qui productisent la même métrique en six semaines, ça veut dire une chose : le ratio scrape-to-referral vient d’entrer dans le vocabulaire courant, et vous allez devoir en produire un pour votre site.

Le moment n’est pas un hasard. Le 15 septembre 2026 est passé il y a trois jours, et le blocage par défaut de Cloudflare est désormais effectif. La question n’est plus « faut-il se préparer », elle est « qu’est-ce que ça a changé chez moi, et comment je le mesure ». C’est la suite directe de l’article sur les crawlers à bloquer avant le 15 septembre, qui s’arrêtait à la veille de la bascule. Celui-ci porte sur la métrique et sur sa fiabilité, pas sur la mécanique du blocage. Et il tombe pendant que 84 % du marché est encore devant la question : l’IAB notait le 4 août 2026 que seulement 16 % des marques suivent leur visibilité IA.

Ce que le ratio scrape-to-referral mesure, exactement

Le ratio scrape-to-referral rapporte deux nombres qui ne viennent pas du même endroit. Au numérateur, les requêtes de crawl : combien de fois un bot IA est venu lire vos pages. On les trouve dans les logs de votre CDN ou de votre serveur. Au dénominateur, les sessions référentes : combien de visiteurs humains sont arrivés chez vous depuis une réponse IA. On les compte avec un tag JavaScript, celui d’analytics.

Deux couches de collecte différentes, donc, et c’est toute la difficulté. Les crawls sont lus côté serveur, au moment de la requête HTTP. Les referrals sont lus côté navigateur, au chargement de la page. Rien ne garantit que les deux mesures couvrent le même périmètre de domaines, ni la même fenêtre de temps. C’est exactement pour ça que Clarity impose ses « mapped domains » : tant que le domaine surveillé côté logs et le domaine mesuré côté tag ne sont pas alignés, le ratio est de l’arithmétique sans signification. Un grand nombre divisé par un autre grand nombre ne devient pas un indicateur juste parce qu’on lui a donné un nom.

Retenez cette phrase pour la suite : un ratio n’a de sens que si son numérateur et son dénominateur parlent du même site, sur la même période. Presque personne ne vérifie ce point, et c’est là que les surprises commencent.

Obtenir le chiffre : trois chemins

Il y a trois façons de sortir ce ratio pour votre site, avec des prérequis très différents. Voici comment elles se comparent.

CheminCoûtPrérequisGranularitéLimite
Microsoft ClarityGratuit, sans limite de traficUn CDN connecté (Fastly, Amazon CloudFront, Cloudflare) ou WordPress avec le plugin à jourPar opérateur, avec accès aux enregistrements de sessionInutilisable sans l’un de ces CDN
Cloudflare Attribution Business InsightsOffres hautes (Bot Management, Enterprise)Site derrière CloudflarePar opérateur, fenêtres 24 h, 7 j, 30 jReferrals suivis via UTM
Logs plus BigQuery (maison)Coût BigQueryAccès aux logs serveur ou CDNTotale, à votre définitionÀ construire vous-même

Clarity est gratuit et sans limite de trafic, ce qui le rend très tentant. Le point bloquant n’est pas le prix, c’est le CDN : sans Fastly, CloudFront, Cloudflare ou un WordPress avec le plugin à jour, la carte reste vide. Un mot de vigilance au passage, côté RGPD : Clarity envoie des données de navigation de vos visiteurs à Microsoft. Le produit est gratuit parce que la contrepartie est ailleurs. Le recommander sans le dire serait le genre de raccourci que ce blog ne fait pas.

Cloudflare donne un chiffre plus propre côté crawls, puisqu’il lit le trafic au niveau du réseau, mais Attribution Business Insights est réservé aux offres hautes et suit les referrals via UTM, donc rate tout ce qui n’est pas balisé.

Reste la méthode maison, logs plus BigQuery, la seule où vous contrôlez la définition du numérateur et du dénominateur. La collecte des logs et leur chargement dans BigQuery sont déjà décrits en détail dans l’article précédent : inutile de les réécrire. Ce qui manquait, c’est la requête de jointure qui produit le ratio, opérateur par opérateur.

-- Ratio scrape-to-referral par opérateur, sur 30 jours
WITH crawls AS (
  SELECT operator, COUNT(*) AS n_crawls
  FROM `projet.logs.crawl_events`
  WHERE event_date >= DATE_SUB(CURRENT_DATE(), INTERVAL 30 DAY)
  GROUP BY operator
),
referrals AS (
  SELECT operator, COUNT(DISTINCT session_id) AS n_referrals
  FROM `projet.analytics.ai_sessions`
  WHERE event_date >= DATE_SUB(CURRENT_DATE(), INTERVAL 30 DAY)
  GROUP BY operator
)
SELECT
  c.operator,
  c.n_crawls,
  COALESCE(r.n_referrals, 0) AS n_referrals,
  SAFE_DIVIDE(c.n_crawls, r.n_referrals) AS scrape_to_referral
FROM crawls c
LEFT JOIN referrals r USING (operator)
ORDER BY scrape_to_referral DESC;

La jointure se fait sur l’opérateur, pas sur « les IA » en bloc. C’est la seule granularité qui permet une décision, et c’est aussi la seule qui rende le ratio comparable à ceux de Cloudflare ou de Clarity.

Pourquoi votre ratio est faux (et dans quel sens)

Voici le passage que ni Microsoft ni Cloudflare n’écrivent, parce qu’ils vendent l’un le blocage, l’autre son écosystème. Le ratio est faux par construction, des deux côtés de la fraction. La bonne nouvelle, c’est qu’il est faux dans un sens prévisible.

Un dénominateur sous-compté

Les referrals IA sont systématiquement sous-comptés, ce qui fait paraître le ratio pire qu’il n’est. Les causes sont connues et datées. Google a confirmé le 23 mai 2025 que les attributs noreferrer d’AI Mode faisaient basculer des clics en trafic Direct. OpenAI n’a ajouté des UTM à ses liens qu’en juin 2025. L’app Gemini sur iOS utilisait encore un user-agent non documenté en octobre 2025. Côté GA4, le canal AI Assistant n’est arrivé que le 13 mai 2026, et le champ Source Group en juin 2026. Résultat : une part importante des visites venues d’une IA atterrit ailleurs que dans la case « IA », et le canal natif de GA4 en rate entre 35 et 70 % selon les configurations. Si ce point vous concerne, il est traité en profondeur dans le guide pour tracker le trafic ChatGPT, Gemini et Claude dans GA4.

Tant que le dénominateur fuit, le déséquilibre est mécaniquement exagéré. Votre 6 000 pour 1 est peut-être un 2 000 pour 1 une fois le comptage réparé.

Un numérateur mal attribué

De l’autre côté, le numérateur a ses propres défauts. Un tag JavaScript ne voit jamais les bots qui n’exécutent pas de JavaScript, donc si vous tentez de compter les crawls côté tag, vous en manquez la majorité. Et si vous les comptez côté logs, l’erreur inverse guette : additionner tous les crawls sans distinguer les familles revient à mélanger des choses qui n’ont pas la même contrepartie. Un crawler d’entraînement, un agent qui répond en direct et un bot de recherche ne vous doivent pas le même referral. Cette distinction en trois familles est détaillée dans l’article sur le blocage ; la reprendre ici serait la refaire.

La conclusion opérationnelle est simple, et c’est la plus importante de l’article : le ratio est un indicateur de rang entre opérateurs, pas une valeur absolue. Le classement est fiable, l’ampleur ne l’est pas. Si Clarity vous dit qu’un opérateur aspire dix fois plus qu’un autre pour un même nombre de visites, croyez le classement. Ne croyez pas le « 6 000 » au chiffre près.

Ce que le ratio ne dit pas : la qualité

Un ratio élevé se lit comme un mauvais bulletin. Il ignore pourtant ce qui compte le plus : ce que font les rares visiteurs qui arrivent. L’étude Clarity du 18 décembre 2025, menée sur plus de 1 200 sites éditeurs, donne un contraste net : 1,66 % de conversion en inscription pour le trafic IA, contre 0,15 % pour la recherche classique, avec une croissance de 155 % sur huit mois pour moins de 1 % des visiteurs. Peu de monde, mais du monde qui agit.

Attention quand même à ne pas transformer ce chiffre en nouveau benchmark. La variance entre secteurs est énorme, de « sous la parité » à « plusieurs fois la recherche » selon les sources. Aucune moyenne sectorielle n’est utilisable telle quelle. C’est justement l’intérêt des enregistrements de session filtrés par source IA : ils remplacent une moyenne empruntée par une observation de vos propres visiteurs. Le ratio se lit donc en trois temps, dans cet ordre : le volume d’abord (combien de referrals réels), le ratio ensuite (le rang de l’opérateur), le comportement post-clic enfin (est-ce que ces gens convertissent). C’est cette lecture, et pas le ratio seul, qui fait du chiffre la métrique manquante à côté des quatre déjà décrites dans le guide pour mesurer la visibilité de votre marque dans les réponses IA.

La grille de décision

Le ratio ne décide pas à votre place, il trie. Voici comment j’arbitre, opérateur par opérateur, une fois le chiffre en main.

Situation de l’opérateurDécision
Ratio bas et conversion correcteLaisser passer, il vous rend ce qu’il prend
Ratio élevé mais referrals réelsArbitrer le coût serveur contre la visibilité
Ratio élevé, zéro referral, famille entraînement purCandidat au blocage
Crawler mixte (Googlebot et assimilés)Ne pas toucher

Le dernier cas est le piège le plus coûteux. Un bot mixte crawle à la fois pour la recherche et pour l’entraînement : le bloquer sur la base d’un mauvais ratio vous sort de Google. La mécanique exacte pour distinguer et bloquer sans dégâts est dans l’article précédent.

Et gardez un garde-fou en tête avant de bloquer quoi que ce soit : une étude de la Rutgers Business School et de Wharton a montré que les éditeurs qui coupaient les crawlers IA via robots.txt ont perdu 23,1 % de leurs visites mensuelles, sans protection proportionnelle en échange. Le ratio dit qui aspire beaucoup ; il ne dit pas ce que coûte le blocage. Ce sont deux questions distinctes.

Ce qu’on en fait

Le ratio scrape-to-referral est un outil de négociation et de priorisation, pas un verdict. Dans un audit, il sert à trois choses : classer les opérateurs pour savoir par lesquels commencer, repérer ceux qui prennent sans rendre, et donner un chiffre concret quand on discute d’un accord de rémunération au contenu. Rien de plus, et c’est déjà beaucoup.

Ce qu’il faut retenir : calculez-le sur vos données plutôt que de recopier le benchmark d’un vendeur, réparez d’abord le dénominateur, lisez le classement et pas le niveau, puis croisez-le toujours avec le comportement post-clic avant de couper quoi que ce soit. Et si vous vendez en ligne, souvenez-vous que le referral n’est plus la seule contrepartie possible d’un crawl : une partie de la valeur passe désormais par le commerce agentique, qui se tracke à part dans GA4. Le chiffre spectaculaire fait un bon titre. La décision, elle, se prend opérateur par opérateur.