Comment Airfleet a développé sa surveillance de visibilité IA avec Bright Data

Comment Airfleet gère sa surveillance GEO et de visibilité IA sur Bright Data : des milliers de prompts par jour sur ChatGPT, Claude, Gemini et Perplexity, sans surveiller des Scrapers.
9 min de lecture
How Airfleet Scaled AI Visibility Monitoring With Bright Data

L’infrastructure derrière notre pratique GEO. Des milliers de prompts par jour, sur tous les grands LLM, sans surveiller un seul Scraper.

TL;DR

  • Airfleet a développé sa propre surveillance de visibilité IA pour observer comment les marques apparaissent sur ChatGPT, Claude, Gemini et Perplexity
  • Les outils standard ne pouvaient pas atteindre l’échelle ou le niveau de détail souhaités, et nos propres Scrapers basés sur navigateur tombaient en panne face aux captchas, changements de modèles et modifications d’interface.
  • Nous faisons désormais tourner toute l’opération sur Bright Data. Des milliers de prompts par jour, une API cohérente sur tous les LLM, qui résiste même quand les plateformes IA modifient leurs interfaces.
  • L’adéquation était technique et humaine. Le produit a évolué rapidement, et l’intérêt sincère d’un marketeur de Bright Data pour notre cas d’usage a transformé notre curiosité en véritable partenariat.
  • C’est devenu une infrastructure centrale pour nos recherches SERP, notre pipeline de contenu et nos workflows d’agents, dont une étude en cybersécurité ayant généré près d’un million de prompts.

Nous utilisons Bright Data pour notre travail de visibilité IA parce que ça fonctionne

Airfleet est une agence B2B spécialisée dans le développement, le design et les services web. Nous construisons et optimisons des sites web qui génèrent du pipeline pour des entreprises technologiques B2B, et une part croissante de ce travail consiste à comprendre comment nos clients apparaissent dans les réponses IA et les outils LLM, pas seulement dans les moteurs de recherche.

Pour y parvenir efficacement, nous gérons notre propre surveillance de visibilité IA sur les principaux LLM, notamment ChatGPT, Claude, Gemini et Perplexity. Nous observons comment les marques sont citées, quelles sources influencent ces réponses, et ce qui change réellement un résultat. Le moteur de tout cela, c’est Bright Data.

Nous expliquerons comment nous en sommes venus à développer notre propre outil. Mais l’essentiel est que Bright Data nous a aidés à monter en échelle et à minimiser les lacunes de données que nous rencontrions avec d’autres outils de surveillance GEO du marché. Nous y faisons passer des milliers de prompts par jour, sans passer notre temps à maintenir l’outil en état de marche.

“Nous ne sommes pas une entreprise de produits. Nous développons des produits pour l’agence afin de fournir des services. Nous n’avons pas le temps de bricoler ou de comprendre pourquoi quelque chose ne fonctionne pas. Nous avons besoin de quelque chose qui fonctionne simplement.” – Elad Hefetz, PDG d’Airfleet

Ce que nous voulions construire, et où ça a d’abord échoué

Nous avons commencé avec un objectif simple. Nous voulions voir comment les marques apparaissent dans les réponses IA à l’échelle d’une catégorie entière, pas une liste de trente ou cent prompts suivis.

Nous avons d’abord examiné les outils de visibilité IA existants. La plupart étaient solides. Le problème était leur plafond. Pour comprendre tout un secteur, il faut des milliers de prompts couvrant de nombreuses entreprises, sous-thèmes et régions, et les outils standard ne pouvaient pas atteindre cette largeur ou facturaient par prompt pour y parvenir. Nous avons donc décidé de développer le nôtre.

C’est là que nous avons rencontré le vrai problème. Quand nous avons commencé à récupérer les réponses via les API officielles, celles-ci ne correspondaient pas à ce qu’un vrai utilisateur voit.

“Nous avons rapidement réalisé qu’interroger ChatGPT via une API donne une réponse très différente de celle obtenue sur le web. Il y a une couche au-dessus du modèle qui modifie la façon dont il répond. Pareil pour Gemini, Claude et les autres.” – Elad Hefetz, PDG d’Airfleet

Si la réponse de l’API n’est pas celle que voit votre acheteur, c’est la mauvaise donnée. Nous avons donc fait la chose évidente et avons commencé à piloter de vrais navigateurs, en agissant comme un humain pour capturer la vraie réponse. Et c’est là que ça a planté.

Captchas. Points de rupture. Nouvelles versions de modèles. Changements d’interface. N’importe lequel pouvait faire tomber un Scraper, et maintenir une flotte d’automatisations de navigateur en vie sur tous les LLM est devenu un travail à plein temps que nous ne voulions pas. Nous avons d’abord essayé une alternative moins coûteuse pour supporter cette charge. Elle n’a pas tenu comme nous en avions besoin.

Pourquoi nous avons choisi Bright Data

Deux choses importaient dans le choix, et c’étaient les deux mêmes qui nous avaient posé problème : l’échelle et la stabilité.

Bright Data a résolu les deux rapidement. L’implémentation était simple, et l’API était cohérente sur tous les LLM, donc un seul modèle d’appel couvrait ChatGPT, Claude, Gemini et Perplexity au lieu d’une intégration séparée pour chacun. Une fois que ça fonctionnait, ça continuait à fonctionner.

“Même quand ChatGPT change son interface, ça continue de fonctionner. Nous n’avons pas à construire des mécanismes de secours pour quand un Scraper tombe en panne. Nous l’utilisons simplement.” – Elad Hefetz, PDG d’Airfleet

Il y avait un avantage que nous n’avions pas prévu. En plus des réponses, nous avons commencé à obtenir des métadonnées que nous pensions impossibles à extraire d’une session de navigateur.

“Nous obtenons les requêtes de recherche finales et les sources que ChatGPT a utilisées pour construire sa réponse. C’est l’information contre laquelle nous optimisons réellement.” – Elad Hefetz, PDG d’Airfleet

L’adéquation n’était pas seulement technique. Elad est arrivé via le niveau gratuit pour tester si l’approche fonctionnerait, curieux plus qu’engagé, comme la plupart des évaluations initiales commencent. Puis un marketeur de Bright Data l’a contacté. Il avait remarqué qu’Elad avait commencé puis s’était arrêté, lui a envoyé des crédits pour réessayer, lui a expliqué comment d’autres entreprises utilisaient le produit, et lui a demandé, sincèrement, ce qu’il essayait de faire.

“Il a montré un vrai intérêt pour ce que nous construisions, et ça a complètement changé ma vision de Bright Data en tant qu’entreprise.” – Elad Hefetz, PDG d’Airfleet

C’est cette conversation qui a véritablement lancé le partenariat, construit autour de notre cas d’usage plutôt que d’un contrat.

Bright Data est devenu une infrastructure centrale, pas seulement un Scraper

Nous avons intégré Bright Data pour automatiser une seule chose : le prompting basé sur navigateur pour ChatGPT. Il n’est pas resté dans ce couloir.

Une fois que nous avions une couche navigateur fiable pour l’IA, nous avons commencé à l’utiliser partout où cette couche manquait. Nous l’utilisons pour lire les pages de résultats de recherche Google dans notre travail SEO. Nous l’utilisons comme navigateur derrière nos agents IA, afin que les agents puissent accéder au web ouvert sans être bloqués.

“Les gens supposent que toute IA est connectée à internet. Ce n’est pas le cas. Si vous voulez qu’un agent fasse de vraies recherches sur le web, vous devez lui construire une couche navigateur. C’est difficile à construire, et Bright Data la fournit simplement.” – Elad Hefetz, PDG d’Airfleet

Cette couche alimente désormais directement notre pipeline de contenu. Quand le pipeline recherche un sujet, vérifie ce qui est bien classé, surveille les subreddits pour ce dont parle réellement une catégorie, récupère des signaux de l’activité LinkedIn publique, ou scrape le site d’un concurrent pour voir ce qui a changé, Bright Data effectue la récupération en dessous. Si notre IA essayait d’accéder à ces sources seule, elle serait bloquée. Bright Data s’intercale entre l’IA et internet et rouvre le web pour elle.

Une étude en cybersécurité que nous n’aurions pas pu mener autrement

L’exemple le plus clair est un projet de recherche dans la catégorie cybersécurité. Nous voulions comprendre ce qui influence réellement les réponses IA tout au long du funnel, des questions larges en haut du funnel jusqu’aux prompts en phase d’achat en bas. Cela nécessite un volume qu’aucun outil standard ne pouvait nous fournir.

Nous avons utilisé Bright Data pour exécuter la surveillance au volume requis par l’étude : plus de 371 000 réponses IA, couvrant 21 entreprises de cybersécurité et plus de 5 000 sources tierces, répétées dans le temps et sur ChatGPT, Gemini et Perplexity. Nous avons ensuite analysé ce que l’IA citait à chaque étape. Quelques conclusions se sont distinguées :

  • Les plateformes d’avis sont le principal levier. G2, Peerspot, Capterra, Software Advice et TrustRadius ont montré la plus forte augmentation des mentions de marque aux stades de considération et de décision, souvent de dizaines de points de pourcentage au-dessus de la référence de l’étape. Quand l’IA cite l’une d’elles, elle nomme généralement une marque spécifique en parallèle.
  • Reddit est la source la plus citée à chaque étape du funnel. L’IA s’appuie sur les discussions d’utilisateurs réels plus que sur presque tout autre chose pour décider quelles marques mettre en avant.
  • Wikipedia mérite ses citations pour les définitions, pas les recommandations. Il apparaît pour les requêtes éducatives, mais son influence sur les mentions de marque devient négative à mesure que les prompts deviennent plus commerciaux.
  • Le haut du funnel est un terrain peu fertile. Avec un taux de mention de base de 7,9 %, les prompts de notoriété large font rarement apparaître une marque spécifique, ce qui en fait le mauvais endroit pour mesurer si vous gagnez.

Aucune de ces conclusions ne vient d’une observation superficielle de quelques prompts. Elles viennent de l’exécution de la catégorie à grande échelle, ce qui est exactement ce que Bright Data a rendu possible.

Ce que nous prévoyons de faire avec Bright Data ensuite

La surveillance de visibilité IA fait désormais partie intégrante de notre façon de travailler, pas une étude ponctuelle, et Bright Data est la couche sur laquelle nous construisons le reste. À mesure que le Trafic sur le web se déplace des humains vers les agents et les crawlers, la capacité à voir le web comme ces systèmes le voient, et à leur volume, ne fait que gagner en importance dans ce que nous faisons. Nous prévoyons de continuer à élargir ce que nous surveillons et automatisons par-dessus.