AI

Accès aux données web de qualité entreprise dans DeerFlow avec Bright Data

Intégrez Bright Data dans DeerFlow pour un accès web entreprise, permettant aux agents IA de rechercher et récupérer des données web à grande échelle de manière fiable.
16 min de lecture
DeerFlow with Bright Data

Dans cet article, vous apprendrez :

  • Ce qu’est DeerFlow et ce qu’il offre comme harnais pour les tâches à long horizon.
  • Pourquoi Bright Data est une excellente option pour les capacités de recherche et de récupération web.
  • Comment intégrer Bright Data dans DeerFlow via le MCP Bright Data.

Plongeons-y !

Qu’est-ce que DeerFlow ?

DeerFlow

DeerFlow est un harnais d’agent IA open-source développé par ByteDance. Il orchestre des sous-agents, la mémoire, les compétences, les outils et les bacs à sable pour vous aider à gérer des tâches complexes avec l’IA.

Vous pouvez interagir avec DeerFlow directement via son application web ou via des plateformes de messagerie telles que Telegram et WeChat grâce à sa passerelle de messagerie.

DeerFlow se spécialise dans les charges de travail à long horizon. Il prend en charge des cas d’usage tels que la recherche approfondie, le codage, les pipelines de données, la génération de rapports et la création de contenu. Le projet est entièrement open-source et compte plus de 79 000 étoiles sur GitHub.

Fonctionnalités principales

Les capacités principales prises en charge par DeerFlow sont :

  • Compétences et outils : Capacités extensibles pour la recherche, les rapports, les diapositives, les pages web, la génération d’images et plus encore.
  • Sous-agents : Génère des agents spécialisés avec des contextes isolés, des outils et des conditions de terminaison pour les tâches complexes.
  • Exécution en bac à sable : Donne aux agents des environnements isolés pour lire, écrire, modifier et exécuter des fichiers et des commandes.
  • Navigateur agentique : Permet aux agents de naviguer sur des sites web, de cliquer, de taper, de soumettre des formulaires et d’interagir avec des pages dynamiques.
  • Accès web : Fournit des outils de recherche web, de récupération et de capture de pages rendues.
  • Mémoire à long terme : Stocke les préférences des utilisateurs, les profils et les connaissances accumulées entre les sessions.
  • Ingénierie de contexte : Résume le travail accompli et décharge les résultats intermédiaires pour maintenir le contexte efficacement.
  • Support MCP : Connecte des serveurs MCP externes pour étendre les outils et les capacités de l’agent.
  • Tâches planifiées : Exécute automatiquement des tâches récurrentes ou ponctuelles à l’aide de planifications basées sur cron.
  • Canaux de messagerie : Permet aux utilisateurs d’interagir avec les agents via Telegram, Slack, Discord, Feishu, DingTalk, WeChat et plus encore.
  • Observabilité : S’intègre avec LangSmith, Langfuse et Monocle pour tracer les exécutions d’agents, les outils et les appels LLM.
  • Client intégré : Fournit un client Python pour intégrer DeerFlow directement dans les applications.

En savoir plus dans la documentation officielle.

Bright Data comme moteur de recherche et de récupération web pour DeerFlow

Parmi les nombreuses fonctionnalités de DeerFlow, vous trouverez des outils intégrés de recherche et de récupération web. Ces outils permettent à l’agent IA interne de rechercher de nouvelles sources en ligne et d’accéder à leur contenu pour l’ancrage web.

C’est essentiel pour surmonter la limite de connaissance des LLM. Cela permet également à l’agent IA d’effectuer des tâches en utilisant des données web récentes pour des réponses plus précises. Pour fournir les outils de recherche et de récupération web, DeerFlow s’intègre avec certaines solutions d’API SERP et de recherche web telles que Firecrawl, Brave et DuckDuckGo.

Cependant, ces fournisseurs peuvent ne pas toujours être prêts pour une utilisation en entreprise. Ils peuvent manquer de support pour les recherches multilingues, plusieurs moteurs de recherche, ou un accès fiable aux sites web sans être bloqués. Certains peuvent également manquer de solveurs de CAPTCHA et d’un grand réseau de Proxy IP.

C’est exactement là que Bright Data peut aider !

Bright Data se distingue des fournisseurs web intégrés de DeerFlow grâce à son infrastructure mondiale, qui comprend plus de 400 millions d’IPs résidentielles. Cette architecture offre l’évolutivité, les capacités anti-bot et les performances nécessaires pour les flux de travail de données web réels. Elle prend en charge une concurrence illimitée, offre une disponibilité de 99,99 % et atteint un taux de succès de 99,95 %.

Le MCP Bright Data comme solution

La façon la plus simple de connecter DeerFlow aux outils web de Bright Data est via le MCP Bright Data.

Le MCP Bright Data fournit plus de 70 outils, chacun alimenté par les produits basés sur l’API de Bright Data. Même en mode Rapide (niveau gratuit avec 5 000 requêtes par mois), vous obtenez des outils utiles pour la recherche web, le scraping et la découverte de sources :

Outil Description
search_engine + version spéciale pour les requêtes parallèles (search_engine) Récupère les résultats des moteurs de recherche tels que Google, Bing, Yandex et plus encore.
scrape_as_markdown + version spéciale pour les requêtes parallèles (scrape_batch) Convertit les pages web en Markdown propre tout en gérant la protection anti-bot.
discover Effectue des recherches alimentées par l’IA et retourne des résultats web classés et pertinents.

Pour accéder à tous les 70+ outils, vous devez activer le mode Pro. Cela débloque des outils d’extraction de données structurées pour des plateformes telles qu’Amazon, LinkedIn, Instagram, YouTube, Zillow et Google Maps, ainsi que plus de 40 autres sites web. Il comprend également des outils d’automatisation de navigateur alimentés par l’API Browser de Bright Data.

Comment intégrer le MCP Bright Data dans DeerFlow

Dans cette section étape par étape, vous apprendrez comment configurer le MCP Bright Data dans DeerFlow.

L’intégration de Bright Data donne aux agents IA de DeerFlow la capacité de rechercher sur le web, de découvrir de nouvelles sources, de scraper des pages web et d’interagir avec le contenu web sans se soucier des blocages anti-bot.

Suivez les étapes ci-dessous !

Prérequis

Pour suivre cette section du tutoriel, assurez-vous d’avoir :

Bien que ce ne soit pas strictement requis, il est également recommandé d’avoir :

Étape n°1 : Installer DeerFlow

Créez un dossier pour votre installation DeerFlow, lancez une session d’agent de codage local à l’intérieur et exécutez l’invite suivante :

Help me clone DeerFlow if needed, then bootstrap it for local development by following https://raw.githubusercontent.com/bytedance/deer-flow/main/Install.md

C’est la façon la plus simple d’installer DeerFlow.

L’agent IA de codage téléchargera le fichier Markdown contenant les instructions d’installation du dépôt DeerFlow. Ensuite, il les suivra pour installer et configurer DeerFlow localement.

Si vous manquez de prérequis, l’agent fournira les commandes nécessaires pour les installer. Exécutez ces commandes dans une autre fenêtre de terminal, puis continuez la conversation avec votre agent IA.

À la fin du processus, vous devriez voir une sortie similaire à celle-ci :

La sortie produite par l'agent IA après l'installation de DeerFlow

Votre dossier d’installation devrait maintenant contenir un projet DeerFlow avec une structure similaire à :

<your_deerflow_installation_folder>
├── backend/
├── contracts/
├── deploy/
├── docker/
├── docs/
├── frontend/
├── logs/
├── plans/
├── pr-build/
├── scripts/
├── skills/
├── temp/
├── tests/
├── AGENTS.md
├── CHANGELOG.md
├── CHANGELOG_zh.md
├── CLAUDE.md
├── CODE_OF_CONDUCT.md
├── CONTRIBUTING.md
├── Install.md
├── LICENSE
├── Makefile
├── README.md
├── README_fr.md
├── README_ja.md
├── README_ru.md
├── README_zh.md
├── RELEASING.md
├── SECURITY.md
├── config.example.yaml
├── deer-flow.code-workspace
└── extensions_config.example.json

Deux fichiers particulièrement importants sont :

  • extensions_config.example.json : Un exemple de fichier JSON pour configurer les extensions DeerFlow via des serveurs MCP ou des compétences.
  • config.example.yaml : Un exemple de fichier de configuration pour configurer les intégrations LLM, les répertoires de compétences et de nombreuses autres options qui vous permettent de personnaliser le comportement de l’agent IA de DeerFlow.

Bien joué ! DeerFlow est maintenant installé localement.

Étape n°2 : Configurer DeerFlow

Maintenant, dans le dossier d’installation de DeerFlow, exécutez la commande suivante pour configurer le harnais :

make setup
Démarrage de la configuration DeerFlow

Cela lance un assistant de configuration CLI interactif, qui vous guide à travers plusieurs étapes de configuration. La première consiste à choisir un fournisseur LLM.

Remarque : DeerFlow recommande fortement d’utiliser Doubao-Seed-2.0-Code, DeepSeek V3.2 et Kimi 2.5.

Ici, cependant, vous verrez comment intégrer DeerFlow avec OpenAI. Commencez par sélectionner “OpenAI” comme fournisseur LLM cible :

Sélectionner un fournisseur OpenAI

Continuez en choisissant un modèle (par ex. gpt-5-mini). Ensuite, entrez votre clé API OpenAI. DeerFlow utilisera alors le modèle OpenAI sélectionné pour alimenter son agent IA.

Ensuite, on vous demandera si vous souhaitez configurer optionnellement l’un des outils intégrés de recherche et de récupération web :

Ignorer la configuration de recherche et de récupération web

Dans les deux cas, sélectionnez l’option “Ignorer pour l’instant”, car le MCP Bright Data fournira cette fonctionnalité.

Continuez en sélectionnant une politique d’exécution et de sécurité. Vous pouvez également intégrer optionnellement un canal de messagerie instantanée. À la fin, le processus de configuration générera un fichier config.yaml minimal requis pour démarrer DeerFlow et stockera vos clés API dans .env.

Merveilleux ! Vous êtes maintenant prêt à lancer DeerFlow.

Étape n°3 : Démarrer le frontend DeerFlow

Dans le dossier d’installation de DeerFlow, exécutez la commande ci-dessous pour installer les dépendances du frontend et du backend :

make install

Ensuite, démarrez un serveur de développement local avec :

make dev

Vous devriez obtenir une sortie similaire à celle-ci :

La sortie de la commande

DeerFlow sera maintenant exécuté localement avec :

  • Gateway : Le backend de l’application, s’exécutant sur le port 8001
  • Frontend : S’exécutant sur le port 3000, avec un proxy inverse géré par Nginx sur le port 2026.

Pour accéder au frontend DeerFlow, ouvrez l’URL suivante dans votre navigateur :

http://localhost:2026

Vous devriez voir :

La vue de

Notez que le frontend local partage la même interface utilisateur que le site officiel DeerFlow.

Cliquez sur “Get Started with 2.0” pour accéder à votre espace de travail DeerFlow. La première fois que vous accédez à l’espace de travail, on vous demandera de créer un compte administrateur.

Remplissez le formulaire d’inscription pour créer votre compte local :

Le formulaire pour créer un compte DeerFlow local

Ensuite, connectez-vous pour accéder à l’espace de travail DeerFlow :

Le frontend DeerFlow

À partir d’ici, vous pouvez interagir avec l’agent DeerFlow et explorer les serveurs MCP configurés, les compétences, les canaux de messagerie instantanée et autres paramètres. Incroyable !

Étape n°4 : Se familiariser avec le MCP Bright Data

Avant de connecter le MCP Bright Data à DeerFlow, vérifiez que le serveur MCP s’exécute sur votre machine.

Commencez par installer le package MCP Bright Data globalement via le package npm @brightdata/mcp :

npm install -g @brightdata/mcp

Vérifiez que le serveur MCP démarre correctement avec :

API_TOKEN="<YOUR_BRIGHT_DATA_API>" npx -y @brightdata/mcp

Remplacez <YOUR_BRIGHT_DATA_API> par votre clé API Bright Data. Cela définit la variable d’environnement API_TOKEN requise et démarre le serveur MCP Bright Data localement. Pour plus de détails, consultez la documentation du MCP Bright Data.

Si tout est correctement configuré, vous devriez voir des journaux de démarrage similaires à ceux-ci :

Les journaux de démarrage du MCP Bright Data

Gardez à l’esprit que, lors de sa première exécution, le package @brightdata/mcp crée automatiquement deux API dans votre compte Bright Data :

  • mcp_unlocker : Se connecte à l’API Web Unlocker de Bright Data (et à l’API SERP).
  • mcp_browser : Se connecte à l’API Browser de Bright Data.

Ces API alimentent les 70+ outils disponibles via le MCP Bright Data. Vous pouvez également configurer des API personnalisées, comme décrit dans le dépôt officiel.

Pour confirmer que les API par défaut ont été créées avec succès, ouvrez “Accès web > API d’accès web” dans le panneau de contrôle Bright Data. Les deux API devraient apparaître dans le tableau “Mes API” :

Notez les API

Par défaut, le MCP Bright Data démarre en mode Rapide (niveau gratuit), qui donne accès à une sélection limitée d’outils. Pour activer tous les 70+ outils, passez en mode Pro en définissant la variable d’environnement PRO_MODE=true :

API_TOKEN="<YOUR_BRIGHT_DATA_API>" PRO_MODE="true" npx -y @brightdata/mcp

Remarque : Le mode Pro [entraîne des frais supplémentaires](https://github.com/brightdata/brightdata-mcp?tab=readme-ov-file#-pricing, modes).

Excellent ! Vous savez maintenant que le MCP Bright Data fonctionne localement. Ensuite, connectez-le à DeerFlow.

Étape n°5 : Configurer le MCP Bright Data dans DeerFlow

Vous pouvez configurer une connexion de serveur MCP dans DeerFlow via le fichier extensions_config.json.

Commencez par créer une copie du fichier de configuration exemple inclus dans votre installation :

cp extensions_config.example.json extensions_config.json

Le fichier exemple contient des configurations pour les serveurs MCP GitHub et PostgreSQL. Supprimez-les et assurez-vous que la section mcpServers contient ce qui suit :

{
  // ...
  "mcpServers": {
    "bright-data-web-mcp": {
      "enabled": true,
      "command": "npx",
      "args": [
        "@brightdata/mcp"
      ],
      "env": {
        "API_TOKEN": "<YOUR_BRIGHT_DATA_API_KEY>",
        "PRO_MODE": "true"
      }
    }
  },
  // ...
}

Cela indique à DeerFlow comment se connecter à une instance de serveur MCP Bright Data locale (appelée bright-data-web-mcp). En détail, il lui indique d’utiliser la commande npx -y @brightdata/mcp avec ces deux variables d’environnement :

  • API_TOKEN (requis) : Définissez ceci sur votre clé API Bright Data.
  • PRO_MODE (optionnel) : Définissez sur true pour activer le mode Pro. Définissez sur false ou supprimez PRO_MODE=true pour configurer une connexion MCP Bright Data en mode Rapide.

Notez le paramètre "enabled": true pour activer la connexion au serveur MCP.

Enregistrez extensions_config.json. DeerFlow dispose maintenant de tout ce dont il a besoin pour démarrer le serveur MCP Bright Data localement et s’y connecter. Super !

Étape n°6 : Vérifier que la connexion fonctionne

Terminez le processus DeerFlow actuel et relancez-le avec :

make dev

Dans l’application web de l’espace de travail, cliquez sur “Paramètres et plus” dans le coin inférieur gauche et sélectionnez “Paramètres” :

Sélection de l'option Paramètres””/>

La fenêtre modale “Paramètres” apparaîtra. Allez dans la section “Outils”, où vous verrez le serveur bright-data-web-mcp configuré :

Notez le serveur MCP

Comme configuré, la connexion MCP Bright Data est déjà activée.

DeerFlow ne fournit pas actuellement de moyen de visualiser les outils disponibles depuis un serveur MCP. Ainsi, démarrez une nouvelle conversation et entrez une invite comme :

Which Bright Data MCP tools do you have access to? 

Si vous avez configuré le MCP Bright Data en mode Pro, vous obtiendrez une réponse similaire à celle-ci :

Notez les outils MCP Bright Data disponibles

Remarquez comment cela liste tous les 70+ outils exposés par le MCP Bright Data. Si vous utilisez le mode Rapide, l’agent IA retournera à la place uniquement les outils disponibles dans ce mode.

Fantastique ! Cela confirme que l’agent IA DeerFlow peut accéder aux outils du MCP Bright Data.

Étape n°7 : Tester l’intégration

Il est temps de vérifier que les capacités fournies par Bright Data via son MCP sont correctement intégrées et accessibles dans DeerFlow. Pour ce faire, vous devez donner à l’agent IA une tâche qui nécessite la découverte et le scraping web.

Par exemple, supposons que vous souhaitiez découvrir des articles sur un sujet spécifique (le MCP lui-même, dans ce cas) et laisser l’agent IA DeerFlow les analyser.

N’oubliez pas que DeerFlow est livré avec une compétence intégrée academic-paper-review pour l’analyse de publications scientifiques :

Notez la compétence

Voyons si l’agent IA peut utiliser les outils du MCP Bright Data pour sourcer et accéder aux articles depuis le web.

Pour vérifier cela, essayez de demander à l’agent d’effectuer une tâche comme celle-ci :

Search the web for the most recent papers (last 12 months) on arXiv related to MCP (Model Context Protocol). Select the 5 most relevant papers and scrape their Markdown content from their HTML pages. Review and summarize the papers using the /academic-paper-review skill, then produce a final report highlighting the most interesting insights, findings, and criticisms.

Voici ce qui devrait se passer :

Exécution de l'invite

Initialement, l’agent IA a affiché un formulaire vous demandant de fournir :

  • Le mot-clé à rechercher (recommandé : “MCP” et “Model Context Protocol”).
  • La plage temporelle (recommandé : “12 mois”).
  • Les sources pour obtenir des articles (recommandé : “arXiv”).
  • Le nombre d’articles (recommandé : “5”).

Une fois que vous avez rempli le formulaire et soumis les données, l’agent IA démarrera la tâche. Fantastique !

Étape n°8 : Analyser l’exécution et la sortie de l’agent

Pour mieux comprendre ce que l’agent IA DeerFlow a fait, développez le menu déroulant des étapes :

Les étapes effectuées par l'agent IA DeerFlow pour accomplir la tâche

Pendant l’exécution, l’agent IA a :

  1. Chargé la compétence academic-paper-review.
  2. Utilisé l’outil discover du MCP Bright Data pour rechercher des articles sur “MCP” et “Model Context Protocol”.
  3. Récupéré l’URL de la page HTML pour chaque article arXiv.
  4. Scraped les cinq articles en utilisant l’outil scrape_as_markdown via l’API Web Unlocker de Bright Data.
  5. Examiné les articles en utilisant la compétence chargée et consolidé l’analyse dans un rapport Markdown final.

Faites défiler le rapport produit et vous verrez :

Le rapport produit par l'agent IA DeerFlow

Remarquez comment, pour chaque article, l’agent IA DeerFlow a produit un résumé, les contributions principales, les points forts, les faiblesses, l’évaluation de la méthodologie, les questions pour les auteurs et les recommandations. Le rapport est également soutenu par des liens directs vers les articles et inclut une analyse approfondie avec des scores dérivés de la compétence academic-paper-review de DeerFlow.

Et voilà ! Cela prouve que Bright Data est correctement intégré avec DeerFlow et peut servir de source pour la recherche web, la découverte, le scraping et bien d’autres capacités basées sur le web.

Conclusion

Dans cet article de blog, vous avez appris ce qu’est DeerFlow et comment il permet aux agents IA de gérer des tâches à long horizon. En particulier, vous avez exploré comment le connecter au MCP Bright Data comme source d’outils de qualité entreprise pour l’accès web.

Comme démontré ici, l’intégration de Bright Data peut remplacer entièrement les options intégrées de recherche et de récupération web de DeerFlow. Cela fournit des outils de qualité production, évolutifs et hautement fiables pour accéder aux pages web et interagir avec elles sans être bloqué.

Inscrivez-vous gratuitement à un compte Bright Data dès aujourd’hui et explorez nos produits web prêts pour l’IA !