AI

Le Seul Artefact Qu’ils Ne Peuvent Pas Copier

En 2026, la puissance de calcul, les données et la recette font l’entreprise, et vos poids sont l’avantage concurrentiel. Les données d’entraînement à l’échelle web sont la course que peu d’équipes IA regardent.
9 min de lecture
Compute + Data + Recipe = Company

En juillet 2026, Together AI et Y Combinator ont lancé le premier cluster GPU YC dédié. Les fondateurs YC peuvent désormais sécuriser une puissance de calcul sérieuse en quelques semaines. Les anciens contrats de deux ans ne sont plus la seule voie possible.

Supposons que vous dirigez l’IA d’une nouvelle entreprise. Vous entraînez un modèle de fondation pour l’IA physique, la vidéo ou la recherche. Ces modèles nécessitent beaucoup de FLOPs et beaucoup de données d’entraînement. Cette annonce devrait vous faire ressentir deux choses simultanément. Du soulagement, car votre problème d’approvisionnement le plus difficile vient de s’alléger. De l’inconfort, car il s’est allégé pour tout le monde également.

C’est le schéma de tout ce cycle. Chaque ressource pour laquelle vous vous battez devient accessible à vos concurrents aux mêmes conditions. Ce qui impose la question que votre conseil pose sans cesse. Quel est exactement votre avantage concurrentiel ?

Start by crossing out what is not

Votre code n’est pas votre avantage concurrentiel. Le codage agentique a mis fin à ce débat. Votre infrastructure d’entraînement, votre stack de déploiement et votre harnais d’évaluation sont tous reconstructibles. Une équipe compétente avec un agent de codage les recrée en quelques semaines. Pas parfaitement, mais suffisamment.

Votre architecture n’est pas votre avantage concurrentiel. Les architectures sont publiées, divulguées ou rétro-conçues à partir du comportement. DeepSeek a montré qu’un suiveur rapide peut compresser une avance de plusieurs années en quelques mois. Quelle que soit la variante d’attention ou l’astuce d’espace d’état que vous privilégiez aujourd’hui, elle n’est qu’un article de blog de devenir celle de tout le monde.

Vos GPU ne sont pas votre avantage concurrentiel en eux-mêmes. La puissance de calcul est rare, mais elle devient procurable. L’accord Together et YC en est la preuve : de nombreux vendeurs, des coûts de transition en baisse, et des conditions contractuelles tendant vers la flexibilité. La puissance de calcul est une course que vous ne devez pas perdre. Ce n’est pas une course que vous pouvez remporter.

Vos données ne sont pas non plus votre avantage concurrentiel en elles-mêmes. Si votre plan repose sur les mêmes jeux de données sous licence et les mêmes API que tout le monde, vous avez un problème. Vous pré-entraînez le même modèle que tout le monde, à grand frais. Alors que reste-t-il ?

Compute + Data + Recipe = Company

Voici le cadre que j’apporterais à votre prochaine réunion du conseil.

En 2026, l’équation est simple : Compute + Data + Recipe = Company. Tout le reste, le code, l’infra et la couche applicative, un agent peut le reconstruire. Vos poids sont là où les trois se rencontrent, rendus physiques. C’est l’avantage concurrentiel.

Diagramme de Venn de Data, Compute et Recipe s'intersectant aux Weights, labellisé l'avantage concurrentiel
L’avantage concurrentiel n’est pas une seule ressource, car les ressources s’achètent. C’est l’intersection, compilée dans le seul artefact qu’un agent ne peut pas réimplémenter.

Les poids sont le seul artefact de votre entreprise que le codage agentique ne peut pas répliquer. Non pas parce qu’ils sont secrets. Parce qu’ils sont un enregistrement compressé de décisions. Chaque passe de filtrage, chaque choix de curriculum et chaque environnement RL est intégré dans les paramètres. Tout comme chaque décision d’éliminer 40 % du corpus parce que vos experts du domaine l’ont jugé inutilisable. Deux équipes avec des clusters identiques et des données brutes identiques livrent quand même des modèles différents, car la recette est le modèle.

C’est pourquoi l’intersection importe plus que n’importe quel cercle individuel.

  • Les données sans puissance de calcul sont un disque dur.
  • La puissance de calcul sans données différenciées est une façon très coûteuse de reproduire Llama.
  • Les données et la puissance de calcul sans jugement, c’est ainsi qu’on brûle une Série A en produisant une marchandise aux formes de benchmark.

Les poids se situent là où les trois se chevauchent. Tout le reste dans votre stack est remplaçable. Cet artefact ne l’est pas.

You are in two races at once

Tout le monde reconnaît la course à la puissance de calcul, car elle dispose d’un tableau de scores bruyant. Annonces de clusters, méga-tours de financement et contrats de deux ans. Maintenant des partenariats de type YC pour les court-circuiter. La course aux données se déroule en parallèle, en ce moment même, avec la même physique et la même urgence. Offre rare, accès qui se consolide, et premiers arrivants qui verrouillent les conditions.

Les signaux sont partout. Reddit a signé un accord de licence à 60 millions de dollars par an avec Google. Un cloud d’inférence a payé 275 millions de dollars pour acquérir une couche d’accès web. Les hyperscalers proposent désormais l’accès aux données comme infrastructure de première partie. C’est le même schéma d’annonces que pour la puissance de calcul. Il s’imprime simplement sur une page plus discrète.

La course aux données comporte une différence cruciale. Il n’existe pas de marché spot pour les données que vous n’avez pas collectées. Manquez une fenêtre de calcul et vous attendez un trimestre. Manquez la fenêtre des données et le corpus dont vous aviez besoin n’a jamais été rassemblé.

Alors où vivent concrètement les données à cette échelle ? Pas dans des instantanés académiques, qui sont figés. Pas dans des catalogues sous licence, qui sont des silos étroits, un domaine à la fois. Pas dans Common Crawl, qui est épuisé et n’a jamais contenu de vidéo. Le web ouvert est la plus grande source de données d’entraînement qui existe. Texte, images, PDFs, et surtout vidéo, actualisés quotidiennement, dans toutes les langues, dans tous les domaines.

Mais le web ne se livre pas de lui-même. À l’échelle du pétaoctet, la collecte est une capacité industrielle. Murs anti-bots, limites de débit, rendu, fraîcheur et provenance défendable par votre équipe juridique. Les stacks de scraping open-source plafonnent autour de 60 à 75 % de succès et tombent en panne en cours d’exécution. C’est pourquoi tant de labs bien financés se retrouvent avec des chercheurs qui gardent les crawlers au lieu d’entraîner des modèles.

Tout comme vous ne fabriqueriez pas vos propres GPU, collecter le web vous-même revient à créer une entreprise dans votre entreprise. Je serai direct sur ma position, car c’est ce que nous faisons chez Bright Data. Nous collectons environ un pétaoctet de données web chaque semaine. Cela repose sur une archive web de 90 pétaoctets. Elle contient 630 milliards de pages sur 320 millions de domaines. Nous fonctionnons à 99,99 % de disponibilité, avec une conformité qui a été testée en justice. À ma connaissance, personne d’autre n’opère la collecte web à l’échelle qu’exige un entraînement frontier.

Deux pistes de course parallèles, calcul et données, convergeant vers les Weights
Même physique, même urgence, en parallèle. Offre rare, accès qui se consolide, premiers arrivants qui verrouillent les conditions. La course au calcul a simplement le tableau de scores le plus bruyant.

Tracez le parallèle jusqu’au bout. Sécuriser la puissance de calcul tôt est un prérequis. Sécuriser tôt l’approvisionnement en données à l’échelle web est le geste identique, au moment identique. Les mêmes dynamiques de marché, se jouant en ce moment, dans la voie que moins de personnes regardent.

What this means for how you spend the raise

1. Traitez la puissance de calcul comme une course et les données comme un actif. La puissance de calcul, vous la louez aux meilleures conditions possibles. Le marché évolue en votre faveur, alors profitez-en. Les données, vous les possédez : sécurisées, versionnées, actualisées et différentes de ce que vos concurrents peuvent obtenir. Pour la plupart des équipes, cela signifie aller au-delà du corpus public épuisé. Les chercheurs projettent désormais que le texte public de haute qualité sera épuisé entre 2026 et 2032. Si vous entraînez sur ce que tout le monde peut télécharger, vous avez choisi le modèle de vos concurrents.

2. Si vous êtes dans l’IA physique ou la vidéo, c’est doublement vrai. Votre corpus n’a jamais été dans Common Crawl. Les modèles du monde et les VLA fonctionnent avec de la vidéo, égocentrique, riche en tâches et diverse. Les labs qui gagnent cette course sont ceux qui industrialisent sa collecte maintenant, avant que la catégorie ne se standardise. Votre pipeline de données n’est pas une infrastructure de support. C’est la décision produit.

3. Consacrez vos talents seniors rares à la recette, pas à la plomberie. Les agents peuvent écrire vos chargeurs de données. Ils ne peuvent pas décider ce qu’un robot doit regarder pour apprendre à plier le linge. Ils ne peuvent pas décider ce qu’un modèle de recherche doit voir pour battre Google sur votre vertical. Ce jugement, le troisième cercle, est là où vos chercheurs sont irremplaçables. Organisez vos effectifs en conséquence.

4. Dites-le clairement à votre conseil. Notre avantage concurrentiel, ce sont nos poids : un approvisionnement en données que nos concurrents n’ont pas, notre propre recette, sur une puissance de calcul sécurisée tôt. C’est une phrase qui résiste à la due diligence. Nous avons de super ingénieurs ne l’est plus.

The uncomfortable clock

Une dernière chose que l’accord Together et YC vous indique. Les ressources se consolident rapidement. La puissance de calcul est verrouillée dans des clusters et des partenariats. Les données sont verrouillées dans des licences et des acquisitions. L’intersection que vous pouvez construire en 2026 est plus grande que celle qui sera disponible en 2027. Les cercles rétrécissent pour les retardataires.

Compute + Data + Recipe = Company. Les deux courses se déroulent en parallèle. Vous n’êtes comptabilisé comme finisseur que dans les deux.