Guides
Ce que les labos d'IA achètent aux entreprises, et pourquoi
Les labos d'IA entraînent désormais des modèles à faire du vrai travail, de la note de frais au ticket de support résolu. Pour cela, il leur faut des traces de vrai travail, qui se trouvent surtout dans les entreprises. Voici ce qu'ils achètent, secteur par secteur, et ce qu'ils refusent.
Pourquoi les labos achètent des données privées maintenant
Les premiers grands modèles de langage ont appris sur le web public. Cette source est en grande partie épuisée, et elle apprend peu sur la façon dont le travail se fait en entreprise. En 2026, les labos se concentrent sur les agents d'IA : des modèles qui ouvrent un tableur, naviguent dans un CRM, préparent une présentation et vérifient leur propre travail. Pour entraîner et tester ces agents, les labos ont besoin d'exemples réels des tâches, des étapes suivies et du résultat.
Cela change ce qui a de la valeur. Un rapport final est utile. La demande, les versions intermédiaires, les commentaires et la version finale ensemble le sont bien plus, car ils montrent le chemin.
Processus métier et données d'entraînement pour agents
La catégorie qui progresse le plus vite, ce sont les données qui montrent comment le travail de bureau se fait dans les logiciels métier. Les labos en font des tâches pour agents, avec un résultat correct connu pour vérifier.
- Notes de frais et traitement des factures, du justificatif à la validation.
- Travail sur tableur : tableaux croisés dynamiques, rapprochements, budgets et prévisions avec leurs formules.
- Présentations construites à partir d'une demande, avec la demande et les versions intermédiaires.
- Navigation dans un CRM ou un ERP : créer une commande, mettre à jour une opportunité, clôturer un dossier.
- Tickets de support résolus du premier message à la solution, escalades comprises.
Du code privé avec son historique
Le code public est largement disponible. Ce qui manque aux labos, c'est du code privé avec son contexte : le ticket qui demandait une modification, le document de conception, les commits, les commentaires de revue et les tests. Ensemble, ils permettent à un labo de construire des tâches de développement réalistes avec une réponse vérifiable. Les systèmes historiques, les migrations et les langages moins courants sont particulièrement recherchés.
Le raisonnement d'expert
Les labos veulent saisir la façon dont les professionnels réfléchissent à un problème. Comment un expert-comptable clôture les comptes et décide de ce qu'il faut provisionner. Comment un avocat revoit un contrat et choisit les clauses à négocier. Comment un analyste crédit évalue un dossier. Comment un planificateur réachemine un envoi en retard.
Ce raisonnement se voit souvent dans les données du quotidien : commentaires de revue, échanges d'e-mails internes, notes de décision et corrections qu'un senior apporte au travail d'un junior.
Les labos accordent autant de valeur aux doutes qu'aux réponses. Un échange où deux collègues ne sont pas d'accord sur la façon de comptabiliser une opération, puis tranchent, montre à un modèle comment des experts pèsent les options.
Procédures, méthodes et bases de connaissances
Procédures opérationnelles, méthodes, guides d'intégration, checklists qualité et bases de connaissances internes disent à un modèle comment une tâche doit être faite et comment la vérifier. Les labos s'en servent à la fois pour entraîner des modèles et pour construire des tests. Les entreprises sous-estiment souvent ces contenus parce qu'ils semblent ordinaires. Pour un labo, c'est une description écrite du travail bien fait.
Les données dans des langues moins répandues
La plupart des données d'entraînement sont en anglais. Les modèles sont plus faibles en néerlandais, polonais, suédois, tchèque, finnois et dans beaucoup d'autres langues européennes, surtout pour les tâches professionnelles. Les données de travail dans ces langues sont rares, et les labos les paient donc plus cher. Une entreprise qui travaille en deux ou trois langues a souvent un avantage qu'elle ignore.
Les règles locales ajoutent de la valeur. Une procédure de paie polonaise, un modèle de contrat de travail suédois ou un échange sur la TVA française combine la langue et la connaissance du droit et des pratiques du pays. Cette combinaison est très difficile à trouver ailleurs pour un labo.
Ce que les labos achètent, par secteur
Chaque secteur a ses propres données de valeur. Quelques exemples :
- Expertise comptable : checklists de clôture mensuelle, échanges de rapprochement, dossiers de travail Excel, notes de revue et tickets de questions clients.
- Avocats : bibliothèques de clauses avec positions de repli, guides de revue, déroulé des dossiers et notes de recherche internes.
- ESN et informatique : dépôts privés avec historique, tickets liés, documents de conception, post-mortems et runbooks.
- Conseil : demandes associées aux présentations finales, modèles d'analyse, méthodes et bibliothèques de propositions.
- Services financiers : procédures de crédit, modèles financiers, processus de conformité et modèles de reporting.
- Logistique : échanges de gestion des aléas, processus TMS, WMS et ERP, procédures douanières et procédures d'entrepôt.
Comment les labos utilisent ce qu'ils achètent
Les labos utilisent les données d'entreprise de trois façons principales. La première est l'entraînement : le modèle lit de nombreux exemples d'une tâche et en apprend les schémas. La deuxième est l'évaluation : les labos mettent de côté un ensemble de tâches réelles pour tester si un nouveau modèle sait faire le travail. La troisième est l'apprentissage par renforcement, où un modèle tente une tâche dans un environnement simulé et est récompensé quand le résultat correspond à ce qu'a fait un professionnel.
Chaque usage favorise des données différentes. L'entraînement profite du volume. L'évaluation demande des tâches bien documentées avec une bonne réponse claire. L'apprentissage par renforcement a besoin à la fois de la tâche et d'un moyen de vérifier le résultat, c'est pourquoi les données avec un résultat visible, comme un ticket clôturé ou un rapport validé, sont très demandées.
Comment les labos jugent la qualité
Avant d'acheter, un labo examine des extraits caviardés. Il vérifie si les données sont complètes, si les étapes peuvent être suivies, combien de bruit elles contiennent et si le format est cohérent d'une année à l'autre. Il demande aussi d'où viennent les données et si le vendeur avait le droit de les céder.
La traçabilité fait désormais partie de la qualité. Avec le règlement européen sur l'IA, les fournisseurs de modèles d'IA à usage général doivent publier un résumé de leurs données d'entraînement. Les labos préfèrent donc des données accompagnées d'une trace écrite claire de leur origine, de leur périmètre et de leur désidentification.
Ce que les labos ne veulent pas
Les labos sont sélectifs. Certaines données n'ont aucune valeur pour eux, et d'autres ne peuvent pas être utilisées légalement.
- Données personnelles : noms, coordonnées, données de santé et numéros d'identité. Elles sont supprimées ou exclues.
- Données aux droits incertains : fichiers appartenant aux clients, contenus sous accord de confidentialité et documents de tiers.
- Bruit : newsletters, notifications automatiques, invitations de calendrier et doublons.
- Textes écrits par des outils d'IA, qui apprennent peu aux modèles.
- Documents scannés sans texte lisible.
- Données sans résultat, comme un ticket jamais clôturé.
- Contenus déjà publics, que les labos ont dans la plupart des cas.
Comment savoir si vos données conviennent
Posez-vous quatre questions. Nos données montrent-elles une tâche du début à la fin ? Couvrent-elles plusieurs années ? Montrent-elles un jugement d'expert ? Nous appartiennent-elles ? Si la réponse est oui pour la plupart, vos données ont de bonnes chances d'intéresser les labos.
Lodex vous aide à le vérifier avant de vous engager. L'estimation donne une première fourchette pour votre entreprise, dans €10K–€600K, et un court appel montre lesquelles de vos sources les labos achèteront le plus probablement.
Questions
Les labos achètent-ils aux entreprises ordinaires ou seulement aux grandes plateformes ?
Aux deux. Les grandes plateformes vendent du volume. Les entreprises ordinaires vendent des traces de vrai travail que les plateformes n'ont pas, et c'est ce dont l'entraînement des agents a besoin.
L'historique des e-mails et des messageries est-il utile ?
Oui, quand il montre le travail en train de se faire : décisions, résolution de problèmes et passations. Newsletters, notifications et messages personnels sont supprimés.
Un labo utilisera-t-il mes données pour créer un produit concurrent ?
Les labos entraînent des modèles généralistes sur les données de nombreuses entreprises. Lodex vend uniquement à des labos d'IA, jamais à vos concurrents, et rien n'est publié.
Les labos veulent-ils des données en français ?
En général oui. Les données d'entreprise dans les langues européennes autres que l'anglais sont rares, et les labos les paient plus cher.
Et si la plupart de nos données contiennent des informations clients ?
Les informations clients sont supprimées pendant le traitement. Ce qui reste, les étapes, le raisonnement et le résultat, est ce que les labos paient.