2 000 lignes vides : enrichir sa base de prospection B2B…

Étude de cas anonymisée. 2 000 lignes vides, une première formation IA payée sans résultat, puis un pipeline de génération de leads B2B monté en 14 heures : open data Data.gouv, Firecrawl, Hunter, et Claude avec la main directement sur les fichiers Excel.

Étude de cas anonymisée. Le client a validé le principe de publication ; son nom et celui de son entreprise n'apparaissent pas. Les chiffres sont mesurés, et leur périmètre exact est précisé plus bas.

En bref

Le contexte : quinze ans de terrain, et une base qui ne suit plus

Commercial indépendant, quinze ans passés sur un marché de niche : les logiciels techniques pour l'industrie, vendus à des fabricants de machines, des tableautiers, des automaticiens et des bureaux d'études de l'Ouest de la France.

Il connaît son marché par cœur. Dès la phase de segmentation, il sait quels codes NAF retenir, lesquels écarter, et quels acteurs sortir d'office : grands groupes, organismes de contrôle, agences d'intérim. Un profil sans cette expertise aurait passé des heures à calibrer ce qu'il pose en quelques minutes. Retenez ce détail : c'est lui qui fait toute la différence entre un pipeline d'enrichissement qui produit des leads et un pipeline qui produit du bruit.

Côté IA, ce n'est pas un débutant. Il utilise déjà un assistant conversationnel au quotidien, avec une dizaine de projets documentés et des personas définis. En revanche, il est entièrement débutant sur ce qui compte ici : les fichiers locaux, les connecteurs vers des sources de données, les compétences réutilisables et l'exécution de code.

Le déclencheur : une première formation IA déjà payée, pour rien

Deux choses arrivent en même temps.

Un volume de données qui le dépasse. Environ 2 000 entreprises dans son fichier, plus 700 remontées de LinkedIn quasi inexploitables. Sa collecte tourne encore à la main : lecture d'annonces d'emploi, certifications affichées sur les sites, LinkedIn limité à neuf mois d'historique, salons professionnels. Chaque ligne lui coûte du temps de commercial, du temps qui n'est pas passé à vendre. Il sait que l'IA peut traiter ça. Il ne sait pas comment.

Une saturation d'information. Il est perdu entre les vendeurs de formation, les posts LinkedIn, les vidéos et les retours qu'il déniche sur des forums spécialisés. Tout le monde promet du « growth avec l'IA », personne ne montre le fichier avant et le fichier après.

Surtout, il a déjà payé pour ça. Une première prestation avec un consultant IA n'a débouché sur aucun résultat exploitable. Il arrive donc avec de la défiance, pas de la curiosité. C'est le point de départ réel de la mission, et il change tout : il ne s'agit pas de convaincre quelqu'un que l'IA sert à quelque chose, il s'agit de lui prouver que cette fois, il repartira avec un système qui tourne chez lui.

Le vrai problème : un sujet de données commerciales, pas un sujet d'IA

La demande implicite était « forme-moi à l'IA ». Ce n'était pas le sujet : il en faisait déjà tous les jours.

Le vrai écart était ailleurs, à deux niveaux.

D'abord, passer d' un usage conversationnel à un usage outillé . Tant que l'IA reste dans un onglet de navigateur, on lui donne des bouts de tableau en copier-coller et on recopie ses réponses à la main. Ça ne passe pas à l'échelle de 2 000 lignes, et chaque recopie est une erreur potentielle. Le saut n'est pas un saut de prompt, c'est un saut d'architecture de travail : fichiers locaux, connecteurs vers des sources de données, compétences réutilisables, exécution de code.

Ensuite, et c'est le fond du sujet, comprendre les enjeux de la donnée elle-même. Où la collecter, comment la traiter, comment la qualifier, comment mesurer ce qu'on a gagné, et comment en faire ensuite du matériel commercial exploitable.

Sa vraie question n'était pas « comment on prompte ». C'était : comment je transforme 2 000 lignes vides en interlocuteurs joignables ?

C'est la question de fond de la génération de leads B2B aujourd'hui. Le nom de l'entreprise ne vaut rien. Ce qui vaut, c'est la personne qui décide, sa fonction, son adresse, et la certitude raisonnable que le message va lui arriver.

La stack d'enrichissement, couche par couche

Le pipeline monté pendant le parcours empile quatre couches. L'ordre n'est pas décoratif : chaque couche ne se déclenche que quand la précédente a donné tout ce qu'elle avait. C'est ce qui évite de payer pour des données déjà disponibles gratuitement.

Couche 1 : Data.gouv, le socle gratuit, et il est large

C'est la couche la plus sous-estimée. L'écosystème open data français donne, sans un euro, l'essentiel de la firmographie B2B : l'annuaire officiel des entreprises pour l'identification et l'activité, le registre national pour les dirigeants et les statuts, les annonces légales pour les événements de vie de l'entreprise, créations, changements de dirigeant, procédures.

Concrètement, sur le lot pilote, l'essentiel du gain de remplissage vient de là. Pas des outils payants. Une base de prospection qui n'a pas encore été passée à l'open data n'a aucune raison d'acheter de la donnée : elle achèterait ce qu'elle peut obtenir gratuitement.

C'est aussi la couche qui fait le ménage. Une entreprise cessée, radiée ou absorbée sort du fichier avant qu'on dépense un seul crédit dessus.

Couche 2 : Firecrawl, lire le web que les scrapers classiques ne voient pas

Beaucoup de sites industriels affichent leur contenu utile après exécution du JavaScript : catalogues, pages « nos partenaires », listes de certifications. Un scraper naïf récupère une page vide. Firecrawl rend la page comme le ferait un navigateur, puis restitue un contenu propre et exploitable par l'IA.

Ce que ça débloque pour la prospection : les signaux de qualification qui ne sont dans aucun registre. Quelles marques l'entreprise distribue, quels logiciels elle affiche, quelles certifications elle revendique, quels postes elle recrute. C'est ce qui transforme une ligne firmographique en lead scoré.

Couche 3 : Hunter, passer d'une liste de fonctions à une liste de personnes

Hunter intervient en dernier, et sur trois usages distincts qu'il vaut mieux ne pas confondre :

C'est la troisième qui compte le plus, et c'est celle qu'on oublie. Une adresse déduite avec un score faible et envoyée quand même, c'est un rebond, et les rebonds abîment la réputation du domaine expéditeur. Sur le lot pilote, la vérification a retiré une adresse jugée probable mais invalide, avant l'envoi.

Donner la main à Claude directement sur les fichiers Excel

C'est le point de bascule technique du parcours, et celui qui surprend le plus les commerciaux qui utilisent déjà l'IA au quotidien.

Avant : l'IA vit dans un onglet. On lui colle vingt lignes de tableau, elle répond, on recopie à la main dans le fichier. Sur 88 entreprises, c'est déjà pénible. Sur 2 000, c'est impossible, et chaque recopie ajoute son lot d'erreurs.

Après : Claude travaille dans le dossier de travail, avec le classeur sous la main. Il ouvre le .xlsx , lit les 110 colonnes, écrit dans les cellules, crée les colonnes manquantes, applique les règles de dédoublonnage, calcule le score de chaque ligne et produit le fichier de sortie. Le fichier reste la source de vérité de bout en bout : il n'y a plus d'étape de recopie, donc plus d'erreur de recopie.

Trois garde-fous ont été posés en séance, et ils comptent autant que la technique :

C'est ce troisième point qui rend l'ensemble utilisable en growth : on peut trier la base par niveau de preuve et n'envoyer qu'aux segments solides, plutôt que d'arroser et d'espérer.

Le dispositif : 14 heures, son vrai fichier dès la première heure

Quatre demi-journées de 3 h 30, soit 14 heures, en visio, avec un parti pris d'animation strict : la co-construction se fait toujours sur son écran, jamais sur celui du formateur. À la fin de chaque séquence, le livrable existe chez lui, pas dans un support de cours.

Un fil rouge unique : son vrai fichier, présent dès la première heure. Pas de cas d'école, pas de jeu de données de démonstration.

Et un carnet de bord qu'il écrit lui-même à chaque séquence, qui devient son runbook à la fin du parcours. Règle posée dès le départ : si ce n'est pas dans son carnet, ce n'est pas acquis.

Ce qui a été monté chez lui

Les deux moments de bascule

Le premier lot passé en vrai

On prend un département de l'Ouest. Une centaine de lignes de son fichier, celles qu'il connaît, celles qu'il a collectées à la main pendant des mois. On les passe dans le pipeline.

Le fichier revient avec les effectifs, les chiffres d'affaires, les codes d'activité, les sites web, les dirigeants nommés et des emails scorés. Puis on continue, et le pipeline ramène des entreprises qu'il n'avait pas, sur son propre marché.

Le moment qui compte n'est pas celui où son fichier se remplit tout seul. C'est celui où il s'allonge, avec des sociétés qu'il ne connaissait pas, sur un marché qu'il pensait connaître entièrement.

Des noms sur les cibles métiers

Il avait une liste de fonctions cibles, celles qui décident chez ses prospects. Une liste théorique, sans un seul nom en face.

On y met des noms, des prénoms, des profils, et on reconstruit les adresses à partir du format maison de chaque entreprise, avec un score de fiabilité. Sa liste de fonctions devient une liste de personnes joignables. C'est très exactement le passage d'un ciblage à une campagne.

Les résultats mesurés

Périmètre exact de ces chiffres. Ils portent sur le lot pilote de 88 entreprises, mesuré en juillet 2026 dans le rapport comparatif à trois états. Ce n'est pas le fichier complet de 2 000 lignes. Le dire est la condition pour que le chiffre reste vrai.

Le résultat qui n'est pas dans le tableau

Il est autonome. Il a repassé l'intégralité de la formation seul entre deux sessions, puis formulé lui-même son besoin suivant. C'est l'indicateur le plus favorable du parcours, et le seul qui compte encore à six mois.

Il a aussi réinvesti derrière : montée de gamme sur son compte IA, abonnement payant sur l'outil de rendu de pages. Un client qui remet de l'argent dans l'outillage après la formation est un client qui s'en sert.

Ce que coûte réellement une stack d'enrichissement

La question tombe à chaque fois, alors autant la traiter de front. L'ordre des dépenses est plus important que leur montant.

Formulé autrement : chaque euro dépensé sur une ligne que l'open data aurait pu qualifier est un euro perdu deux fois , une fois sur le crédit consommé, une fois sur le temps passé à traiter une ligne qui aurait dû sortir du fichier.

Ce qui est transférable à votre propre base

Ce qui n'a pas marché

Une étude de cas sans zone d'ombre ne convainc personne qui a déjà mené un projet. Voici les trois points qui ont coincé.

Secteur

Métiers concernés

Modules de formation liés