scraping live de profils linkedin en masse

Hello tout le monde,

C’est quoi les meilleurs solutions pour du scrapine live (j’ai bien dit live :slight_smile: ) de profils Linkedin complets (pas uniquement les données publiques) ?

Des solutions qui n’utilisent pas nos comptes linkedin pour faire de la masse.

merci pour vos pistes !

Je dirais vayne

Va voir du côté de Apify :wink:

Merci, tu l’utilises sur des volumes importants ?

merci Guillaume, je cherche plutôt des solutions robustes et durables sur Apify tu sais jamais sur quoi tu tombes malheureusement

On parle de quels volumes ?

Hello, API de live scraping disponible ici ! DM

ps: Apify c’est super chère, et avec des scams de type rug pull de plus en plus courant, faites attention.

1 « J'aime »

Hello @steph1 :waving_hand:

Le souci c’est que ce que tu demandes se contredit un peu. Déjà, un profil complet (pas juste le public), ça sort forcément d’une session authentifiée, l’API interne de linkedin. Donc y’a toujours un compte derrière. Quand un outil te dit « sans utiliser tes comptes », ça veut dire qu’il tape dans celui de quelqu’un d’autre, et c’est ce compte-là qui prend le ban, pas toi.

Une fois ce compte posé, tes 3 autres critères (live, en masse, sans cramer le compte) peuvent pas tenir ensemble. En gros t’as trois familles :

1. Le « comptes farming » (Apify, Bright Data, PhantomBuster, vayne…)
Ton compte est tranquille, mais la data vient de comptes tiers qui eux se font griller. Du coup fraîcheur et fiabilité font le yoyo, les actors cassent à chaque update de détection de linkedin. Et souvent le « live » c’est de la file d’attente, pas du temps réel. Le coût grimpe vite quand tu pousses le volume.

2. Les bases déjà scrapées (style Proxycurl, waterfall d’enrichissement)
Du volume, pas cher, mais c’est du cache. Donc ça casse ton critère « live ». Bien si t’as pas besoin de temps réel, sinon oublie.

3. Ton propre compte
C’est ce qui reste le plus propre côté risque, et t’as la donnée complète en temps réel. Le hic c’est que ça monte pas en volume, un compte reste un compte. Et si tu commences à en empiler pour scaler, tu retombes direct dans le cas 1.

Bref tu peux pas avoir les 3 en même temps, faut choisir ceux qui comptent pour ton use case. Volume massif, tu fais du comptes farming et t’assumes la fraîcheur variable. Précision temps réel sur des comptes que tu maîtrises, tu restes petit.

Et linkedin a une détection comportementale assez costaud, donc tout ce qui s’écarte trop du vrai usage se fait repérer vite. C’est aussi pour ça que le scraping de masse pas cher est souvent pourri niveau qualité.

Je précise que je bosse sur un truc dans ce domaine (de l’exécution linkedin pilotée par un agent), donc je suis le nez dedans en ce moment :sweat_smile: Si tu veux creuser un point hésite pas.

3 « J'aime »

ça m’intéresse aussi ! Malhëurêsement les bases de données type Apollo, Prospeo, icypeas & co ne sont pas vraiment à jour (malgré qu’ils communiquent sur un refresh régulier).

J’ai pas mal de cas où les personnes ciblées ne bossent plus dans les entreprises…

Au final, rien de mieux que le scraping en live. Si vous avez d’autres options (à part acteur Apify), je suis preneur. De mon côté, mon usecase est surtout : partir d’une entreprise et trouver les bonnes personnes, merci !!

Pour tous les gens qui font des gros volumes par mois, plus de dizaines de millions par mois, j’ai une API qui peut scraper en live ou avec du cache de 8 jours, avec un temps de réponse entre 10 et 20 secondes sur du live et sur du cache en millisecondes. La réponse : n’hésitez pas à me contacter. J’ai proposé à des SaaS que tu cites la techno. Ils sont pas intéressés par le fait de refresh.