Le web scraping consiste à récupérer automatiquement des informations affichées sur des sites web. Un programme lit les pages à votre place et range ce qu'il y trouve dans un tableau.
L'idée est simple. Ce qui l'est moins, c'est de le faire proprement, à répétition, sur des sites qui changent.
À quoi ça sert
Un e-commerçant surveille les prix de ses concurrents. Un promoteur suit les annonces immobilières d'une ville. Un cabinet de recrutement alimente son propre moteur d'offres. Une marque vérifie où ses produits sont revendus, et à quel prix.
Le point commun de ces situations : l'information est publique, mais aucun bouton ne permet de la télécharger en nombre.
Ce qui se passe techniquement
Le programme demande une page, comme le ferait un navigateur. Il repère les éléments utiles (le prix, le titre, la date), les extrait, puis les écrit dans un fichier ou une base.
Certains sites livrent leur contenu directement en HTML. D'autres le construisent en JavaScript une fois la page ouverte, ce qui oblige à piloter un vrai navigateur. Le résultat que vous recevez est le même. Le travail derrière n'a rien à voir.
Et le cadre légal ?
Nous travaillons sur des données accessibles publiquement, à une cadence qui ne perturbe pas les sites consultés. La définition des usages relève de votre responsabilité, et nous vous conseillons sur ce point. Si votre projet touche à des données personnelles, la CNIL publie des fiches pratiques qui valent la lecture.
Le scraping devient intéressant dès qu'une donnée existe en ligne sans qu'aucune interface ne permette de la récupérer en volume ou régulièrement. Si vous êtes dans ce cas, décrivez-nous le besoin.