Eklablog Tous les blogs
Suivre ce blog Administration + Créer mon blog
MENU

Publicité

Modifier les éléments

Je ne reviens ni sur la constitution de l'arbre par le parser lxml, ni sur la navigation dans l'arbre ni sur la recherche. J'explique ici comment modifier l'arbre à partir d'un exemple. Pour la réalisation de mon moteur de recherche de bougies parfumées,...

Lire la suite
Publicité

Chercher dans l'arbre

Reprenons notre exemple habituel : le site de bougies parfumées Scandles Scandles est un site marchand Wordpress qui utilise l'extension commerce Woocommerce. Supposons que nous voulions extraire de la page produit, le prix et le titre de la bougie from...

Lire la suite

Navigation dans l'arbre

BeautifulSoup permet de naviguer au sein de l'arbre créé lors de l'analyse syntaxique d'un document X(HTML). Après la création de l'objet BS4 : from bs4 import BeautifulSoup import requests u="https://fr.wikipedia.org/wiki/Beautiful_Soup" soup = BeautifulSoup(requests.get(u))...

Lire la suite

BeautifulSoup

BeautifulSoup (BS4) est une bibliothèque (package) pour parser du HTML/XML. BS4 est écrit en Python. BS4 utilise par défaut le parser lxml mais vous pouvez en spécifier un autre (par exemple html5lib) D'ailleurs, si vous ne précisez pas votre parser vous...

Lire la suite
Publicité

Scraping du Web

Mon 1er post est une brève présentation de ce que sera la teneur générale de ce blog. Il s'agit avant tout de scraping du Web, c'est à dire de la collecte automatisée de données en provenance de sites Web et du traitement de ces données après analyse....

Lire la suite