Eklablog Tous les blogs
Suivre ce blog Administration + Créer mon blog
MENU

Publicité

Top articles

  • Chercher dans l'arbre

    05 juillet 2016

    Reprenons notre exemple habituel : le site de bougies parfumées Scandles Scandles est un site marchand Wordpress qui utilise l'extension commerce Woocommerce. Supposons que nous voulions extraire de la page produit, le prix et le titre de la bougie from...

  • Modifier les éléments

    06 juillet 2016

    Je ne reviens ni sur la constitution de l'arbre par le parser lxml, ni sur la navigation dans l'arbre ni sur la recherche. J'explique ici comment modifier l'arbre à partir d'un exemple. Pour la réalisation de mon moteur de recherche de bougies parfumées,...

  • BeautifulSoup

    04 juillet 2016

    BeautifulSoup (BS4) est une bibliothèque (package) pour parser du HTML/XML. BS4 est écrit en Python. BS4 utilise par défaut le parser lxml mais vous pouvez en spécifier un autre (par exemple html5lib) D'ailleurs, si vous ne précisez pas votre parser vous...

  • Navigation dans l'arbre

    05 juillet 2016

    BeautifulSoup permet de naviguer au sein de l'arbre créé lors de l'analyse syntaxique d'un document X(HTML). Après la création de l'objet BS4 : from bs4 import BeautifulSoup import requests u="https://fr.wikipedia.org/wiki/Beautiful_Soup" soup = BeautifulSoup(requests.get(u))...

  • Scraping du Web

    01 juillet 2016

    Mon 1er post est une brève présentation de ce que sera la teneur générale de ce blog. Il s'agit avant tout de scraping du Web, c'est à dire de la collecte automatisée de données en provenance de sites Web et du traitement de ces données après analyse....