Application de collecte de données sur deux sites, avec nettoyage, stockage SQLite et interface Streamlit.
- Books to Scrape : https://books.toscrape.com/catalogue/page-1.html
- Gaaraas (Dakar Auto) : https://www.gaaraas.com/fr/users/dakar-auto?page=1
- Selenium (scraping coding, sans BeautifulSoup)
- Web Scraper (extension Chrome) pour les données brutes
- SQLite
- Streamlit + Plotly
- Formulaires d'évaluation : KoboToolbox et Google Forms
python -m venv .venv
.venv\Scripts\activate
pip install -r requirements.txt
python -m streamlit run app.pyChrome est nécessaire pour Selenium.
Les données Selenium déjà collectées sont dans data/data.db. Pour tout rescraper en local : python scripts/run_full_scrape.py.
app.py
scrapers/ # Selenium (books et gaaraas)
cleaning/ # nettoyage des variables
db/ # base SQLite
data/raw/ # CSV exportés avec Web Scraper
data/webscraper_sitemaps/
scripts/
- Scraping multi-pages (données nettoyées enregistrées en SQL)
- Dashboard sur les données Selenium
- Téléchargement / dépôt des CSV bruts Web Scraper
- Accès aux deux formulaires d'évaluation
Fichier data/data.db :
books: titre, prix, disponibilite, nb_produits_page, note, nb_reviews, description, categorie, tax, scraped_atcars: marque, modele, annee, prix, kilometrage, boite, region, scraped_at
Les sitemaps sont dans data/webscraper_sitemaps/.
Les CSV bruts sont placés dans data/raw/ et disponibles dans l'application.
Liens KoboToolbox et Google Forms configurés dans .streamlit/secrets.toml (voir secrets.toml.example), accessibles depuis l'onglet Évaluation de l'app.
Application en ligne : https://collectis.streamlit.app/
Déployée sur Streamlit Community Cloud à partir du dépôt GitHub.
Les secrets KOBO_FORM_URL et GOOGLE_FORM_URL sont renseignés dans les paramètres de l'app.