Script de Python que ejecuta un proceso ETL completo sobre la lista de países por PIB nominal, tomando como fuente una captura de Wikipedia en Web Archive.
- Extracción — descarga el HTML con
requestsy parsea la tabla de países conBeautifulSoup. - Transformación — convierte el PIB de texto con comas a valor numérico con
pandas/numpy, y lo pasa de millones a miles de millones de USD (redondeado a 2 decimales). - Carga — guarda el resultado en
Countries_by_GDP.csvy en una base de datos SQLite (World_Economies.db, tablaCountries_by_GDP). - Consulta de verificación — ejecuta
SELECT * FROM Countries_by_GDP WHERE GDP_USD_billions >= 100sobre la base recién cargada. - Logging — cada etapa registra un timestamp en
etl_project_log.txtpara poder medir cuánto tarda cada paso.
etl.py— script con las funcionesextraer,transformar,cargar_a_csv,cargar_a_db,consultarylog_progress.Countries_by_GDP.csv— salida del proceso.Pipfile— dependencias del entorno.
Python · pandas · NumPy · BeautifulSoup · requests · SQLite
pip install pandas numpy beautifulsoup4 requests
python etl.py