Weather Trend Forecasting
Evaluación avanzada de DS de PM Accelerator — EDA en panel, pronósticos día adelante para Kyiv, anomalías y agregados geo sobre 167k+ filas de clima
- Rol
- Científico de datos
- Stack
- PythonpandasJupyterscikit-learnRidge regressionKaggle Global Weather Repository

Contexto
Esta fue la evaluación técnica de científico de datos avanzado de PM Accelerator: pronosticar tendencias climáticas sobre el dataset de Kaggle Global Weather Repository, con limpieza, EDA, varios modelos, ensemble, anomalías, importancia de features, análisis ambiental y geográfico, más un video demo corto y repositorio público.
Problema
El dataset es un panel de capturas de scrape — 268 ciudades, 41 columnas, 167k+ filas — no una serie temporal única y ordenada. El brief exige usar last_updated como índice temporal y entregar análisis avanzados más allá de un solo gráfico.
Enfoque
- Notebook 01 — Parsear fechas, eliminar un duplicado
(location_name, last_updated), documentación global IQR/QA, EDA de Kyiv (temperatura + precipitación a la hora de observación). - Notebook 02 —
temperature_celsiusen Kyiv, split cronológico 80/20, naive / estacional-365 / Ridge con rezagos[1,2,3,7,14,28], ensemble de Ridge + naive; diagnóstico de span de rezagos para naive estacional. - Notebook 03 — Anomalías robust-z e Isolation Forest, coeficientes de rezagos en Ridge, correlaciones clima–calidad del aire en Kyiv, temperaturas medias por país con filtro de países dispersos.
Resultados (holdout)
| Modelo | MAE (°C) | RMSE (°C) |
|---|---|---|
| Naive | 2,509 | 3,753 |
| Naive estacional (365 filas) | 5,993 | 7,528 |
| Ridge | 2,474 | 3,599 |
| Ensemble (Ridge + naive) | 2,474 | 3,653 |
Ridge es el mejor modelo individual en RMSE; el ensemble empata en MAE. El resultado negativo interesante es el naive estacional — documentado con deriva de hora de observación y variabilidad climática, no una falsa historia de alineación de calendario.
Artefactos
- Repositorio en GitHub — notebooks,
requirements.txt, informe PDF, diapositivas, figuras - Informe escrito — metodología, advertencias, limitaciones
- Video demo — recorrido de diapositivas de 2 minutos en YouTube
Qué demuestra
Comunicación de data science de punta a punta: baselines honestos, evaluación que respeta el tiempo, métodos avanzados con fallos interpretados y artefactos reproducibles aptos para revisión — no un notebook que solo reporta el mejor número.
Puntos clave
- 167.812 filas × 41 features en 268 ciudades tras deduplicar la clave; serie de Kyiv (863 obs) indexada por `last_updated`
- Holdout 80/20 en orden temporal: Ridge MAE 2,474 °C / RMSE 3,599 °C — mejor modelo individual; el ensemble empata en MAE con persistencia naive muy cerca
- Naive estacional ~6 °C de MAE documentado con honestidad: variabilidad climática + deriva de la hora de observación, no desalineación de calendario
- Tramo avanzado: 9 anomalías robust-z, Isolation Forest (top 2 %), importancia de rezagos, correlaciones clima–calidad del aire en Kyiv, medias por país con filtro ≥100 filas
- Notebooks 01→03 reproducibles, informe escrito, diapositivas y video demo de 2 minutos en YouTube
Retos
Resultados
- Repositorio público en GitHub con notebooks, figuras, informe PDF y diapositivas — CSV local por términos de Kaggle
- Historia de holdout defendible en revisión: Ridge ≈ persistencia, naive estacional como resultado negativo, ensemble como requisito avanzado
- Documentación de nivel portafolio: informe ejecutivo, diapositivas y video de recorrido de 2 minutos