Todos los proyectos
ListoSep 2026

Weather Trend Forecasting

Evaluación avanzada de DS de PM Accelerator — EDA en panel, pronósticos día adelante para Kyiv, anomalías y agregados geo sobre 167k+ filas de clima

Rol
Científico de datos
Stack
PythonpandasJupyterscikit-learnRidge regressionKaggle Global Weather Repository
Pronóstico en holdout para Kyiv: temperatura real frente a Ridge y ensemble

Contexto

Esta fue la evaluación técnica de científico de datos avanzado de PM Accelerator: pronosticar tendencias climáticas sobre el dataset de Kaggle Global Weather Repository, con limpieza, EDA, varios modelos, ensemble, anomalías, importancia de features, análisis ambiental y geográfico, más un video demo corto y repositorio público.

Problema

El dataset es un panel de capturas de scrape — 268 ciudades, 41 columnas, 167k+ filas — no una serie temporal única y ordenada. El brief exige usar last_updated como índice temporal y entregar análisis avanzados más allá de un solo gráfico.

Enfoque

  1. Notebook 01 — Parsear fechas, eliminar un duplicado (location_name, last_updated), documentación global IQR/QA, EDA de Kyiv (temperatura + precipitación a la hora de observación).
  2. Notebook 02 — temperature_celsius en Kyiv, split cronológico 80/20, naive / estacional-365 / Ridge con rezagos [1,2,3,7,14,28], ensemble de Ridge + naive; diagnóstico de span de rezagos para naive estacional.
  3. Notebook 03 — Anomalías robust-z e Isolation Forest, coeficientes de rezagos en Ridge, correlaciones clima–calidad del aire en Kyiv, temperaturas medias por país con filtro de países dispersos.

Resultados (holdout)

ModeloMAE (°C)RMSE (°C)
Naive2,5093,753
Naive estacional (365 filas)5,9937,528
Ridge2,4743,599
Ensemble (Ridge + naive)2,4743,653

Ridge es el mejor modelo individual en RMSE; el ensemble empata en MAE. El resultado negativo interesante es el naive estacional — documentado con deriva de hora de observación y variabilidad climática, no una falsa historia de alineación de calendario.

Artefactos

  • Repositorio en GitHub — notebooks, requirements.txt, informe PDF, diapositivas, figuras
  • Informe escrito — metodología, advertencias, limitaciones
  • Video demo — recorrido de diapositivas de 2 minutos en YouTube

Qué demuestra

Comunicación de data science de punta a punta: baselines honestos, evaluación que respeta el tiempo, métodos avanzados con fallos interpretados y artefactos reproducibles aptos para revisión — no un notebook que solo reporta el mejor número.

Puntos clave

  • 167.812 filas × 41 features en 268 ciudades tras deduplicar la clave; serie de Kyiv (863 obs) indexada por `last_updated`
  • Holdout 80/20 en orden temporal: Ridge MAE 2,474 °C / RMSE 3,599 °C — mejor modelo individual; el ensemble empata en MAE con persistencia naive muy cerca
  • Naive estacional ~6 °C de MAE documentado con honestidad: variabilidad climática + deriva de la hora de observación, no desalineación de calendario
  • Tramo avanzado: 9 anomalías robust-z, Isolation Forest (top 2 %), importancia de rezagos, correlaciones clima–calidad del aire en Kyiv, medias por país con filtro ≥100 filas
  • Notebooks 01→03 reproducibles, informe escrito, diapositivas y video demo de 2 minutos en YouTube

Retos

Resultados

  • Repositorio público en GitHub con notebooks, figuras, informe PDF y diapositivas — CSV local por términos de Kaggle
  • Historia de holdout defendible en revisión: Ridge ≈ persistencia, naive estacional como resultado negativo, ensemble como requisito avanzado
  • Documentación de nivel portafolio: informe ejecutivo, diapositivas y video de recorrido de 2 minutos

Demo

Trabajemos juntos

manuel@manuelvargas.dev

Abierto a roles de tiempo completo y a contratos freelance. Respondo en menos de 48 horas.