Este proyecto aborda el problema del abandono académico en educación superior mediante el uso de técnicas de aprendizaje automático supervisado, específicamente el algoritmo K-Nearest Neighbors (KNN).
Se desarrollan dos modelos principales:
- Clasificación binaria: Predicción del riesgo de deserción estudiantil.
- Regresión: Estimación del promedio académico final del estudiante.
El enfoque integra un flujo completo de ciencia de datos, desde el análisis exploratorio hasta la evaluación rigurosa de modelos, con énfasis en interpretabilidad y aplicación en contextos reales.
- Cristian Camilo Linero Cantillo (https://github.com/cristianclc)
- David Ricardo Marquez Luna (https://github.com/DAVIDML2005)
- Nombre: Predict Students’ Dropout and Academic Success
- Fuente: UCI Machine Learning Repository
- ID: 697
- Origen: Institución de educación superior en Portugal
- Enlace: https://archive.ics.uci.edu/dataset/697/predict+students+dropout+and+academic+success
Desarrollar modelos predictivos utilizando KNN para identificar estudiantes en riesgo de abandono y estimar su rendimiento académico.
- Realizar análisis exploratorio de datos (EDA)
- Preprocesar datos (encoding, escalado, limpieza)
- Aplicar selección de características
- Implementar modelos KNN para:
- Clasificación
- Regresión
- Optimizar hiperparámetro
kmanualmente - Evaluar desempeño de los modelos
- Analizar variables más influyentes
El proyecto sigue una estructura clara:
- Análisis Exploratorio (EDA)
- Preprocesamiento
- One-Hot Encoding
- Escalado con
RobustScaler
- Selección de Características
- Chi-cuadrado
- Kruskal-Wallis
- Modelado con KNN
- Optimización de
k - Evaluación
- Interpretación de resultados