pág. 6356
MODELO DE APRENDIZAJE PROFUNDO
PARA LA DETECCIÓN TEMPRANA DEL
RIESGO DE REPROBACIÓN EN
ASIGNATURAS DE PROGRAMACIÓN
MEDIANTE ANÁLISIS PREDICTIVO EN
EDUCACIÓN SUPERIOR
A DEEP LEARNING MODEL FOR THE EARLY DETECTION
OF THE RISK OF FAILING PROGRAMMING COURSES
THROUGH PREDICTIVE ANALYTICS IN HIGHER
EDUCATION
Samuel Martínez Ramos
Instituto Tecnológico Superior de Perote
José Antonio Contreras Flores
Instituto Tecnológico Superior de Perote
José Alfonso Lopez Gonzalez
Instituto Tecnológico Superior de Perote
José Alfonso Lopez Gonzalez
Instituto Tecnológico Superior de Perote

pág. 6357
DOI: https://doi.org/10.37811/cl_rcm.v10i4.25585
Modelo de aprendizaje profundo para la detección temprana del riesgo de
reprobación en asignaturas de programación mediante análisis predictivo en
educación superior
Samuel Martínez Ramos1
doc-095@itsperote.edu.mx
https://orcid.org/0009-0000-1048-4975
Instituto Tecnológico Superior de Perote
Perote, México
José Antonio Contreras Flores
doc-156@itsperote.edu.mx
https://orcid.org/0009-0004-6091-1268
Instituto Tecnológico Superior de Perote
Perote, México
José Alfonso Lopez Gonzalez
doc-111@itsperote.edu.mx
https://orcid.org/0009-0004-3608-0302
Instituto Tecnológico Superior de Perote
Perote, México
David Medina Hernández
Sub_academica@itsperote.edu.mx
https://orcid.org/0000-0001-9873-3752
Instituto Tecnológico Superior de Perote
Perote, México
RESUMEN
La detección del riesgo de reprobación tiene un gran impacto en el rendimiento académico para la
aprobación de materias de programación y permanencia de los alumnos, lo que se convierte en un reto
prioritario para las instituciones de educación superior. Con el objetivo de contribuir a esta necesidad,
en este estudio se desarrolló un modelo de aprendizaje profundo para la detección temprana de riesgo
de reprobación. La investigación se basó en la metodología CRISP-DM, analizando variables
académicas, hábitos de estudio y factores de entorno recopilados mediante formularios digitales y
cuestionarios físicos aplicados a estudiantes de Ingeniería Informática. Con esta información se
conformó un conjunto de datos de 1,106 registros y 28 variables. El procesamiento y análisis
exploratorio se realizó con Pandas, NumPy y Matplotlib, identificando patrones y relaciones altamente
significativas. Finalmente, se alcanzó una exactitud aproximada del 99.1% en la evaluación de la red
neuronal profunda implementada con TensorFlow/Keras. Se concluye que la aplicación de minería de
datos y aprendizaje profundo fortalece las estrategias académicas y permite la generación de alertas
tempranas eficaces.
Palabras clave: aprendizaje profundo; educación superior; minería de datos; programación; riesgo de
reprobación.
1 Autor principal
Correspondencia: doc-095@itsperote.edu.mx

pág. 6358
A deep learning model for the early detection of the risk of failing
programming courses through predictive analytics in higher education
ABSTRACT
Identifying the risk of failing a course has a significant impact on academic performance—specifically,
on students’ ability to pass programming courses and remain enrolled—which poses a major challenge
for higher education institutions. To address this need, this study developed a deep learning model for
the early detection of the risk of failing a course. This research was conducted based on the CRISP-DM
methodology, using academic variables, study habits, and environmental factors collected via digital
forms and paper questionnaires administered to computer engineering students. This information was
used to train the model, forming a dataset of 1,106 records and 28 variables. Data processing and
exploratory analysis were performed using Pandas, NumPy, and Matplotlib, identifying relevant
relationships among variables. Finally, after achieving an accuracy of approximately 99.1% in
classifying students at risk using a deep neural network implemented with TensorFlow/Keras, it was
concluded that educational machine learning and data mining techniques contribute significantly to
generating early warnings and strengthening academic strategies.
Keywords: data mining; deep learning; higher education; programming; risk of failing.
Artículo recibido 13 mayo 2026
Aceptado para publicación: 21 junio 2026

pág. 6359
1. INTRODUCCIÓN
En los últimos años, el crecimiento de la inteligencia artificial y del análisis de datos ha impulsado el
desarrollo de herramientas capaces de apoyar la toma de decisiones en distintos ámbitos, entre ellos la
educación superior. En este contexto, disciplinas como la Minería de Datos Educativos (Educational
Data Mining, EDM) y la Analítica del Aprendizaje (Learning Analytics) han permitido analizar grandes
volúmenes de información académica para identificar patrones de comportamiento estudiantil, predecir
el rendimiento académico y detectar oportunamente factores asociados con el riesgo de reprobación y
deserción escolar (Baker, 2022). Estas tecnologías representan una oportunidad sólida para que las
instituciones educativas implementen estrategias preventivas orientadas a mejorar el desempeño de los
estudiantes y fortalecer los procesos de permanencia escolar.
Uno de los principales desafíos que enfrentan las instituciones de educación superior con carreras de
tecnologías de la información o equivalentes, se presenta en las asignaturas de programación, las cuales
suelen registrar elevados índices de reprobación durante los primeros semestres de los programas de
ingeniería. El aprendizaje de la programación requiere el desarrollo simultáneo de habilidades lógicas,
analíticas y de resolución de problemas, además de una práctica constante y hábitos de estudio
adecuados. Diversas investigaciones señalan que el bajo rendimiento en estas asignaturas puede afectar
la trayectoria académica del estudiante, incrementar el riesgo de abandono escolar y repercutir en los
indicadores institucionales de eficiencia terminal (Guerrero Vázquez et al., 2021; García Santamaría &
Román Forastelli, 2023).
Como respuesta a esta problemática, diversos estudios han incorporado técnicas de aprendizaje
automático para estimar el desempeño académico mediante algoritmos de clasificación, árboles de
decisión, máquinas de soporte vectorial, modelos de ensamble y redes neuronales artificiales (Yağcı,
2022). En particular, los modelos basados en aprendizaje profundo (Deep Learning) han demostrado
una elevada capacidad para identificar relaciones complejas entre múltiples variables y generar
predicciones con altos niveles de precisión, incluso cuando los datos presentan comportamientos no
lineales (Géron, 2023). Estas características los convierten en una alternativa prometedora para el
desarrollo de sistemas de alerta temprana aplicados al contexto educativo.
A pesar de los avances reportados en la literatura, aún existen oportunidades para fortalecer la

pág. 6360
investigación en la predicción del riesgo de reprobación en asignaturas de programación. Una parte
importante de los trabajos publicados utiliza únicamente información proveniente de registros
institucionales o plataformas virtuales de aprendizaje, mientras que son menos frecuentes las
investigaciones que integran, dentro de un mismo modelo, variables académicas, hábitos de estudio y
factores del entorno del estudiante (Batool, 2023).
En este contexto, la presente investigación propone el desarrollo de un modelo de aprendizaje profundo
para la detección temprana del riesgo de reprobación en asignaturas de programación en educación
superior. Para ello, se empleó la metodología CRISP-DM, considerada uno de los estándares más
utilizados para el desarrollo de proyectos de minería de datos, la cual permitió estructurar las etapas de
comprensión del problema, preparación de datos, modelado, evaluación y despliegue del sistema
(Castro, 2024). El modelo fue entrenado utilizando un conjunto de datos conformado por 1,106 registros
y 28 variables, obtenidas mediante formularios digitales y cuestionarios físicos aplicados a estudiantes
de Ingeniería en Informática y complementadas con datos sintéticos generados en Python para fortalecer
el proceso de aprendizaje.
Finalmente, el modelo predictivo fue implementado mediante TensorFlow/Keras e integrado al Sistema
Inteligente para el Análisis del Riesgo de Reprobación (SIARR), desarrollado con Python y Streamlit.
La evaluación experimental mostró una exactitud aproximada del 99.1%, evidenciando el potencial de
las técnicas de aprendizaje profundo para apoyar la identificación oportuna de estudiantes con riesgo
académico. En este sentido, el objetivo de la investigación fue desarrollar y evaluar un modelo de
aprendizaje profundo para la detección temprana del riesgo de reprobación en asignaturas de
programación en educación superior, mediante el análisis predictivo de variables académicas, hábitos
de estudio y factores del entorno, integrándolo en un sistema inteligente que apoye la toma de decisiones
académicas.
2. METODOLOGÍA
La presente investigación se realizó bajo un enfoque cuantitativo, de tipo aplicado, con alcance
predictivo. Como guía se utilizó la metodología CRISP-DM (Cross Industry Standard Process for Data
Mining), estructurada en seis fases lógicas que aseguran el rigor experimental en proyectos de ciencia
de datos (Rianti et al., 2023). El flujo metodológico abarca desde la comprensión del objetivo

pág. 6361
institucional hasta el despliegue funcional en web.
Ilustración 1 Metodología CRISP-DM utilizada en el desarrollo de la investigación.
Fuente: Elaboración propia(2026).
2.1 Recolección de datos y Criterios Éticos
La información utilizada para el proceso de entrenamiento del modelo se obtuvo mediante formularios
digitales y cuestionarios físicos aplicados a estudiantes de Ingeniería en Informática del Instituto
Tecnológico Superior de Perote. El instrumento fue diseñado para recopilar variables relacionadas con
el desempeño académico previo, hábitos de estudio (horas semanales dedicadas fuera del aula) y factores
del entorno que, de acuerdo con la literatura, muestran influencia directa sobre el rendimiento
académico.
De conformidad con las directrices de publicación y ética de investigación, el estudio garantizó la
confidencialidad, privacidad y el anonimato estricto de los datos recabados, recabando el consentimiento
informado previo de los participantes. Como criterios de inclusión, se seleccionaron estudiantes
formalmente inscritos en la carrera que estuvieran cursando o hubieran cursado materias de
programación básica y avanzada; como criterio de exclusión se descartaron aquellos registros con más
del 20% de campos sin respuesta o inconsistencias severas en las variables numéricas institucionales.
2.2 Preparación del conjunto de datos
Para fortalecer el proceso de entrenamiento del modelo y mitigar sesgos de clases desbalanceadas, los
registros obtenidos fueron complementados con datos sintéticos generados mediante Python, siguiendo
criterios paramétricos y estadísticos derivados de las distribuciones reales (medias, varianzas y

pág. 6362
correlaciones). Como resultado, se conformó un conjunto robusto de 1,106 registros y 28 variables,
permitiendo disponer de una muestra representativa para el aprendizaje profundo.
Posteriormente, se efectuó la preparación del dataset mediante la limpieza de valores atípicos,
imputación de valores faltantes y codificación One-Hot para variables categóricas. Las variables
continuas fueron normalizadas utilizando escalado estándar (StandardScaler) para situar los
descriptores numéricos en un rango homogéneo que optimizara la convergencia de la red neuronal.
2.3 Análisis exploratorio de datos (EDA)
De forma previa al modelado, se realizó un análisis exploratorio empleando las bibliotecas Pandas,
NumPy y Matplotlib (Matplotlib Developers, 2025; NumPy Developers, 2025). Esta etapa permitió
analizar las medidas de tendencia central y dispersión, verificando relaciones significativas entre
descriptores clave: el promedio general, la calificación previa en matemáticas o lógica, las horas de
estudio semanales y la asistencia.
2.4 Diseño de la arquitectura del modelo
El modelo predictivo se construyó utilizando una red neuronal profunda multicapa en
TensorFlow/Keras. La arquitectura propuesta consta de:
● Capa de entrada: 28 neuronas correspondientes a las características procesadas del estudiante.
● Capas ocultas: Capas densamente conectadas (Dense) configuradas con la función de
activación no lineal ReLU (Rectified Linear Unit) para modelar interacciones complejas entre hábitos y
calificaciones.
● Regularización: Capas Dropout para prevenir el sobreajuste (overfitting) durante la
propagación hacia atrás.
● Capa de salida: Una neurona con función de activación sigmoide para emitir una probabilidad
continua del rango [0, 1] y clasificar el caso en riesgo o sin riesgo.
2.5 Entrenamiento y optimización
El conjunto de 1,106 registros se dividió aleatoriamente en un 80% para entrenamiento (884 registros)
y un 20% para prueba y evaluación independiente (222 registros). Se utilizó el optimizador Adam
gracias a su capacidad de adaptación en tasas de aprendizaje y la función de pérdida Binary
Crossentropy, registrando métricas de precisión en cada época del entrenamiento para monitorear la

pág. 6363
estabilidad general.
2.6 Evaluación del modelo
El desempeño del modelo fue evaluado mediante diferentes métricas de clasificación, entre ellas la
exactitud (accuracy), precisión (precision), sensibilidad (recall) y puntuación F1-score, además del
análisis de la matriz de confusión. Estas métricas permitieron determinar la capacidad del modelo (Ross,
2023). Asimismo, se analizó la matriz de confusión para identificar el número de clasificaciones
correctas e incorrectas realizadas por la red neuronal.
3. RESULTADOS
Con el propósito de validar la eficacia del modelo de aprendizaje profundo, se analizó inicialmente el
comportamiento de las variables de estudio y posteriormente se evaluó el desempeño cuantitativo de la
red neuronal sobre el subconjunto de prueba no visto por el algoritmo.
3.1 Hallazgos del análisis exploratorio
El análisis exploratorio corroboró empíricamente las hipótesis sobre la vulnerabilidad académica en
programación. La Figura 2 muestra la distribución de frecuencias del Promedio General segmentada por
el estatus final de rendimiento (Aprobado vs. Reprobado). Se aprecia de manera clara cómo la población
en zona de reprobación se concentra marcadamente en promedios generales inferiores a 70,
evidenciando que el rendimiento histórico es un predictor fundamental de alerta temprana.
Ilustración 2 Histograma de frecuencia de la relación entre el Promedio General y Frecuencia
absoluta.
Fuente: Elaboración propia.
pág. 6364
Asimismo, el cruce entre la dedicación al estudio autónomo y la calificación obtenida en la última
materia de programación (Figura 3) evidenció una relación positiva proporcional. Los estudiantes que
dedican menos de 3 horas de estudio a la semana fuera del aula concentran casi la totalidad de los eventos
de reprobación, mientras que dedicaciones superiores a 4 horas por semana reducen significativamente
el riesgo académico.
Ilustración 3 Grafica de frecuencia de la relación entre Horas de Estudio Semanales y la Última
Calificación.
Fuente: Elaboración propia (2026).
3.2 Evaluación y convergencia del modelo Deep Learning
El proceso de entrenamiento se ejecutó a lo largo de 50 épocas. La evolución de las curvas de pérdida
(Loss) y exactitud (Accuracy) para los conjuntos de entrenamiento y validación muestra un
comportamiento monotónico estable, sin signos perceptibles de sobreajuste o varianza excesiva (Figuras
4 y 5).
pág. 6365
Ilustración 4 Comportamiento de la pérdida(Loss).
Fuente: Elaboración propia(2026).
Ilustración 4 Exactitud (Accuracy) durante el entrenamiento.
Fuente: Elaboración propia(2026).

pág. 6366
Para cuantificar con precisión matemática el rendimiento de clasificación, se calcularon las métricas
estándares en aprendizaje supervisado (Tabla 1). El modelo logró una exactitud global (Accuracy) del
99.1%, con una precisión y sensibilidad (Recall) de 99.29%.
Tabla 1. Resumen de métricas de desempeño alcanzadas por la red neuronal profunda en el conjunto
de prueba.
Métrica de Evaluación Resultado (%) Interpretación Práctica
Accuracy (Exactitud) 99.10 % Proporción total de predicciones
correctas sobre el conjunto de
prueba.
Precision (Precisión) 99.29 % Fiabilidad al emitir una alerta de
riesgo (mínimos falsos positivos).
Recall (Sensibilidad) 99.29 % Capacidad para detectar
efectivamente a los alumnos que
están en riesgo real.
F1-Score 99.29 % Media armónica equilibrada entre
Precisión y Sensibilidad.
Fuente: Elaboración propia(2026).
Para inspeccionar de manera granular la distribución de aciertos y errores del clasificador, se generó la
matriz de confusión sobre las predicciones finales (Figura 6). De un total de 222 observaciones en
prueba, la red identificó correctamente a 139 estudiantes en situación de riesgo y a 80 en estatus normal,
incurriendo únicamente en 2 falsos positivos y 1 falso negativo. La minimización de falsos negativos
resulta crítica en el contexto pedagógico, pues garantiza que prácticamente ningún estudiante en peligro
real sea ignorado por las acciones de tutoría.

pág. 6367
Ilustración 5 Matriz de confusión obtenida durante la evaluación del modelo.
Fuente: Elaboración propia(2026).
3.3 Integración práctica: Sistema SIARR
Para garantizar la transferencia tecnológica de estos resultados, el modelo entrenado se encapsuló y
desplegó en el Sistema Inteligente para el Análisis del Riesgo de Reprobación (SIARR), construido con
Python y la biblioteca Streamlit. El entorno web permite a coordinadores académicos y tutores cargar
registros de estudiantes, procesar la clasificación con baja latencia y visualizar de forma interactiva el
nivel de riesgo de cada alumno en tiempo real, cerrando la brecha entre la analítica teórica y la
intervención docente.
4. DISCUSIÓN
Los hallazgos de la investigación confirman de forma contundente que el uso de redes neuronales
profundas (Deep Learning) es altamente efectivo para anticipar la reprobación en carreras tecnológicas.
La exactitud de 99.1% supera el promedio de rendimiento reportado en estudios similares basados en
algoritmos lineales o árboles de decisión tradicionales, tales como los revisados por Yağcı (2022) y
Batool (2023). Esta superioridad se atribuye directamente a la capacidad de las arquitecturas densas en
Keras para capturar correlaciones no lineales complejas entre el ámbito académico de aula y las
conductas autónomas del alumno (horas de estudio, hábitos y entorno).
El desempeño observado también concuerda con las investigaciones recientes de Wen & et al. (2023) y
el estudio comparativo de Villegas-Espinoza (2025), en los que se demuestra que la minería de datos

pág. 6368
educativos alcanza su máximo potencial predictivo cuando no se limita a métricas escolares simples,
sino que incorpora dimensiones actitudinales y contextuales. La robustez técnica lograda mediante la
optimización con Adam y regularización Dropout confirma las directrices de diseño expuestas por
Géron (2023) para problemas de clasificación binaria.
Desde una perspectiva aplicada, la principal aportación de este trabajo es la integración en un entorno
funcional de usuario final (SIARR). Mientras la literatura comúnmente se detiene en las métricas de
laboratorio (Ross, 2023), este estudio demuestra que el modelo predictivo puede actuar como el motor
de una solución de software escalable capaz de guiar planes institucionales de tutorías de recuperación,
asesorías personalizadas y programas institucionales de retención de manera ágil.
5. CONCLUSIONES
El desarrollo y validación del modelo de aprendizaje profundo confirmó que es posible detectar con una
exactitud aproximada del 99.1% el riesgo de reprobación en asignaturas de programación dentro del
nivel superior. La clave metódica para lograr este nivel de precisión radica en la conjunción holística de
variables de desempeño académico con factores de hábito de estudio y entorno en un dataset equilibrado
de 1,106 observaciones.
La implementación práctica en el Sistema Inteligente para el Análisis del Riesgo de Reprobación
(SIARR) evidencia que el análisis predictivo no debe ser un esfuerzo teórico aislado, sino un instrumento
concreto para empoderar a tutores, docentes y directivos. Al identificar con un 99.29% de sensibilidad
a los estudiantes con probabilidad de reprobación, las universidades pueden activar protocolos de
intervención preventiva (como tutorías académicas o seguimiento psicopedagógico) antes de que el
alumno registre la pérdida de la asignatura o abandone la carrera.
Como líneas de trabajo futuro, se proyecta extender la recolección de información hacia otras
instituciones técnicas superiores para evaluar el desempeño y generalización del modelo multi-campus.
Asimismo, se contempla incorporar variables transaccionales de las plataformas LMS oficiales (por
ejemplo, frecuencia de accesos, tiempo de entrega de tareas y participación en foros) para robustecer en
tiempo real el motor predictivo de SIARR.

pág. 6369
REFERENCIAS BIBLIOGRÁFICAS
Baker, R. S. (2022). The state of educational data mining. Journal of Educational Data Mining, 14(1),
3-17.
Batool, S. R. (2023). Educational data mining to predict students' academic performance: A survey
study. Education and Information Technologies, 28, 905-971. https://doi.org/10.1007/s10639-
022-11152-y
Castro, M. (2024). Despliegue de modelos predictivos bajo el estándar CRISP-DM en la educación
superior. Revista Iberoamericana de Tecnologías del Aprendizaje, 19, 45-58.
García Santamaría, C., & Román Forastelli, M. (2023). Perfil de la reprobación en las universidades
públicas en Costa Rica. Estado de la Educación.
Géron, A. (2023). Hands-On Machine Learning with Scikit-Learn, Keras & TensorFlow (3rd ed.).
O'Reilly Media.
Guerrero Vázquez, J. A., Hernández Sierra, M. G., González Álvarez, R., Santos Jiménez Aranda, J., &
Pérez Salas, N. J. (2021). Estrategias efectivas para minimizar índices de reprobación en la
carrera de Ingeniería informática. Ciencia Latina Revista Científica Multidisciplinar, 5(4),
5511–5522. https://doi.org/10.37811/cl_rcm.v5i4.704
Matplotlib Developers. (2025). Matplotlib documentation. Matplotlib. https://matplotlib.org/stable/
NumPy Developers. (2025). NumPy documentation. NumPy. https://numpy.org/
Rianti, A., Majid, N. W., & Fauzi, A. (2023). CRISP-DM: Metodologi Proyek Data Science. Prosiding
Seminar Nasional Teknologi Informasi dan Bisnis (SENATIB), 107-114.
https://www.ojs.udb.ac.id/Senatib/article/view/3015
Ross, E. G. (2023). Evaluating prediction model performance. ScienceDirect, 173, 723-723.
https://doi.org/10.1016/j.surg.2023.05.023
Villegas-Espinoza, A. E.-C. (2025). Using deep learning in student performance prediction: A
systematic review. TEM Journal, 14(3), 2472–2482.
Wen, X. &. (2023). Early prediction of students’ performance using a deep neural network based on
online learning activity sequence. Applied Sciences, 15(13).
https://doi.org/10.3390/app13158933
pág. 6370
Yağcı, M. (2022). Educational data mining: Prediction of students' academic performance using
machine learning algorithms. Smart Learning Environments, 9(11).
https://doi.org/10.1186/s40561-022-00192-z