pág. 6356
MODELO DE APRENDIZAJE PROFUNDO
PARA LA DETECCIÓN TEMPRANA DEL
RIESGO DE REPROBACIÓN EN
ASIGNATURAS DE PROGRAMACIÓN
MEDIANTE ANÁLISIS PREDICTIVO EN
EDUCACIÓN SUPERIOR

A DEEP LEARNING MODEL FOR THE EARLY DETECTION

OF THE RISK OF FAILING PROGRAMMING COURSES

THROUGH PREDICTIVE ANALYTICS IN HIGHER

EDUCATION

Samuel Martínez Ramos

Instituto Tecnológico Superior de Perote

José Antonio Contreras Flores

Instituto Tecnológico Superior de Perote

José Alfonso Lopez Gonzalez

Instituto Tecnológico Superior de Perote

José Alfonso Lopez Gonzalez

Instituto Tecnológico Superior de Perote
pág. 6357
DOI:
https://doi.org/10.37811/cl_rcm.v10i4.25585
Modelo de aprendizaje profundo para la detección temprana del riesgo de

reprobación en asignaturas de programación mediante análisis predictivo en

educación superior

Samuel Martínez Ramos
1
doc-095@itsperote.edu.mx

https://orcid.org/0009-0000-1048-4975

Instituto Tecnológico Superior de Perote

Perote, México

José Antonio Contreras Flores

doc-156@itsperote.edu.mx

https://orcid.org/0009-0004-6091-1268

Instituto Tecnológico Superior de Perote

Perote, México

José Alfonso Lopez Gonzalez

doc
-111@itsperote.edu.mx
https://orcid.org/0009-0004-3608-0302

Instituto Tecnológico Superior de Perote

Perote, México

David Medina Hernández

Sub_academica@itsperote.edu.mx

https://orcid.org/0000-0001-9873-3752

Instituto Tecnológico Superior de Perote

Perote, México

RESUMEN

La detección del riesgo de reprobación tiene un gran impacto en el rendimiento académico para la

aprobación de materias de programación y permanencia de los alumnos, lo que se convierte en un reto

prioritario para las instituciones de educación superior. Con el objetivo de contribuir a esta necesidad,

en este estudio se desarrolló un modelo de aprendizaje profundo para la detección temprana de riesgo

de reprobación. La investigación se basó en la metodología CRISP-DM, analizando variables

académicas, hábitos de estudio y factores de entorno recopilados mediante formularios digitales y

cuestionarios físicos aplicados a estudiantes de Ingeniería Informática. Con esta información se

conformó un conjunto de datos de 1,106 registros y 28 variables. El procesamiento y análisis

exploratorio se realizó con Pandas, NumPy y Matplotlib, identificando patrones y relaciones altamente

significativas. Finalmente, se alcanzó una exactitud aproximada del 99.1% en la evaluación de la red

neuronal profunda implementada con TensorFlow/Keras. Se concluye que la aplicación de minería de

datos y aprendizaje profundo fortalece las estrategias académicas y permite la generación de alertas

tempranas eficaces.

Palabras clave: aprendizaje profundo; educación superior; minería de datos; programación; riesgo de

reprobación.

1 Autor principal

Correspondencia:
doc-095@itsperote.edu.mx
pág. 6358
A deep learning model for the early detection of the risk of failing

programming courses through predictive analytics in higher education

ABSTRACT

Identifying the risk of failing a course has a significant impact on academic performance
specifically,
on students’ ability to pass programming courses and remain enrolled
which poses a major challenge
for higher education institutions. To address this ne
ed, this study developed a deep learning model for
the early detection of the risk of failing a course. This research was conducted based on the CRISP
-DM
methodology, using academic variables, study habits, and environmental factors collected via digital

f
orms and paper questionnaires administered to computer engineering students. This information was
used to train the model, forming a dataset of 1,106 records and 28 variables. Data processing and

exploratory analysis were performed using Pandas, NumPy, and
Matplotlib, identifying relevant
relationships among variables. Finally, after achieving an accuracy of approximately 99.1% in

classifying students at risk using a deep neural network implemented with TensorFlow/Keras, it was

concluded that educational ma
chine learning and data mining techniques contribute significantly to
generating early warnings and strengthening academic strategies.

Keywords:
data mining; deep learning; higher education; programming; risk of failing.
Artículo recibido
13 mayo 2026
Aceptado para publicación: 2
1 junio 2026
pág. 6359
1. INTRODUCCIÓN

En los últimos años, el crecimiento de la inteligencia artificial y del análisis de datos ha impulsado el

desarrollo de herramientas capaces de apoyar la toma de decisiones en distintos ámbitos, entre ellos la

educación superior. En este contexto, disciplinas como la Minería de Datos Educativos (Educational

Data Mining, EDM) y la Analítica del Aprendizaje (Learning Analytics) han permitido analizar grandes

volúmenes de información académica para identificar patrones de comportamiento estudiantil, predecir

el rendimiento académico y detectar oportunamente factores asociados con el riesgo de reprobación y

deserción escolar (Baker, 2022). Estas tecnologías representan una oportunidad sólida para que las

instituciones educativas implementen estrategias preventivas orientadas a mejorar el desempeño de los

estudiantes y fortalecer los procesos de permanencia escolar.

Uno de los principales desafíos que enfrentan las instituciones de educación superior con carreras de

tecnologías de la información o equivalentes, se presenta en las asignaturas de programación, las cuales

suelen registrar elevados índices de reprobación durante los primeros semestres de los programas de

ingeniería. El aprendizaje de la programación requiere el desarrollo simultáneo de habilidades lógicas,

analíticas y de resolución de problemas, además de una práctica constante y hábitos de estudio

adecuados. Diversas investigaciones señalan que el bajo rendimiento en estas asignaturas puede afectar

la trayectoria académica del estudiante, incrementar el riesgo de abandono escolar y repercutir en los

indicadores institucionales de eficiencia terminal (Guerrero Vázquez et al., 2021; García Santamaría &

Román Forastelli, 2023).

Como respuesta a esta problemática, diversos estudios han incorporado técnicas de aprendizaje

automático para estimar el desempeño académico mediante algoritmos de clasificación, árboles de

decisión, máquinas de soporte vectorial, modelos de ensamble y redes neuronales artificiales (Yağcı,

2022). En particular, los modelos basados en aprendizaje profundo (Deep Learning) han demostrado

una elevada capacidad para identificar relaciones complejas entre múltiples variables y generar

predicciones con altos niveles de precisión, incluso cuando los datos presentan comportamientos no

lineales (Géron, 2023). Estas características los convierten en una alternativa prometedora para el

desarrollo de sistemas de alerta temprana aplicados al contexto educativo.

A pesar de los avances reportados en la literatura, aún existen oportunidades para fortalecer la
pág. 6360
investigación en la predicción del riesgo de reprobación en asignaturas de programación. Una parte

importante de los trabajos publicados utiliza únicamente información proveniente de registros

institucionales o plataformas virtuales de aprendizaje, mientras que son menos frecuentes las

investigaciones que integran, dentro de un mismo modelo, variables académicas, hábitos de estudio y

factores del entorno del estudiante (Batool, 2023).

En este contexto, la presente investigación propone el desarrollo de un modelo de aprendizaje profundo

para la detección temprana del riesgo de reprobación en asignaturas de programación en educación

superior. Para ello, se empleó la metodología CRISP-DM, considerada uno de los estándares más

utilizados para el desarrollo de proyectos de minería de datos, la cual permitió estructurar las etapas de

comprensión del problema, preparación de datos, modelado, evaluación y despliegue del sistema

(Castro, 2024). El modelo fue entrenado utilizando un conjunto de datos conformado por 1,106 registros

y 28 variables, obtenidas mediante formularios digitales y cuestionarios físicos aplicados a estudiantes

de Ingeniería en Informática y complementadas con datos sintéticos generados en Python para fortalecer

el proceso de aprendizaje.

Finalmente, el modelo predictivo fue implementado mediante TensorFlow/Keras e integrado al Sistema

Inteligente para el Análisis del Riesgo de Reprobación (SIARR), desarrollado con Python y Streamlit.

La evaluación experimental mostró una exactitud aproximada del 99.1%, evidenciando el potencial de

las técnicas de aprendizaje profundo para apoyar la identificación oportuna de estudiantes con riesgo

académico. En este sentido, el objetivo de la investigación fue desarrollar y evaluar un modelo de

aprendizaje profundo para la detección temprana del riesgo de reprobación en asignaturas de

programación en educación superior, mediante el análisis predictivo de variables académicas, hábitos

de estudio y factores del entorno, integrándolo en un sistema inteligente que apoye la toma de decisiones

académicas.

2. METODOLOGÍA

La presente investigación se realizó bajo un enfoque cuantitativo, de tipo aplicado, con alcance

predictivo. Como guía se utilizó la metodología CRISP-DM (Cross Industry Standard Process for Data

Mining), estructurada en seis fases lógicas que aseguran el rigor experimental en proyectos de ciencia

de datos (Rianti et al., 2023). El flujo metodológico abarca desde la comprensión del objetivo
pág. 6361
institucional hasta el despliegue funcional en web.

Ilustración 1 Metodología CRISP-DM utilizada en el desarrollo de la investigación.

Fuente: Elaboración propia(2026).

2.1 Recolección de datos y Criterios Éticos

La información utilizada para el proceso de entrenamiento del modelo se obtuvo mediante formularios

digitales y cuestionarios físicos aplicados a estudiantes de Ingeniería en Informática del Instituto

Tecnológico Superior de Perote. El instrumento fue diseñado para recopilar variables relacionadas con

el desempeño académico previo, hábitos de estudio (horas semanales dedicadas fuera del aula) y factores

del entorno que, de acuerdo con la literatura, muestran influencia directa sobre el rendimiento

académico.

De conformidad con las directrices de publicación y ética de investigación, el estudio garantizó la

confidencialidad, privacidad y el anonimato estricto de los datos recabados, recabando el consentimiento

informado previo de los participantes. Como criterios de inclusión, se seleccionaron estudiantes

formalmente inscritos en la carrera que estuvieran cursando o hubieran cursado materias de

programación básica y avanzada; como criterio de exclusión se descartaron aquellos registros con más

del 20% de campos sin respuesta o inconsistencias severas en las variables numéricas institucionales.

2.2 Preparación del conjunto de datos

Para fortalecer el proceso de entrenamiento del modelo y mitigar sesgos de clases desbalanceadas, los

registros obtenidos fueron complementados con datos sintéticos generados mediante Python, siguiendo

criterios paramétricos y estadísticos derivados de las distribuciones reales (medias, varianzas y
pág. 6362
correlaciones). Como resultado, se conformó un conjunto robusto de 1,106 registros y 28 variables,

permitiendo disponer de una muestra representativa para el aprendizaje profundo.

Posteriormente, se efectuó la preparación del dataset mediante la limpieza de valores atípicos,

imputación de valores faltantes y codificación One-Hot para variables categóricas. Las variables

continuas fueron normalizadas utilizando escalado estándar (StandardScaler) para situar los

descriptores numéricos en un rango homogéneo que optimizara la convergencia de la red neuronal.

2.3 Análisis exploratorio de datos (EDA)

De forma previa al modelado, se realizó un análisis exploratorio empleando las bibliotecas Pandas,

NumPy y Matplotlib (Matplotlib Developers, 2025; NumPy Developers, 2025). Esta etapa permitió

analizar las medidas de tendencia central y dispersión, verificando relaciones significativas entre

descriptores clave: el promedio general, la calificación previa en matemáticas o lógica, las horas de

estudio semanales y la asistencia.

2.4 Diseño de la arquitectura del modelo

El modelo predictivo se construyó utilizando una red neuronal profunda multicapa en

TensorFlow/Keras. La arquitectura propuesta consta de:

Capa de entrada: 28 neuronas correspondientes a las características procesadas del estudiante.
Capas ocultas: Capas densamente conectadas (Dense) configuradas con la función de
activación no lineal ReLU (Rectified Linear Unit) para modelar interacciones complejas entre hábitos y

calificaciones.

Regularización: Capas Dropout para prevenir el sobreajuste (overfitting) durante la
propagación hacia atrás.

Capa de salida: Una neurona con función de activación sigmoide para emitir una probabilidad
continua del rango [0, 1] y clasificar el caso en riesgo o sin riesgo.

2.5 Entrenamiento y optimización

El conjunto de 1,106 registros se dividió aleatoriamente en un 80% para entrenamiento (884 registros)

y un 20% para prueba y evaluación independiente (222 registros). Se utilizó el optimizador Adam

gracias a su capacidad de adaptación en tasas de aprendizaje y la función de pérdida Binary

Crossentropy, registrando métricas de precisión en cada época del entrenamiento para monitorear la
pág. 6363
estabilidad general.

2.6 Evaluación del modelo

El desempeño del modelo fue evaluado mediante diferentes métricas de clasificación, entre ellas la

exactitud (accuracy), precisión (precision), sensibilidad (recall) y puntuación F1-score, además del

análisis de la matriz de confusión. Estas métricas permitieron determinar la capacidad del modelo (Ross,

2023). Asimismo, se analizó la matriz de confusión para identificar el número de clasificaciones

correctas e incorrectas realizadas por la red neuronal.

3. RESULTADOS

Con el propósito de validar la eficacia del modelo de aprendizaje profundo, se analizó inicialmente el

comportamiento de las variables de estudio y posteriormente se evaluó el desempeño cuantitativo de la

red neuronal sobre el subconjunto de prueba no visto por el algoritmo.

3.1 Hallazgos del análisis exploratorio

El análisis exploratorio corroboró empíricamente las hipótesis sobre la vulnerabilidad académica en

programación. La Figura 2 muestra la distribución de frecuencias del Promedio General segmentada por

el estatus final de rendimiento (Aprobado vs. Reprobado). Se aprecia de manera clara cómo la población

en zona de reprobación se concentra marcadamente en promedios generales inferiores a 70,

evidenciando que el rendimiento histórico es un predictor fundamental de alerta temprana.

Ilustración 2 Histograma de frecuencia de la relación entre el Promedio General y Frecuencia
absoluta.

Fuente: Elaboración propia.
pág. 6364
Asimismo, el cruce entre la dedicación al estudio autónomo y la calificación obtenida en la última

materia de programación (Figura 3) evidenció una relación positiva proporcional. Los estudiantes que

dedican menos de 3 horas de estudio a la semana fuera del aula concentran casi la totalidad de los eventos

de reprobación, mientras que dedicaciones superiores a 4 horas por semana reducen significativamente

el riesgo académico.

Ilustración 3 Grafica de frecuencia de la relación entre Horas de Estudio Semanales y la Última
Calificación.

Fuente: Elaboración propia (2026).

3.2 Evaluación y convergencia del modelo Deep Learning

El proceso de entrenamiento se ejecutó a lo largo de 50 épocas. La evolución de las curvas de pérdida

(Loss) y exactitud (Accuracy) para los conjuntos de entrenamiento y validación muestra un

comportamiento monotónico estable, sin signos perceptibles de sobreajuste o varianza excesiva (Figuras

4 y 5).
pág. 6365
Ilustración 4 Comportamiento de la pérdida(Loss).

Fuente: Elaboración propia(2026).

Ilustración 4 Exactitud (Accuracy) durante el entrenamiento.

Fuente: Elaboración propia(2026).
pág. 6366
Para cuantificar con precisión matemática el rendimiento de clasificación, se calcularon las métricas

estándares en aprendizaje supervisado (Tabla 1). El modelo logró una exactitud global (Accuracy) del

99.1%, con una precisión y sensibilidad (Recall) de 99.29%.

Tabla 1. Resumen de métricas de desempeño alcanzadas por la red neuronal profunda en el conjunto

de prueba.

Métrica de Evaluación
Resultado (%) Interpretación Práctica
Accuracy (Exactitud)
99.10 % Proporción total de predicciones
correctas sobre el conjunto de

prueba.

Precision (Precisión)
99.29 % Fiabilidad al emitir una alerta de
riesgo (mínimos falsos positivos).

Recall (Sensibilidad)
99.29 % Capacidad para detectar
efectivamente a los alumnos que

están en riesgo real.

F1-Score
99.29 % Media armónica equilibrada entre
Precisión y Sensibilidad.

Fuente: Elaboración propia(2026).

Para inspeccionar de manera granular la distribución de aciertos y errores del clasificador, se generó la

matriz de confusión sobre las predicciones finales (Figura 6). De un total de 222 observaciones en

prueba, la red identificó correctamente a 139 estudiantes en situación de riesgo y a 80 en estatus normal,

incurriendo únicamente en 2 falsos positivos y 1 falso negativo. La minimización de falsos negativos

resulta crítica en el contexto pedagógico, pues garantiza que prácticamente ningún estudiante en peligro

real sea ignorado por las acciones de tutoría.
pág. 6367
Ilustración 5 Matriz de confusión obtenida durante la evaluación del modelo.

Fuente: Elaboración propia(2026).

3.3 Integración práctica: Sistema SIARR

Para garantizar la transferencia tecnológica de estos resultados, el modelo entrenado se encapsuló y

desplegó en el Sistema Inteligente para el Análisis del Riesgo de Reprobación (SIARR), construido con

Python y la biblioteca Streamlit. El entorno web permite a coordinadores académicos y tutores cargar

registros de estudiantes, procesar la clasificación con baja latencia y visualizar de forma interactiva el

nivel de riesgo de cada alumno en tiempo real, cerrando la brecha entre la analítica teórica y la

intervención docente.

4. DISCUSIÓN

Los hallazgos de la investigación confirman de forma contundente que el uso de redes neuronales

profundas (Deep Learning) es altamente efectivo para anticipar la reprobación en carreras tecnológicas.

La exactitud de 99.1% supera el promedio de rendimiento reportado en estudios similares basados en

algoritmos lineales o árboles de decisión tradicionales, tales como los revisados por Yağcı (2022) y

Batool (2023). Esta superioridad se atribuye directamente a la capacidad de las arquitecturas densas en

Keras para capturar correlaciones no lineales complejas entre el ámbito académico de aula y las

conductas autónomas del alumno (horas de estudio, hábitos y entorno).

El desempeño observado también concuerda con las investigaciones recientes de Wen & et al. (2023) y

el estudio comparativo de Villegas-Espinoza (2025), en los que se demuestra que la minería de datos
pág. 6368
educativos alcanza su máximo potencial predictivo cuando no se limita a métricas escolares simples,

sino que incorpora dimensiones actitudinales y contextuales. La robustez técnica lograda mediante la

optimización con Adam y regularización Dropout confirma las directrices de diseño expuestas por

Géron (2023) para problemas de clasificación binaria.

Desde una perspectiva aplicada, la principal aportación de este trabajo es la integración en un entorno

funcional de usuario final (SIARR). Mientras la literatura comúnmente se detiene en las métricas de

laboratorio (Ross, 2023), este estudio demuestra que el modelo predictivo puede actuar como el motor

de una solución de software escalable capaz de guiar planes institucionales de tutorías de recuperación,

asesorías personalizadas y programas institucionales de retención de manera ágil.

5. CONCLUSIONES

El desarrollo y validación del modelo de aprendizaje profundo confirmó que es posible detectar con una

exactitud aproximada del 99.1% el riesgo de reprobación en asignaturas de programación dentro del

nivel superior. La clave metódica para lograr este nivel de precisión radica en la conjunción holística de

variables de desempeño académico con factores de hábito de estudio y entorno en un dataset equilibrado

de 1,106 observaciones.

La implementación práctica en el Sistema Inteligente para el Análisis del Riesgo de Reprobación

(SIARR) evidencia que el análisis predictivo no debe ser un esfuerzo teórico aislado, sino un instrumento

concreto para empoderar a tutores, docentes y directivos. Al identificar con un 99.29% de sensibilidad

a los estudiantes con probabilidad de reprobación, las universidades pueden activar protocolos de

intervención preventiva (como tutorías académicas o seguimiento psicopedagógico) antes de que el

alumno registre la pérdida de la asignatura o abandone la carrera.

Como líneas de trabajo futuro, se proyecta extender la recolección de información hacia otras

instituciones técnicas superiores para evaluar el desempeño y generalización del modelo multi-campus.

Asimismo, se contempla incorporar variables transaccionales de las plataformas LMS oficiales (por

ejemplo, frecuencia de accesos, tiempo de entrega de tareas y participación en foros) para robustecer en

tiempo real el motor predictivo de SIARR.
pág. 6369
REFERENCIAS BIBLIOGRÁFICAS

Baker, R. S. (2022). The state of educational data mining.
Journal of Educational Data Mining, 14(1),
3
-17.
Batool, S. R. (2023). Educational data mining to predict students' academic performance: A survey

study.
Education and Information Technologies, 28, 905-971. https://doi.org/10.1007/s10639-
022
-11152-y
Castro, M. (2024).
Despliegue de modelos predictivos bajo el estándar CRISP-DM en la educación
superior. Revista Iberoamericana de Tecnologías del Aprendizaje, 19, 45-58.

García Santamaría, C., & Román Forastelli, M. (2023). Perfil de la reprobación en las universidades

públicas en Costa Rica. Estado de la Educación.

Géron, A. (2023).
Hands-On Machine Learning with Scikit-Learn, Keras & TensorFlow (3rd ed.).
O'Reilly Media.

Guerrero Vázquez, J. A., Hernández Sierra, M. G., González Álvarez, R., Santos Jiménez Aranda, J., &

Pérez Salas, N. J. (2021). Estrategias efectivas para minimizar índices de reprobación en la

carrera de Ingeniería informática. Ciencia Latina Revista Científica Multidisciplinar, 5(4),

55115522. https://doi.org/10.37811/cl_rcm.v5i4.704

Matplotlib Developers. (2025).
Matplotlib documentation. Matplotlib. https://matplotlib.org/stable/
NumPy Developers. (2025). NumPy documentation. NumPy. https://numpy.org/

Rianti, A., Majid, N. W., & Fauzi, A. (2023). CRISP
-DM: Metodologi Proyek Data Science. Prosiding
Seminar Nasional Teknologi Informasi dan Bisnis (SENATIB), 107-114.

https://www.ojs.udb.ac.id/Senatib/article/view/3015

Ross, E. G. (2023). Evaluating prediction model performance.
ScienceDirect, 173, 723-723.
https://doi.org/10.1016/j.surg.2023.05.023

Villegas-Espinoza, A. E.-C. (2025).
Using deep learning in student performance prediction: A
systematic review.
TEM Journal, 14(3), 24722482.
Wen, X. &. (2023). Early prediction of students’ performance using a deep neural network based on

online learning activity sequence.
Applied Sciences, 15(13).
https://doi.org/10.3390/app13158933
pág. 6370
Yağcı, M. (2022). Educational data mining: Prediction of students' academic performance using

machine learning algorithms.
Smart Learning Environments, 9(11).
https://doi.org/10.1186/s40561-022-00192-z