Chatbots basados en Retrieval-Augmented Generation (RAG) para el seguimiento y apoyo del progreso académico de estudiantes en instituciones educativas: una revisión sistemática de la literatura

Resumen

Los sistemas basados en Generación Aumentada por Recuperación (RAG) prometen reducir las alucinaciones de los grandes modelos de lenguaje al anclar sus respuestas en fuentes verificadas, lo que los convierte en candidatos para el acompañamiento de estudiantes en riesgo académico; sin embargo, la evidencia sobre su uso en el seguimiento institucional del riesgo permanece dispersa. Esta revisión sistemática, conducida según las directrices PRISMA sobre ocho bases de datos, identificó 135 estudios publicados entre 2020 y 2026, de los cuales 100 cumplieron los criterios de inclusión, y se complementó con un análisis cienciométrico de la producción. Los resultados muestran un corpus de formación reciente —dos tercios de los estudios corresponden al periodo 2025-2026— y una bifurcación entre dos literaturas que apenas se citan entre sí: la analítica predictiva del riesgo, activa desde 2020, y la inteligencia artificial conversacional, cuyas implementaciones RAG no aparecen antes de 2024 y alcanzan el 38% del corpus. Ambas tradiciones emplean familias de métricas disjuntas: ningún estudio evalúa de forma conjunta la precisión predictiva del riesgo y la fiabilidad del chatbot, y los repertorios de mitigación —tratamiento del desbalance de clases y control del texto generativo— no conviven en ningún diseño. Se concluye que no existe todavía una arquitectura híbrida que acople la predicción del riesgo con la generación aumentada por recuperación, y se propone una agenda centrada en el diseño de dichas arquitecturas, la construcción de marcos de evaluación conjunta y la combinación de ambos repertorios de mitigación bajo supervisión docente.

Palabras clave: generación aumentada por recuperación; chatbots educativos; riesgo académico; grandes modelos de lenguaje; alucinaciones; revisión sistemática

Introducción

Las instituciones de educación enfrentan el reto constante de mejorar la retención y el éxito estudiantil, reconociendo que actualmente "tienen medios sin precedentes para recopilar y almacenar digitalmente la huella de comportamiento dejada por los estudiantes al interactuar con diferentes sistemas" (Santos & Henriques, 2023). En estos entornos educativos, los datos de interacción que registran los sistemas de gestión del aprendizaje (LMS) se han convertido en el insumo principal para identificar tempranamente a los estudiantes en riesgo en la educación superior  (Chiu et al., 2026; Osborne & Lang, 2023), y su articulación con técnicas de inteligencia artificial ha impulsado el desarrollo del aprendizaje personalizado (Gong et al., 2025). Entre las herramientas emergentes destacan los asistentes virtuales, ya que "los avances en los Grandes Modelos de Lenguaje (LLMs) han permitido el desarrollo de herramientas educativas inteligentes que apoyan el aprendizaje basado en la investigación" (Zhao et al., 2025).

Ante este escenario, si bien la IA predictiva ha sido útil, la alucinación constituye la principal barrera para la adopción de chatbots basados en LLM en el ámbito educativo (Swacha & Gracel, 2025), lo que representa un riesgo crítico que explota directamente la vulnerabilidad académica del estudiante. Para mitigar este problema, la arquitectura Retrieval-Augmented Generation (RAG) se ha posicionado como el estándar tecnológico ideal, ya que permite anclar las respuestas en recursos verificados del propio curso —diapositivas, apuntes y materiales de laboratorio— y citar la fuente en cada respuesta, de modo que el estudiante pueda verificarla (Seshadri et al., 2026). No obstante, su adopción enfrenta desafíos importantes. Las instituciones necesitan diseñar sistemas donde la tecnología actúe estrictamente como "tutor, no como solucionador" (B. Li et al., 2026), para evitar la dependencia cognitiva, y requieren implementar estrategias que salvaguarden "los desafíos éticos en la toma de decisiones de la IA, como la falta de transparencia, explicabilidad y equidad" (Ra et al., 2025).

Esta doble condición —una analítica predictiva madura pero pasiva y una IA generativa potente pero propensa a la alucinación— no es simultánea, sino sucesiva. La línea de vida del campo (Figura 1) muestra tres momentos claramente diferenciados. La analítica predictiva del riesgo académico se consolida desde (Bañeres et al., 2020), y mantiene una producción constante hasta 2026. La IA conversacional aplicada a la educación irrumpe recién en 2023 con (Osborne & Lang, 2023), y la arquitectura RAG no registra implementaciones reales antes de 2024: los primeros cinco estudios (Alsafari et al., 2024; Demartini et al., 2024; Sajeev et al., 2024; Thway et al., 2024; Vidivelli et al., 2024) marcan la bisagra, seguidos por una expansión abrupta en 2025 y 2026 hasta alcanzar 51 estudios (38% del corpus). Solo a partir de 2025 la fiabilidad y la alucinación aparecen como problema de partida, y únicamente en nueve estudios. El dato relevante para esta revisión no es la cronología en sí, sino que la irrupción generativa no reemplazó a la analítica predictiva: ambas literaturas corren en paralelo y apenas se citan entre sí, lo que explica por qué el seguimiento del riesgo y la conversación asistida siguen resolviéndose en sistemas separados.

Figura 1. Línea de vida del campo (2020-2026): emergencia sucesiva de la analítica predictiva del riesgo, la IA conversacional y la arquitectura RAG. Elaboración propia a partir del corpus (n = 135).

Aunque la literatura aborda extensamente la analítica de datos a través de modelos predictivos tradicionales (Balaji et al., 2021), la evidencia empírica acerca de la efectividad de las arquitecturas generativas RAG para la intervención y el apoyo directo en entornos académicos continúa siendo limitada y dispersa. En consecuencia, esta revisión sistemática tiene como objetivo analizar la evidencia científica disponible sobre la implementación de chatbots basados en RAG para el seguimiento y apoyo del progreso académico de estudiantes en instituciones de educación superior. Para ello, se plantearon las siguientes preguntas de investigación: RQ1 ¿Qué propósitos educativos principales cumplen los sistemas que integran chatbots RAG?

RQ2 ¿Qué modelos de lenguaje (LLMs) son los más utilizados en el diseño de sistemas de seguimiento estudiantil?

RQ3 ¿Qué arquitecturas RAG o Agentes RAG son los más utilizados en el diseño de sistemas de seguimiento estudiantil?

RQ4 ¿Qué estrategias metodológicas emplean los estudios para mitigar los desafíos técnicos en el ámbito educativo?

RQ5 ¿Cuáles son las métricas utilizadas para evaluar la precisión de riesgo escolar y la fiabilidad de los chatbots educativos? La investigación se desarrolló mediante una revisión sistemática de literatura siguiendo las directrices PRISMA, complementada con un análisis cualitativo de publicaciones indexadas.

Los hallazgos buscan aportar evidencia para apoyar la toma de decisiones de directivos, docentes y especialistas de TI, conscientes de que el éxito de estas herramientas requiere un diseño pedagógico basado en la colaboración entre el docente y el agente, en el que la IA amplíe la práctica pedagógica sin desplazar el criterio del educador (Chen, 2025). El artículo se organiza presentando en la sección 1 la metodología, en la sección 2 los resultados, en la sección 3 la discusión y en la sección 4 las conclusiones. 

1 Metodología

La presente revisión sistemática de la literatura (SLR) se orientó a identificar y analizar las investigaciones relacionadas con el uso de chatbots basados en Retrieval-Augmented Generation (RAG) para el seguimiento y apoyo del progreso académico de estudiantes en instituciones educativas, siguiendo los lineamientos establecidos por la metodología PRISMA 2020. La revisión permitió sintetizar la evidencia científica sobre las arquitecturas empleadas, los enfoques de inteligencia artificial implementados, las fuentes de datos utilizadas y los principales beneficios, limitaciones y desafíos reportados en la literatura. 

1.1    Diseño de investigación

El estudio adoptó un enfoque de revisión sistemática empleando metodologías estructuradas (como PICOC y PRISMA), basado en la recopilación, clasificación y evaluación crítica de artículos científicos relacionados con la inteligencia artificial, el aprendizaje automático y la Generación Aumentada por Recuperación (RAG), sintetizando evidencia de instituciones de educación superior. El propósito es integrar dos frentes: aprovechar el análisis de datos para predecir el rendimiento y prevenir el abandono escolar, y desarrollar sistemas de aprendizaje interactivo mediante asistentes virtuales. La investigación se estructuró en torno a cuatro preguntas científicas:

RQ1: ¿Qué propósitos educativos principales cumplen los sistemas que integran chatbots RAG?

RQ2: ¿Qué modelos de lenguaje (LLMs) son los más utilizados en el diseño de sistemas de seguimiento estudiantil?

RQ3: ¿Qué arquitecturas RAG o Agentes RAG son los más utilizados en el diseño de sistemas de seguimiento estudiantil?

RQ4: ¿Qué estrategias metodológicas emplean los estudios para mitigar los desafíos técnicos en el ámbito educativo?

RQ5: ¿Cuáles son las métricas utilizadas para evaluar la precisión de riesgo escolar y la fiabilidad de los chatbots educativos?

1.2  Periodo de ejecución

La investigación fue desarrollada durante el mes de julio de 2026, abarcando las etapas correlativas de definición del problema; diseño de cadenas de búsqueda; recuperación de artículos; aplicación de criterios de inclusión/exclusión; evaluación de calidad; extracción/organización de datos; análisis cualitativo/cienciométrico; y validación del artículo final.

Figura 2. Diagrama PRISMA del proceso de selección de estudios.
 

1.3  Estrategia de búsqueda

La búsqueda bibliográfica se realizó durante el mes de julio de 2026 en ocho bases de datos científicas indexadas: Scopus, IEEE Xplore, ACM Digital Library, ScienceDirect, SpringerLink, Frontiers, MDPI y arXiv. Se consideraron publicaciones en idioma inglés y español relacionadas con chatbots basados en Retrieval-Augmented Generation (RAG) para el seguimiento y apoyo del progreso académico de estudiantes en instituciones educativas. Para la identificación de los estudios relevantes, se diseñaron cadenas de búsqueda de alta precisión adaptadas a la sintaxis y características de cada base de datos, con el propósito de maximizar la recuperación de investigaciones pertinentes y minimizar la obtención de resultados no relacionados (Tabla 1).

Tabla 1 – Cadenas de búsqueda utilizadas en la revisión

Base de datos

Cadena de búsqueda

Scopus

TITLE-ABS-KEY ( ("RAG" OR "Retrieval-Augmented Generation" OR "AI agent*" OR "chatbot*") AND ("at-risk" OR "academic risk" OR "dropout") AND ("education*" OR "higher education" OR "university") )

IEEE Xplore

("at-risk" OR "academic risk" OR "dropout") AND ("RAG" OR "Retrieval-Augmented Generation" OR "AI agents" OR "chatbot") AND ("education" OR "learning management system" OR "LMS")

ACM Digital Library

(Abstract:"at-risk" OR Abstract:"academic risk" OR Abstract:"dropout") AND (Abstract:"RAG" OR Abstract:"Retrieval-Augmented Generation" OR Abstract:"chatbot") AND (Abstract:"education" OR Abstract:"higher education")

ScienceDirect

("at-risk students" OR "academic risk" OR "dropout") AND ("RAG" OR "Retrieval-Augmented Generation" OR "AI agents" OR "chatbot") AND ("Education" OR "Learning Management System" OR "LMS")

Springer

("at-risk students" OR "prediction of academic risk" OR "dropout") AND ("RAG" OR "Retrieval-Augmented Generation" OR "AI agents" OR "chatbot") AND ("Education" OR "Learning Management System")

Frontiers

("at-risk" OR "academic risk" OR "dropout") AND ("RAG" OR "Retrieval-Augmented Generation" OR "chatbot" OR "AI agent*") AND ("education" OR "university" OR "higher education")

MDPI

("at-risk" OR "academic risk" OR "dropout") AND ("RAG" OR "Retrieval-Augmented Generation" OR "chatbot") AND ("education" OR "higher education")

arXiv

("at-risk" OR "academic risk" OR "dropout") AND ("RAG" OR "Retrieval-Augmented Generation" OR "chatbot" OR "AI agent") AND ("education" OR "learning management system" OR "LMS")

1.4  Criterios de inclusión y exclusión

Los criterios de inclusión abarcaron estudios científicos primarios (empíricos) publicados entre los años 2020 y 2026, redactados en idioma inglés o español, y relacionados con la implementación de chatbots basados en Retrieval-Augmented Generation (RAG), inteligencia artificial generativa o agentes inteligentes aplicados al ámbito educativo. Se incluyeron investigaciones desarrolladas en instituciones educativas de cualquier nivel (educación básica, secundaria, bachillerato o superior) cuya población de estudio estuviera conformada por estudiantes y que abordaran el seguimiento y apoyo del progreso académico, la detección temprana de estudiantes en riesgo, la tutoría inteligente, el aprendizaje personalizado o la generación de recomendaciones académicas. Asimismo, se consideró indispensable que los trabajos describieran claramente la arquitectura o metodología del sistema propuesto, presentaran resultados experimentales o métricas de evaluación objetivas para valorar su desempeño y contaran con acceso al texto completo. De manera complementaria, se identificaron revisiones de literatura y otros estudios secundarios, los cuales fueron considerados únicamente como literatura de apoyo para el marco teórico y la discusión, pero excluidos de la extracción de datos.

Por otro lado, los criterios de exclusión comprendieron publicaciones anteriores al año 2020 o redactadas en idiomas distintos al inglés y español; así como investigaciones desarrolladas en sectores no académicos (como la atención al cliente comercial, capacitación corporativa en empresas o asistencia médica) o trabajos cuya población objetivo no correspondiera a estudiantes. También se descartaron estudios centrados exclusivamente en metodologías pedagógicas o herramientas digitales convencionales (LMS tradicionales) sin incorporar tecnologías de inteligencia artificial o arquitectura RAG orientadas al apoyo del aprendizaje. Finalmente, se excluyeron investigaciones puramente teóricas que no describieran la arquitectura ni el funcionamiento del sistema propuesto, artículos que no reportaran resultados experimentales ni métricas de evaluación, documentos duplicados, resúmenes cortos (short papers) y publicaciones sin acceso al texto completo.

1.5  Proceso de selección (PRISMA)

Siguiendo las cuatro etapas de la declaración PRISMA 2020, en la fase de identificación se recuperaron un total de 266 registros provenientes de las bases de datos Scopus, IEEE Xplore, ACM Digital Library, ScienceDirect, SpringerLink, Frontiers, MDPI y arXiv. Posteriormente, se eliminaron 51 registros duplicados, obteniéndose 215 estudios únicos para el proceso de cribado. Durante esta etapa, se revisaron los títulos y resúmenes con el propósito de evaluar su pertinencia respecto al objetivo de la investigación, excluyéndose 80 estudios que no abordaban el uso de chatbots basados en inteligencia artificial, el seguimiento del progreso académico, o que claramente no cumplían con los criterios de inclusión establecidos.

En la fase de elegibilidad, se procedió a la lectura a texto completo de los 135 artículos restantes, aplicando rigurosamente los criterios de inclusión y exclusión definidos. Esto dio lugar a la exclusión de 35 estudios por razones como: falta de rigor empírico, no describir la arquitectura del sistema propuesto, desarrollarse en sectores no académicos (fuera del contexto educativo) o no responder a las preguntas de investigación. Finalmente, se incluyeron 100 artículos científicos primarios para el análisis cualitativo y cienciométrico de la revisión, los cuales constituyeron la base documental para responder a las preguntas de investigación planteadas.

1.6  Extracción de datos

La gestión de la información bibliográfica se organizó mediante los programas Zotero y Microsoft Excel. Para cada uno de los 100 estudios finales seleccionados, se diseñó una matriz de extracción en la que se registraron variables clave orientadas a dar respuesta a las preguntas de investigación. Estas variables incluyeron: datos de los autores y año de publicación, contexto educativo (nivel de la institución), metodologías aplicadas, tipos de datos académicos utilizados, arquitectura técnica de los chatbots basados en Retrieval-Augmented Generation (RAG), resultados experimentales, métricas de evaluación y las principales limitaciones reportadas. La rigurosa sistematización de esta información permitió identificar tendencias, patrones de implementación y futuras oportunidades de investigación sobre el uso de chatbots RAG para el seguimiento y apoyo del progreso académico en las instituciones educativas.

1.7   Técnica de análisis

Se aplicó una estrategia de análisis temático y comparativo. Los estudios fueron clasificados de acuerdo con cuatro categorías principales: tipos de datos académicos utilizados, metodologías y marcos de trabajo implementados, arquitecturas de chatbots basados en Retrieval-Augmented Generation (RAG) y estrategias para garantizar la calidad de los datos académicos. Posteriormente, se compararon los resultados, metodologías, enfoques y evidencias reportadas por los diferentes autores con el objetivo de identificar tendencias, coincidencias, diferencias y oportunidades de investigación en el desarrollo de chatbots RAG para el seguimiento y apoyo del progreso académico en instituciones educativas.

1.8  Análisis cienciométrico

Con el fin de complementar la revisión sistemática, se realizó un análisis cienciométrico orientado a caracterizar la cantidad y la calidad de la producción científica del corpus. Los metadatos de los estudios incluidos se exportaron desde Zotero a una hoja de cálculo (cienciometrico-ultimo.xlsx) y se procesaron en Python 3 sobre el entorno Google Colab. La lectura y depuración de los datos se efectuó con la librería pandas (función read_excel); los conteos de frecuencia se obtuvieron mediante value_counts sobre los campos Revista, Universidad, País y Año. El campo Año se convirtió a valor numérico con pd.to_numeric (parámetro errors='coerce') y se descartaron los registros sin año identificable antes de construir la serie temporal. Las visualizaciones se generaron con matplotlib y seaborn: gráficos de barras horizontales (sns.barplot) para las veinte fuentes y las veinte instituciones más productivas (Figuras 6 y 8), y un gráfico de líneas (sns.lineplot) para la evolución anual de las publicaciones (Figura 3). La distribución por países se representó mediante conteos de frecuencia sobre el campo País (Figuras 4 y 7). Para el análisis léxico de los títulos (Figura 5) se aplicó una normalización previa con expresiones regulares, eliminando caracteres no alfabéticos y convirtiendo el texto a minúsculas. Se depuraron las palabras vacías mediante los diccionarios de stopwords de NLTK en español e inglés, ampliados con términos de alta frecuencia y escaso valor discriminante en este dominio (using, based, study, analysis). La nube de palabras se construyó con la librería wordcloud, desactivando la detección de colocaciones (collocations=False) para que el tamaño de cada término refleje exclusivamente su frecuencia absoluta de aparición y no la de bigramas compuestos. La calidad de las publicaciones se evaluó mediante el cuartil de la fuente en SCImago Journal Rank (SJR), consultado en el portal scimagojr.com para cada revista del corpus y registrado bajo el criterio de mejor cuartil (best quartile) del año de publicación. Las fuentes sin cuartil asignable —repositorios, servidores de preprints y actas de congreso— se clasificaron en una categoría independiente ('sin indexación SJR') y se reportan por separado para no sesgar la distribución.

(Figura 3). La distribución por países se representó mediante conteos de frecuencia sobre el campo País (Figuras 4 y 7)

El gráfico ilustra la evolución anual del número de publicaciones entre los años 2020 y 2026. Durante el periodo inicial (2020-2023), el volumen se mantuvo bajo y relativamente estable, oscilando entre 2 y 7 publicaciones anuales. A partir de 2024 (14 publicaciones) comenzó una fase de crecimiento que culminó con un pico máximo histórico en 2025, superando las 40 publicaciones. Finalmente, en 2026 se observa un descenso a 24 publicaciones, aunque la cifra se mantiene significativamente por encima de los niveles previos a 2024.

1.8.1. Distribución por países e instituciones Los estudios identificados provienen principalmente de:

Figura 4 – Distribución de publicaciones por países El mapa ilustra la distribución global de la producción científica incluida en esta revisión, evidenciando que el estudio e implementación de esta tecnología es un fenómeno de alcance internacional, aunque con concentraciones regionales claramente definidas.

1.8.2. Análisis de frecuencia léxica de los títulos

Figura 5 – Nube de palabras: términos más frecuentes en los títulos del corpus

Presenta el análisis léxico de los títulos de los 100 artículos incluidos en la revisión: el tamaño de cada término es proporcional a su frecuencia absoluta de aparición, una vez depuradas las palabras vacías. Conviene precisar que se trata de un recuento de frecuencia y no de un análisis de co-ocurrencia, por lo que la figura no expresa relaciones ni centralidad entre términos.

1.8.3. Análisis de las principales fuentes de publicación

Figura 6. Revistas o fuentes con mayor número de artículos

El gráfico detalla el 'Top 20 Revistas con Más Publicaciones', mostrando la distribución de los artículos en las fuentes más frecuentes. La revista Applied Sciences lidera significativamente con un total de 6 publicaciones, seguida por Scientific Reports con 4. El tercer lugar es compartido por el International Journal of Educational Technology in Higher Education y fuentes catalogadas como 'No disponible', ambas con 3 publicaciones

1.8.4. Distribución geográfica de las publicaciones

Figura 7. Distribución geográfica de los artículos incluidos.

La Figura muestra la distribución geográfica de las publicaciones analizadas. Se observa una mayor concentración de estudios en India, seguida por China, mientras que otros países presentan una menor representación.

1.8.5. Productividad científica por afiliación institucional

Figura 8. Universidades con mayor número de artículos.

El análisis de las afiliaciones universitarias revela una producción científica altamente descentralizada. A diferencia de las revistas, donde se observaba cierta concentración, el origen institucional es sumamente fragmentado. Solo tres entidades logran superar la marca de una publicación: Nanyang Technological University (3), RWTH Aachen University (2) y Mayo Clinic (2). El hecho de que el 85% de este 'Top 20' esté compuesto por instituciones con un solo artículo sugiere un esfuerzo investigativo global y diversificado, sin un núcleo institucional que domine de forma absoluta la temática.


1.8.6. Autores con mayor índice de colaboración científica

Figura 9. Grupos de autores más recurrentes en los artículos incluidos.

Se observa una red de colaboración científica bastante limitada en el corpus analizado. Únicamente tres autores (Santos & Henriques, 2023; J. Zhang, 2025) alcanzan el valor máximo registrado, con un grado de 2 coautores. Los 17 perfiles restantes que conforman este top 20 presentan un grado de colaboración de 1. Esto indica una fuerte tendencia hacia publicaciones elaboradas en solitario o en binomios aislados.


2. Resultados

La aplicación del protocolo metodológico permitió estructurar los hallazgos de la revisión sistemática en matrices de datos organizadas, garantizando el cumplimiento de los lineamientos PRISMA para la presentación visual de resultados.

2.1. Respuestas a las preguntas de investigación

Tabla 2 – RQ1: ¿Qué propósitos educativos principales cumplen los sistemas que integran chatbots RAG? 

Referencia

Propósito Educativo y Aplicación

Tecnologías y Enfoques

Ámbito Educativo

(Santos & Henriques, 2023)

Predicción temprana del rendimiento e identificación de estudiantes en riesgo a partir de sus interacciones en el LMS.

Machine Learning tradicional (Random Forest, Extra Trees) y redes neuronales (LSTM).

Educación Superior

(Alsafari et al., 2024)

Asistente de enseñanza virtual 24/7 para clarificar dudas sobre el material de cursos como minería de datos.

Arquitectura Retrieval-Augmented Generation (RAG), LangChain y modelo generativo GPT-3.5 Turbo.

Educación Superior

(Arroyo-Paz et al., 2025)

Automatización de gestión académica para responder consultas rápidas sobre horarios, ubicaciones, aforos y docentes.

Procesamiento de Lenguaje Natural (PLN) con LangChain y la base de datos vectorial FAISS.

Educación Superior

(Phuc et al., 2026)

Asistente de escritura y tutoría diseñado para mejorar la competencia escrita de estudiantes de inglés como lengua extranjera.

Chatbot basado en arquitectura RAG y propulsado por Grandes Modelos de Lenguaje (LLMs).

Educación Secundaria (Grado 6)

(Koutsiaki et al., 2025)

Apoyo académico en idioma griego bajo demanda y creación rápida de recursos de aprendizaje contextualizados.

Marco de Generación Aumentada por Recuperación (RAG) acoplada a Grandes Modelos de Lenguaje.

Educación Superior

(Barenji et al., 2026)

Evaluación automática, generación de calificaciones y entrega de comentarios formativos para ensayos estudiantiles.

Sistema de evaluación RAG impulsado por modelos generativos.

Educación Superior

(Steininger et al., 2025)

Chatbot integrado al LMS (Moodle) para interactuar, buscar aclaraciones y discutir material en diseño asistido por computadora.

Arquitectura RAG dinámica y segura mediante el estándar Learning Tools Interoperability.

Educación Superior

(Tebourbi et al., 2025)

Automatización del flujo de trabajo de aprendizaje de idiomas personalizado, abarcando lectura y gramática alineado al CEFR.

Sistemas Multi-Agente (MAS), arquitectura RAG y herramientas como GPT-4 Vision OCR.

Educación (Aprendizaje de idiomas)

(Akçapınar et al., 2019)

Sistema de alerta temprana para predecir el fracaso esperado e identificar estudiantes con bajo rendimiento en etapas iniciales.

Algoritmos de Machine Learning (Árboles de Decisión, Random Forest, Redes Neuronales, SVM).

Educación Superior

(Eirena & Shah, 2025)

Servicio de atención de nivel universitario para resolver consultas de orientación académica, admisiones y ayuda financiera.

Chatbot híbrido RAG combinando un LLM local con técnicas de recuperación semántica.

Educación Superior

(Embarak & Hawarna, 2024)

Detección temprana de riesgo académico mediante el sistema RADAR, proveyendo intervenciones personalizadas y monitoreo continuo.

Inteligencia Artificial Explicable (XAI) y selección de características mediante Árboles de Decisión.

Educación Superior

(Neumann et al., 2025)

Tutor virtual integrado a los Sistemas de Gestión del Aprendizaje (LMS) para encontrar materiales o resolver problemas organizativos.

Chatbot conversacional impulsado por Grandes Modelos de Lenguaje (LLM) y PLN.

Educación Superior

(Noraset et al., 2026)

Asistente de laboratorio y tutor de código Python que guía a los principiantes en su proceso de pensamiento sin darles la solución directa.

Extensión de chatbot guiada por indicaciones (prompts) a través de Grandes Modelos de Lenguaje (LLMs).

Educación Superior (Curso corto)

(Osborne & Lang, 2023)

Identificación predictiva de estudiantes en riesgo en las primeras cinco semanas del curso para permitir apoyo oportuno.

Analítica predictiva, minería de datos y modelado utilizando registros del LMS.

Educación Superior

(Siragusa & Pirrone, 2024)

Chatbot (Unipa-GPT) estructurado para asistir a los estudiantes con preguntas sobre normativas, impuestos e información institucional en italiano.

Arquitectura RAG integrando bases de datos vectoriales FAISS y embeddings de OpenAI (GPT-3.5-turbo).

Educación Superior

(Tamascelli et al., 2025)

Chatbot de asesoramiento académico para orientar la selección de programas de estudio de manera empoderadora.

Asistente virtual / Agente de IA utilizando Grandes Modelos de Lenguaje.

Educación Superior

(Wang, 2025)

Mejora de los sistemas de gestión estudiantil para el monitoreo del rendimiento académico en tiempo real y la creación de estrategias de alerta.

Modelo híbrido de Machine Learning (Árboles de Decisión, Random Forest, SVM y ANN).

Educación Superior y Secundaria

(Chiu et al., 2026)

Identificación temprana de discrepancias en el rendimiento de los cursos para aplicar estrategias e intervenciones educativas adaptativas.

Modelos predictivos balanceados mediante SMOTE y validación cruzada estratificada.

Educación Superior (Multidisciplinario)

(Demartini et al., 2024)

Refinamiento del diseño curricular y aplicación de aprendizaje adaptativo mediante la evaluación de métricas de rendimiento y participación estudiantil.

Analítica de aprendizaje (Learning Analytics) y algoritmos de clustering (k-means, k-medoids).

Educación Superior

(K. Zhang et al., 2026)

Evaluación de colecciones bibliográficas académicas y determinación del impacto disciplinario para instituciones universitarias.

Pipeline automatizado con modelo Qwen3-8B y búsqueda semántica RAG (embeddings Nomic).

Educación Superior (Bibliotecas)

La elaboración de esta tabla responde a la necesidad de sintetizar y estructurar cómo se están implementando las tecnologías de Inteligencia Artificial (IA), y de manera específica la arquitectura Retrieval-Augmented Generation (RAG), en el ámbito educativo. Dado que el objetivo central de la revisión sistemática es analizar el uso de chatbots RAG para el seguimiento y apoyo del progreso académico, esta tabla permite identificar las tendencias tecnológicas actuales y los propósitos pedagógicos precisos que motivan el desarrollo de estos sistemas. Además, establecer esta categorización facilita la comparación directa entre los enfoques tradicionales (como el Machine Learning predictivo o los chatbots basados en intenciones predefinidas) y los sistemas generativos modernos, evidenciando la evolución de las herramientas de apoyo al estudiante.

Tabla 3 – RQ2: ¿Qué modelos de lenguaje (LLMs) son los más utilizados en el diseño de sistemas de seguimiento estudiantil?

Proveedor / Familia

Modelos Específicos Reportados

Características y Enfoque

Referencias

OpenAI (GPT)

ChatGPT, GPT-3.5, GPT-4, GPT-4o

Dominancia absoluta. Uso prioritario vía API comercial en la nube para integrar capacidades RAG de forma rápida y con alto rendimiento conversacional.

(Caccavale et al., 2026; Salman et al., 2025; Tamascelli et al., 2025)

Meta (LLaMA)

LLaMA 2, LLaMA 3-70B, TinyLlama-1.1B

Principal alternativa de código abierto. Alta preferencia para implementación en servidores locales garantizando la privacidad de los datos estudiantiles.

(Daugdaug et al., 2026; Rugemalila et al., 2026; Siragusa & Pirrone, 2024)

Mistral AI

Mistral 7B, Mistral NeMo 12B, Mixtral

Muy utilizados para arquitecturas RAG locales por su equilibrio entre bajo costo computacional y alto rendimiento.

(Gurler et al., 2026; Hartono et al., 2025; Tamascelli et al., 2025)

Google

Gemini 1 Pro, Google Bard

Modelos propietarios comerciales, frecuentemente utilizados para evaluar comparativamente el rendimiento frente a la familia GPT.

Tamascelli et al., 2025) Salman et al., 2025; (Salman et al., 2025)

Qwen & DeepSeek

Qwen-7B, Qwen2.5-0.5B, DeepSeek-V3

Modelos de código abierto emergentes de altísima eficiencia, ideales para entornos de bajos recursos (low-resource settings).

(Eirena & Shah, 2025; Gurler et al., 2026; Rugemalila et al., 2026)

Revisiones y Literatura de Apoyo

Análisis de múltiples modelos y métricas

Estudios de revisión sistemática (SLR) que evalúan marcos RAG y sus métricas de alucinación en diversas disciplinas.

(Amugongo et al., 2025; Swacha & Gracel, 2025)

La extracción de datos para responder a la RQ2 evidencia una clara dicotomía en el diseño arquitectónico de los sistemas de seguimiento estudiantil. Por un lado, existe un dominio hegemónico de los modelos comerciales, siendo la familia GPT de OpenAI (específicamente las variantes GPT-3.5 Turbo, GPT-4 y GPT-4o) la más adoptada debido a su facilidad de integración vía API y su alta fluidez semántica.

Sin embargo, el análisis de la literatura revela una fuerte tendencia emergente hacia la adopción de Modelos de Lenguaje de Código Abierto (Open-Source LLMs), liderados por las familias LLaMA (Meta) y Mistral. La elección de estos modelos de menor escala (como LLaMA 3 de 8B o Mistral 7B) responde a una necesidad crítica en el sector educativo: la gobernanza de datos. Al ser implementados en infraestructuras locales (utilizando motores como Ollama o LM Studio), las instituciones logran ejecutar arquitecturas de Generación Aumentada por Recuperación (RAG) sin enviar los datos sensibles de los estudiantes y el currículo a servidores de terceros, garantizando así el cumplimiento de normativas de privacidad. Asimismo, destaca la reciente incorporación de modelos altamente eficientes como Qwen y DeepSeek, los cuales demuestran que los "Modelos de Lenguaje Pequeños" (SLMs, por sus siglas en inglés) pueden ofrecer capacidades de tutoría y razonamiento equivalentes a los modelos comerciales masivos, pero a una fracción del costo computacional.

Tabla 4 – RQ3: ¿Qué arquitecturas RAG o Agentes RAG son los más utilizados en el diseño de sistemas de seguimiento estudiantil?

Categoría / Arquitectura

Algoritmos y Herramientas Tecnológicas

Características y Enfoques Reportados

Referencias

Marcos de Orquestación (Frameworks)

LangChain, LlamaIndex.

Ecosistemas dominantes para encadenar Modelos de Lenguaje Grandes (LLMs), gestionar prompts y conectar la recuperación de información con bases de datos externas de forma eficiente.

(Steininger et al., 2025; Vidivelli et al., 2024)

Orquestadores Multi-Agente (MAS)

LangGraph, MAESTRO, DSPy.

Permiten abandonar el chatbot monolítico a favor de sistemas donde múltiples agentes (ej. Lector, Evaluador) dividen las tareas. LangGraph modela flujos pedagógicos visuales (BPMN), y MAESTRO permite flujos NL2SQL para consultar bases de datos tabulares.

(Saurel et al., 2026; Tebourbi et al., 2025)

Bases de Datos Vectoriales y Dinámicas

ChromaDB, FAISS, Weaviate, Pinecone, Elasticsearch. Airtable.

Indexan fragmentos curriculares como vectores para una búsqueda semántica ultrarrápida. Airtable actúa como base dinámica donde los docentes inyectan diagnósticos cualitativos (Human-in-the-Loop) que el modelo RAG recupera en tiempo real.

(Eirena & Shah, 2025; Hernández-Herrera et al., 2026; Ouhaddou et al., 2025; Son et al., 2025)

Modelos de Embeddings y Segmentación

BAAI (bge-m3, bge-small), Sentence-BERT, nomic-embed-text, all-MiniLM.

Traducen textos educativos a vectores de alta dimensión. El particionamiento (chunking) se realiza de forma semántica o recursiva utilizando ventanas deslizantes para no perder el contexto de la lección.

(Daugdaug et al., 2026; Khasanova Zafar kizi & Suh, 2025; Rugemalila et al., 2026)

Estrategias de Recuperación (Retrieval)

Búsqueda Híbrida (Densa + BM25), Búsqueda MMR. Re-ranking (Cross-Encoders).

Fusión de exactitud léxica (BM25) y semántica (vectores). Se complementa con algoritmos de reordenamiento basados en metadatos del currículo (grado, tema) para garantizar que la respuesta del LLM se adhiera al plan de estudios.

(Khasanova Zafar kizi & Suh, 2025; Rugemalila et al., 2026)

Interfaces y Multimodalidad

API WhatsApp Cloud, Streamlit, ThinkStack. Whisper (STT), Coqui VITS (TTS), LlamaParse.

Despliegue en interfaces web o mensajería (WhatsApp) para entornos de bajos recursos. Integran reconocimiento de voz (Whisper) para interacción inmersiva y herramientas (LlamaParse) para procesar PDFs complejos.

(Phuc et al., 2026; Shahnawaz et al., 2026; Tebourbi et al., 2025)

Modelos Predictivos (No-RAG)

Random Forest, XGBoost, SVM, Redes Neuronales (LSTM, TGEL-Transformer).

Operan en el trasfondo analítico. Algoritmos de ensamble (Random Forest) y Deep Learning dominan la predicción del riesgo de abandono procesando los registros del LMS (calificaciones, clics, asistencia).

(Chiu et al., 2026; Gong et al., 2025; Santos & Henriques, 2023)

Explicabilidad (XAI) y Clustering

Valores SHAP, K-Means, DBSCAN.

Mitigan el problema de "caja negra" computacional. SHAP permite al docente comprender qué factor exacto (ej. estrés financiero) causa el riesgo académico, mientras que K-Means agrupa estudiantes por comportamiento.

(Garcia, 2021; Qiang et al., 2026; Urs & Sudharshan, 2025)

Los sistemas educativos actuales adoptan un enfoque tecnológico dual. Por un lado, para la predicción del riesgo de abandono y la analítica del rendimiento, el Machine Learning tradicional (No-RAG), liderado por algoritmos de ensamble como Random Forest y XGBoost, sigue siendo el estándar dominante para procesar datos tabulares del LMS

Cuando se requiere analizar historiales temporales de los alumnos, las instituciones emplean modelos de Deep Learning (como LSTM o Transformers especializados), incorporando sistemáticamente técnicas de Inteligencia Artificial Explicable (XAI) como SHAP para interpretar qué factores específicos afectan al estudiante y mitigar los sesgos algorítmicos

.Por otro lado, cuando el objetivo es la tutoría y la intervención conversacional, la arquitectura RAG (Generación Aumentada por Recuperación) se ha consolidado como la solución preferida

Estos sistemas son orquestados mayoritariamente por frameworks como LangChain y LlamaIndex, apoyándose en bases de datos vectoriales ultrarrápidas (FAISS, ChromaDB) para el almacenamiento seguro de los currículos institucionales

El avance técnico más crítico en este ámbito es la transición hacia la Recuperación Híbrida; al combinar la similitud semántica de los embeddings con la búsqueda léxica (BM25) y utilizar algoritmos de re-ranking (Cross-Encoders) basados en metadatos, los sistemas logran anclarse estrictamente al material de clase, mitigando las alucinaciones de los LLMs

Tabla 5 – RQ4: ¿Cuáles son las métricas utilizadas para evaluar la precisión de riesgo escolar y la fiabilidad de los chatbots educativos?

Categoría de Evaluación y Estrategia

Métricas y Herramientas Reportadas en la Literatura

Propósito y Enfoque de Mitigación de Desafíos

Referencias

Mitigación de Alucinaciones (Evaluación RAG)

Métricas RAGAS: Fidelidad (Faithfulness), Relevancia de respuesta, Precisión y Recall de contexto.Estrategias: Bases de conocimientos de dominio, optimización de prompts zero-shot, despliegue local.

Estrategia principal para asegurar que las respuestas se basen en evidencia real. Evalúan el anclaje factual (Groundedness) para reducir la invención de datos.

(Hartono et al., 2025, 2025; Khan et al., 2025; Khasanova Zafar kizi & Suh, 2025)

Transparencia y Explicabilidad (XAI)

Modelos y Métricas: Valores SHAP(SHapley Additive exPlanations), LIME.Estrategias: Auditorías de sesgos, políticas de "divulgación por diseño".

Resuelve el problema de la "caja negra". SHAP pondera el peso de cada variable (ej. asistencia o interacción en el LMS) para hacer las predicciones interpretables para los docentes.

(Embarak & Hawarna, 2024; Qiang et al., 2026; Ujkani et al., 2024)

Desempeño Analítico y Modelos Predictivos

Clasificación:Exactitud (Accuracy), Precision, Recall, F1-score, Matriz de Confusión, Curva AUC-ROC.Regresión: RMSE, MAE, MAPE, R², MSE.

Evalúan matemáticamente la precisión algorítmica de los Sistemas de Alerta Temprana (predicción de riesgo de abandono y calificaciones).

(Osborne & Lang, 2023; Salazar Alberto et al., 2024; Santos & Henriques, 2023)

Análisis No Supervisado (Clustering)

Métricas de Agrupamiento: Silhouette Score (0.37-0.83), Índice Davies-Bouldin (DBI), PCA, t-SNE, Distancias intra-centroide.

Estrategia para perfilar y segmentar automáticamente a los estudiantes en grupos de comportamiento o niveles de riesgo sin necesidad de etiquetas previas.

(Urs & Sudharshan, 2025)

Calidad de Generación (NLP) y Evaluación de Código

Métricas Semánticas:BERTScore F1, Cosine Similarity (SBERT).Métricas Léxicas:BLEU, ROUGE (1/2/L), Exact Match.Código: Calidad de arreglos, tasa de éxito, tests.

Evalúa la precisión del razonamiento y la fluidez del texto generado, así como la capacidad del chatbot para actuar como asistente de programación explicando y corrigiendo bugs.

(Daugdaug et al., 2026; Eirena & Shah, 2025; Siragusa & Pirrone, 2024)

Eficiencia Computacional y Seguridad

Métricas de Sistema: Latencia de extremo a extremo, tiempos de respuesta del webhook, uso de GPU y RAM, consumo de energía.Seguridad: Detección de inyecciones de prompts, privacidad.

Mitiga las barreras de infraestructura. Permite optimizar la velocidad del tutor de IA y evaluar la protección de datos estudiantiles (Privacy-Conscious frameworks).

(Chiu et al., 2026; Vidivelli et al., 2024)

Experiencia de Usuario (UX) e Impacto Cognitivo

Adopción:Modelos TAM y UTAUT, Utilidad (EUCS), Confianza.Impacto Pedagógico: Carga cognitiva (NASA-TLX), escalas de esfuerzo mental de Paas, encuestas de satisfacción.

Garantiza la aceptabilidad del sistema. Evalúa si la integración de la IA facilita o sobrecarga la memoria de trabajo del alumno, midiendo su nivel de estrés y compromiso.

(J. Li & Zhao, 2026; Opesemowo et al., 2026; Rouhani & Yadegari, 2025)

Auditoría Clínica, Ética y Human-in-the-Loop

Evaluación Humana:Kappa de Cohen, ICC (Acuerdo Interjueces).Legibilidad y Clínica: Flesch-Kincaid, PEMAT, DISCERN, EQIP, GQS. Comparación contra consensos.

Estrategias fundamentales para mitigar riesgos en chatbots de salud o áreas STEM críticas, asegurando que la IA cumpla con estándares éticos y sea comprensible.

(Gurler et al., 2026; Huang et al., 2026; Valan & Venugopal, 2025)

Las instituciones de educación superior han adoptado marcos de evaluación multidimensionales para la IA, superando las simples encuestas de satisfacción. Para evitar alucinaciones y proteger la privacidad, implementan arquitecturas RAG validadas con métricas de fidelidad (como el marco RAGAS) y optimizan la eficiencia computacional y seguridad mediante despliegues locales. Por otro lado, en la analítica predictiva para sistemas de alerta temprana, combaten la opacidad algorítmica de la "caja negra" integrando Inteligencia Artificial Explicable (como los valores SHAP y LIME) para interpretar las causas exactas de abandono estudiantil, apoyándose además en técnicas de clustering (segmentación) validadas estadísticamente. Finalmente, para garantizar que el éxito técnico se traduzca en éxito pedagógico, se evalúa la carga cognitiva y la experiencia de usuario (usando índices como NASA-TLX y TAM/UTAUT), lo cual se complementa con Auditorías Humanas (Human-in-the-Loop) respaldadas por métricas de acuerdo entre expertos (como ICC y Kappa de Cohen) para asegurar que la IA actúe como un apoyo de aprendizaje riguroso y seguro

Tabla 6 – RQ5: ¿Qué estrategias metodológicas emplean los estudios para mitigar los desafíos técnicos en el ámbito educativo?

Categoría de Estrategia

Tácticas Reportadas en la Literatura

Propósito y Desafío que Mitiga

Referencias

Repertorio A — calidad de los datos académicos

Calidad de datos y desbalance de clases

n = 27 estudios

Limpieza de escaneos de libros de texto

Ingesta y limpieza de datos institucionales

Normalización de prompts (salida JSON)

Normalización de entidades (UMLS)

Corregir el sesgo del corpus académico y la sobrerrepresentación de la clase "no riesgo", que infla la exactitud aparente del modelo predictivo.

(Jathaur et al., 2026; Nimy et al., 2023; Wang, 2025)

Repertorio B — control del texto generativo

Optimización de la recuperación (chunking, embeddings, re-ranking)

n = 27 estudios

Mejora de la estabilidad de la recuperación

Filtro de doble etapa (Top-3 y umbral de similitud τ=0.60)

Segmentación recursiva (chunks de 512 tokens)

Chunking de datos contextuales

Asegurar que el fragmento recuperado sea el pertinente antes de generar: es la capa donde se decide la calidad del anclaje.

(Amugongo et al., 2025; Haider et al., 2025; Yadav, 2025)

Ingeniería de prompts y restricciones de generación

n = 18 estudios

Ethical Guardrails

Ingeniería de prompts estructurada

Restricción a base de conocimiento curada

Política de no-código

Acotar por diseño lo que el modelo puede responder, restringiendo la generación al material autorizado.

(Barenji et al., 2026; Noraset et al., 2026; Siragusa & Pirrone, 2024)

Anclaje documental (grounding)

n = 13 estudios

RAG anclado a marcos pedagógicos validados

Restricción a base de conocimiento curada

RAG anclado a guías clínicas internacionales

Biblioteca curada (+250 documentos)

Reducir la alucinación obligando a que la respuesta se sostenga en una base institucional cerrada y verificable.

(Gurler et al., 2026; Thoeni & Fryer, 2026; Thway et al., 2024)

Ajuste del modelo (fine-tuning y adaptación de dominio)

n = 5 estudios

Fine-tuning en patrones de citación

Fine-tuning específico de dominio

Fine-tuning específico de dominio

Cuantización

Adaptar el modelo al lenguaje y las convenciones del dominio educativo cuando el anclaje documental resulta insuficiente.

(Aldhafeeri et al., 2025; Vidivelli et al., 2024; Xu et al., 2025)

Seguridad del sistema

n = 2 estudios

Interceptores para filtrar consultas maliciosas

Defensa ante inyección de prompts

Contener la inyección de prompts y el uso malicioso del asistente en un entorno con datos sensibles de menores y estudiantes.

(Daugdaug et al., 2026; Noraset et al., 2026)

Estrategias transversales

Supervisión humana (human-in-the-loop) y rol docente

n = 14 estudios

Orquestación mediada por el docente (human-in-the-loop)

Contenido provisto directamente por docentes expertos

Base de conocimientos curada por expertos médicos

Supervisión del instructor

Mantener al docente como autoridad de validación y evitar la delegación del juicio pedagógico en el sistema.

(Jiang et al., 2024; Rochelle & Sushith, 2024; Tebourbi et al., 2025)

Privacidad, gobernanza y despliegue local

n = 11 estudios

Servidores locales

Marcos de gobernanza ética (AILuminate)

Despliegue local

Seudonimización local

Proteger el dato académico del estudiante y cumplir con FERPA/GDPR, evitando el envío de consultas a servidores comerciales.

(Crompton & Burke, 2023; Ifenthaler & Yau, 2020; Sajja et al., 2023)

Sesgo, transparencia y explicabilidad (XAI)

n = 10 estudios

Auditorías de sesgo algorítmico

Auditorías periódicas

Monitoreo de sesgos

Retroalimentación contextualizada

Hacer auditable la decisión algorítmica y evitar que el etiquetado de riesgo se convierta en una profecía autocumplida.

(Ahmad et al., 2024; Bhat, 2023; Silva, 2023)

3. Discusión

 La presente revisión sistemática pone de manifiesto que la integración de la Inteligencia Artificial en la educación está atravesando un punto de inflexión. El objetivo de este estudio fue analizar cómo los chatbots basados en la arquitectura Retrieval-Augmented Generation (RAG) están redefiniendo el seguimiento y el apoyo del progreso académico de los estudiantes. Los resultados obtenidos a través de las cuatro preguntas de investigación revelan un ecosistema tecnológico en rápida maduración, el cual ofrece un soporte ubicuo y fundamentado, pero que simultáneamente se enfrenta a tensiones pedagógicas y dilemas éticos profundos.

3.1. Propósitos educativos: dos literaturas que corren en paralelo (Tabla 5)

La Tabla 5 muestra que los propósitos dominantes del corpus se reparten entre la tutoría conversacional (31 estudios), la alerta temprana y prevención de la deserción (30), la personalización (27) y la reducción de la carga docente (21). Leída junto con la línea de vida del campo, la distribución revela dos tradiciones con cronologías distintas: la alerta temprana se consolida desde los sistemas de detección de estudiantes en riesgo en educación superior en línea (Bañeres et al., 2020) y la identificación predictiva a partir de datos del LMS (Osborne & Lang, 2023), mientras que la tutoría conversacional es posterior y adopta formas como el asistente virtual disponible de forma continua (Sajja et al., 2023), el chatbot institucional integrado al LMS (Neumann et al., 2025) o el chatbot de asesoramiento académico con agentes (Tamascelli et al., 2025). Ambas persiguen el éxito estudiantil, pero casi no se citan entre sí. El dato más elocuente es negativo: solo nueve estudios plantean la fiabilidad o la alucinación como problema de partida, y todos desde 2025.

De ahí se desprende el vacío que esta revisión identifica como central en el plano de los propósitos: ningún estudio del corpus sitúa un chatbot RAG en el rol de seguimiento y monitoreo institucional del riesgo académico. El antecedente más próximo, (Neumann et al., 2025), propone un tutor RAG orientado a mitigar el riesgo mediante el aprendizaje autorregulado, pero la función de monitoreo permanece fuera del sistema. Los chatbots acompañan; los modelos predictivos detectan; ningún diseño del corpus integra ambas funciones.

3.2. Modelos y arquitecturas: adopción acelerada sin hibridación (Tablas 6 y 7)

Las Tablas 6 y 7 documentan una adopción tecnológica rápida y convergente. La familia GPT domina el corpus (54 estudios), con implementaciones de referencia en asesoría académica (Tamascelli et al., 2025) y en entornos de enseñanza y aprendizaje(Caccavale et al., 2026); le siguen los modelos abiertos de la familia LLaMA, empleados sobre todo en despliegues locales (Daugdaug et al., 2026; Rugemalila et al., 2026), y alternativas ligeras como Mistral (Gurler et al., 2026) o Qwen en configuraciones de bajo costo (Eirena & Shah, 2025). En la capa arquitectónica, la orquestación se apoya en LangChain y LlamaIndex (Steininger et al., 2025; Vidivelli et al., 2024) y evoluciona del chatbot monolítico hacia sistemas multi-agente como MAESTRO (Saurel et al., 2026) y diseños BPMN multi-agente con validación humana (Tebourbi et al., 2025), con bases vectoriales dinámicas (Son et al., 2025) y estrategias de recuperación híbrida con re-ranking (Khasanova Zafar kizi & Suh, 2025; Rugemalila et al., 2026). Esta madurez de diseño se alcanza en apenas dos años.

Sin embargo, esa convergencia convive con una ausencia notable. El aprendizaje automático clásico no desaparece con la llegada de los LLMs: los modelos predictivos sin RAG se mantienen activos durante todo el periodo, desde las contribuciones tempranas al análisis del rendimiento estudiantil(Balaji et al., 2021) hasta los marcos predictivos con protección de privacidad (Chiu et al., 2026) y los transformadores que incorporan teorías educativas (Gong et al., 2025). La lectura obvia sería la de un relevo tecnológico incompleto; la evidencia apunta más bien a una bifurcación: no existe en el corpus una sola arquitectura híbrida que acople un motor predictivo de riesgo con un pipeline RAG. Las dos familias tecnológicas se ocupan de problemas contiguos sin encontrarse, y esa contigüidad no resuelta es donde esta revisión localiza la oportunidad de diseño.

3.3. Métricas: dos familias disjuntas y un vacío de evaluación conjunta (Tabla 8)

La Tabla 8 sostiene el hallazgo central de esta revisión. Las categorías de evaluación reportadas se agrupan en dos familias que no se tocan. La familia del riesgo, operativa desde 2020, emplea F1, recall y sensibilidad (34 estudios), AUC-ROC (6) y métricas de regresión, con ejemplos representativos en la predicción del abandono a partir de la huella digital del estudiante (Santos & Henriques, 2023), la identificación temprana con datos del LMS (Osborne & Lang, 2023) y los modelos aplicados en contexto latinoamericano (Salazar Alberto et al., 2024). La familia de la fiabilidad, que no aparece hasta 2024, emplea métricas tipo RAGAs, fidelidad y relevancia contextual (26 estudios), con evaluaciones de alucinación en chatbots educativos multilingües (Hartono et al., 2025; Khasanova Zafar kizi & Suh, 2025) y en dominios clínico-educativos (Huang et al., 2026; Khan et al., 2025). A ellas se suman instrumentos transversales de percepción —Likert, TAM y UTAUT (26)— y de acuerdo humano —Kappa e ICC (7)—, junto con la evaluación del impacto cognitivo y la experiencia de usuario (J. Li & Zhao, 2026; Rouhani & Yadegari, 2025).

Ningún estudio del corpus evalúa de forma conjunta la precisión predictiva del riesgo académico y la fiabilidad del chatbot. Treinta y un estudios declaran explícitamente no medir fiabilidad ni alucinaciones. La consecuencia es metodológica antes que técnica: no existe métrica compuesta ni marco que permita afirmar que un sistema detecta bien el riesgo y, además, no inventa cuando lo comunica. Cabe aquí una advertencia dirigida a futuras síntesis: varios trabajos aparentan cruzar ambas familias porque reportan recall, pero se trata de context recall —una métrica de recuperación documental— y no de la sensibilidad de una predicción de riesgo. La coincidencia terminológica ha ocultado el vacío más que revelarlo, y una lectura automatizada de la literatura lo pasaría por alto.

3.4. Estrategias de mitigación: dos repertorios que nunca conviven (Tabla 9)

La Tabla 9 organiza las estrategias reportadas en dos repertorios y un conjunto transversal. El repertorio de la calidad de los datos académicos —tratamiento del desbalance, estratificación, ensamble y preprocesamiento (27 estudios)— responde a un problema estructural del dato educativo, documentado en el tratamiento de la sobrerrepresentación de la clase sin riesgo (Nimy et al., 2023) y en los pipelines de limpieza e ingesta institucional (Jathaur et al., 2026): un modelo que ignora a la clase minoritaria puede exhibir una exactitud alta y una utilidad nula. El repertorio del control del texto generativo responde a un problema distinto —que el sistema no invente— y combina el anclaje en bases de conocimiento curadas (Thway et al., 2024), la optimización de la recuperación mediante chunking y filtros de similitud (Amugongo et al., 2025), la ingeniería de prompts con guardrails éticos (Barenji et al., 2026) y el ajuste fino de dominio (Aldhafeeri et al., 2025; Vidivelli et al., 2024). Las estrategias transversales —supervisión humana con orquestación mediada por el docente (Jiang et al., 2024), despliegue local y seudonimización para la protección del dato académico (Ifenthaler & Yau, 2020) y auditoría de sesgos (Ahmad et al., 2024) - aparecen en ambas tradiciones.

El patrón se repite por tercera vez: la mitigación del desbalance de clases y la mitigación de la alucinación no conviven en ningún diseño del corpus. Un sistema que efectivamente acompañe a estudiantes en riesgo necesita ambas cosas a la vez —un predictor que no ignore a la minoría y un generador que no invente al explicarle al estudiante por qué está en riesgo—, y esa combinación no ha sido ensayada. Es también la columna mejor cubierta del corpus, con solo tres estudios que no abordan la pregunta, lo que descarta que el vacío se deba a un déficit de reporte: los estudios sí describen sus estrategias; simplemente no las combinan.

3.5. Implicaciones pedagógicas y éticas: "tutor, no solucionador"

Los hallazgos técnicos no son neutrales en el plano pedagógico. La evidencia converge en que la eficacia de estos sistemas depende menos del modelo elegido que del diseño de la interacción: los sistemas más efectivos actúan como andamiaje cognitivo con barreras deliberadas que impiden entregar la solución directa (B. Li et al., 2026), y la evaluación del impacto cognitivo advierte sobre los riesgos de la delegación del esfuerzo mental en el asistente (J. Li & Zhao, 2026). Ello justifica un enfoque centrado en el ser humano, con el docente como autoridad de validación: la colaboración docente-agente estructurada (Chen, 2025), la orquestación mediada por el profesorado (Rochelle & Sushith, 2024) y la validación humana del contenido y de la secuencia pedagógica (Tebourbi et al., 2025) tratan la supervisión humana como salvaguarda técnica y pedagógica a la vez, en coherencia con los 14 estudios que la reportan en la Tabla 9.

En el plano ético, la gobernanza y la privacidad del dato académico constituyen un condicionante de diseño y no un apéndice. El envío de consultas estudiantiles a servidores comerciales entra en tensión con los marcos de protección de datos educativos analizados desde la analítica del aprendizaje (Ifenthaler & Yau, 2020) con las consideraciones de despliegue institucional responsable (Kasaii et al., 2025); la respuesta documentada en el corpus es el despliegue local de modelos abiertos con seudonimización (11 estudios). A ello se suma un riesgo específico del seguimiento del riesgo académico: el etiquetado algorítmico puede operar como profecía autocumplida si no es auditable, lo que explica la presencia de técnicas de explicabilidad y auditoría de sesgo (Ahmad et al., 2024). Un sistema que clasifica a un estudiante como en riesgo debe poder explicar por qué, tanto por exigencia técnica como por respeto a la agencia del estudiante y al juicio profesional del docente.

4. Conclusiones

Esta revisión sistemática (n = 135, 2020-2026) permite concluir que el campo no ha vivido un relevo tecnológico, sino una bifurcación. La analítica predictiva del riesgo académico y la IA generativa conversacional se desarrollaron como dos literaturas paralelas que apenas se citan entre sí: la primera desde Bañeres et al. (2020), con una producción constante de dos a tres estudios anuales que no decae; la segunda desde Osborne et al. (2023), con la arquitectura RAG apareciendo recién en 2024 y expandiéndose hasta 51 estudios (38% del corpus). El corpus es, además, marcadamente reciente: 91 estudios (67%) se publicaron en 2025-2026, lo que indica un campo en formación cuyas convenciones metodológicas aún no se han estabilizado.

El hallazgo central es un vacío, no una tendencia: ningún estudio del corpus evalúa de forma conjunta la precisión predictiva del riesgo académico y la fiabilidad del chatbot. Coexisten dos familias métricas disjuntas separadas por cuatro años: la del riesgo (F1, recall y sensibilidad en 34 estudios; AUC-ROC en 6) operativa desde 2020, y la de la fiabilidad (métricas tipo RAGAs, fidelidad y relevancia contextual en 26 estudios; alucinaciones medidas o discutidas en 25) que no aparece hasta (Habib et al., 2024). Treinta y un estudios declaran explícitamente no medir fiabilidad. Cabe una advertencia metodológica para futuras síntesis: los trabajos que aparentan cruzar ambas familias emplean el término recall como context recall —una métrica de recuperación documental— y no como sensibilidad en la predicción del riesgo; la coincidencia terminológica no equivale a una evaluación conjunta.

La bifurcación se reproduce en el plano técnico. No existe en el corpus una arquitectura híbrida que acople un motor predictivo de riesgo con un pipeline RAG, y los repertorios de mitigación permanecen igualmente separados: el tratamiento del desbalance de clases (estratificación, ensamble y SMOTE en 22 estudios, desde (Balaji et al., 2021) nunca convive en un mismo diseño con el control del texto generativo (anclaje en base de conocimiento cerrada en 19 estudios, chunking y re-ranking en 10, human-in-the-loop en 9, desde (Thway et al., 2024). Ningún estudio sitúa un chatbot RAG en el rol de seguimiento y monitoreo institucional del riesgo académico; el antecedente más próximo es (Neumann et al., 2025), un tutor RAG orientado a mitigar el riesgo mediante el aprendizaje autorregulado, pero sin función de monitoreo institucional.

En consecuencia, la afirmación de que RAG resuelve el problema de la alucinación en el ámbito educativo debe matizarse: el anclaje documental es una estrategia de diseño ampliamente adoptada, pero su eficacia para el seguimiento del riesgo académico no ha sido evaluada con métricas de riesgo en ningún estudio del corpus. La evidencia disponible sostiene la promesa arquitectónica, no todavía el resultado educativo.

La agenda de investigación que se desprende es específica. Primero, diseñar y validar arquitecturas híbridas que acoplen la predicción del riesgo con la generación aumentada por recuperación, de modo que el sistema que detecta también acompañe. Segundo, construir un marco de evaluación conjunta —una métrica compuesta o un protocolo que reporte simultáneamente sensibilidad predictiva y fidelidad de la respuesta— sin el cual ambas literaturas seguirán siendo inconmensurables. Tercero, combinar en un mismo diseño el tratamiento del desbalance de clases y el control del texto generativo, hoy repertorios ajenos. A ello se suman las líneas ya identificadas en la discusión: estudios longitudinales sobre retención del conocimiento, evaluación del efecto en el pensamiento crítico bajo el paradigma de tutor y no solucionador, y políticas estandarizadas de gobernanza de datos que acompañen el despliegue local de estos modelos.

Este trabajo presenta limitaciones que conviene explicitar. La síntesis se apoya en la información reportada en las publicaciones, por lo que la ausencia de una métrica o de una estrategia de mitigación en un estudio indica que no fue reportada, no necesariamente que no fuera aplicada. Asimismo, la concentración del corpus en 2025-2026 implica que una porción relevante de la evidencia proviene de estudios muy recientes, con validaciones aún preliminares y escasa replicación independiente. 

Referencias

Ahmad, K., Iqbal, W., Elhassan, A., Qadir, J., Benhaddou, D., Ayyash, M., & Al-Fuqaha, A. (2024). Data-Driven Artificial Intelligence in Education: A Comprehensive Review. IEEE Transactions on Learning Technologies, 17, 12-31. https://doi.org/10.1109/tlt.2023.3314610

Akçapınar, G., Altun, A., & Aşkar, P. (2019). Using learning analytics to develop early-warning system for at-risk students. International Journal of Educational Technology in Higher Education, 16(1), 40. https://doi.org/10.1186/s41239-019-0172-z

Aldhafeeri, L., Aljumah, F., Thabyan, F., Alabbad, M., AlShahrani, S., Alanazi, F., & Al-Nafjan, A. (2025). Generative AI Chatbots Across Domains: A Systematic Review. Applied Sciences (Switzerland), 15(20). Scopus. https://doi.org/10.3390/app152011220

Alsafari, B., Atwell, E., Walker, A., & Callaghan, M. (2024). Towards effective teaching assistants: From intent-based chatbots to LLM-powered teaching assistants. Natural Language Processing Journal, 8. Scopus. https://doi.org/10.1016/j.nlp.2024.100101

Amugongo, L. M., Mascheroni, P., Brooks, S., Doering, S., & Seidel, J. (2025). Retrieval augmented generation for large language models in healthcare: A systematic review. PLOS Digital Health, 4. https://doi.org/10.1371/journal.pdig.0000877

Arroyo-Paz, A., Salinas-Lazo, D., & Urquizo-Ttito, C. (2025). Implementation of an intelligent Chatbot for the consultation of academic management information in a higher education institution. Proceedings of the 23rd LACCEI International Multi-Conference for Engineering, Education and Technology (LACCEI): «Engineering, Artificial Intelligence, and Sustainable Technologies in service of society». 23rd LACCEI International Multi-Conference for Engineering, Education and Technology (LACCEI): «Engineering, Artificial Intelligence, and Sustainable Technologies in service of society». https://doi.org/10.18687/LACCEI2025.1.1.1429

Balaji, P., Alelyani, S., Qahmash, A., & Mohana, M. (2021). Contributions of Machine Learning Models towards Student Academic Performance Prediction: A Systematic Review. Applied Sciences, 11(21), 10007. https://doi.org/10.3390/app112110007

Bañeres, D., Rodríguez, M. E., Guerrero-Roldán, A. E., & Karadeniz, A. (2020). An Early Warning System to Detect At-Risk Students in Online Higher Education. Applied Sciences, 10(13), 4427. https://doi.org/10.3390/app10134427

Barenji, R. V., Salimi, N., & Khoshgoftar, S. (2026). An LLM -Powered Assessment Retrieval-Augmented Generation (RAG) For Higher Education. ArXiv, abs/2601.06141. https://doi.org/10.48550/arxiv.2601.06141

Bhat, J. (2023). Automating Higher Education Administrative Processes with AI-Powered Workflows. International Journal of Emerging Trends in Computer Science and Information Technology. https://doi.org/10.63282/3050-9246.ijetcsit-v4i4p116

Caccavale, F., Gargalo, C. L., Kager, J., Skowyra, M., Larsen, S., Gernaey, K. V., & Krühne, U. (2026). Large Language Models in Teaching and Learning: Reflections on Implementing an AI Chatbot in Higher Education (arXiv:2603.17773; Versión 1). arXiv. https://doi.org/10.48550/arXiv.2603.17773

Chen, J. (2025). Constructing an Application Framework for Educational AI Agents to Promote Deep Integration of Teacher TPACK. Journal of Computer and Communications, 13(11), 213-222. https://doi.org/10.4236/jcc.2025.1311013

Chiu, H.-S., Wong, A., & Wong, T.-L. (2026). A Privacy-Conscious AI Framework for Early Identification of At-Risk Students Across Disciplines Using LMS Engagement Data. Education Sciences, 16(7), 1046. https://doi.org/10.3390/educsci16071046

Crompton, H., & Burke, D. (2023). Artificial intelligence in higher education: The state of the field. International Journal of Educational Technology in Higher Education, 20, 1-22. https://doi.org/10.1186/s41239-023-00392-8

Daugdaug, J., Salera, L. V., Alosada, H. G., Busico, E., & Amparo, J. (2026). Bruno: A RAG-based Programming Learning Assistant for Guided, No-Code Problem Solving. Proceedings of the 2025 9th International Conference on Education and E-Learning, ICEEL ’25, 147-158. https://doi.org/10.1145/3789859.3789864

Demartini, C. G., Sciascia, L., Bosso, A., & Manuri, F. (2024). Artificial Intelligence Bringing Improvements to Adaptive Learning in Education: A Case Study. Sustainability, 16(3), 1347. https://doi.org/10.3390/su16031347

Eirena, A., & Shah, N. (2025). A Hybrid RAG-Based Chatbot for University Customer Service: Combining Local LLM with Semantic Retrieval for Privacy and Real-Time Performance. Journal of Logistics, Informatics and Service Science, 12(8), 58-72. Scopus. https://doi.org/10.33168/JLISS.2025.0804

Embarak, O. H., & Hawarna, S. (2024). Automated AI-driven System for Early Detection of At-risk Students. Procedia Computer Science, 14th International Conference on Emerging Ubiquitous Systems and Pervasive Networks / 13th International Conference on Current and Future Trends of Information and Communication Technologies in Healthcare (EUSPN/ICTH 2023), 231, 151-160. https://doi.org/10.1016/j.procs.2023.12.187

Garcia, L. (2021). Machine Learning Models for Student Performance Prediction. IEEE Access.

Gong, Y., Wang, F., Zhang, Y., & Geng, J. (2025). TGEL-transformer: Fusing educational theories with deep learning for interpretable student performance prediction. PLOS ONE, 20(6), e0327481. (pub.1190313500). https://doi.org/10.1371/journal.pone.0327481

Gurler, N., Sengul, T., Bulbul, S. H., Yilmaz Akyaz, D., Guler, O., Yantac, A. E., Aydın, E. B., & Kirkland-Kyhn, H. (2026). Secure and accessible AI in nursing education: A modular agentic chatbot framework comparing ChatGPT-4o with an open-source LLM for chronic wound care. Nurse Education in Practice, 93, 104789. https://doi.org/10.1016/j.nepr.2026.104789

Habib, M. A., Amin, S., Oqba, M., Jaipal, S., Khan, M. J., & Samad, A. (2024). TaxTajweez: A Large Language Model-based Chatbot for Income Tax Information In Pakistan Using Retrieval Augmented Generation (RAG). Proc. Int. Fla. Artif. Intell. Res. Soc. Conf., FLAIRS, 37. Scopus. https://doi.org/10.32473/flairs.37.1.135648

Haider, S. A., Prabha, S., Gomez Cabello, C. A., Genovese, A., Collaco, B., Wood, N., London, J., Bagaria, S., Tao, C., & Forte, A. J. (2025). The Development and Evaluation of a Retrieval-Augmented Generation Large Language Model Virtual Assistant for Postoperative Instructions. Bioengineering, 12(11). https://doi.org/10.3390/bioengineering12111219

Hartono, L. S., Setiawan, E. I., & Singh, V. (2025). Retrieval Augmented Generation-Based Chatbot for Prospective and Current University Students. International Journal of Engineering, Science and Information Technology, 5(3), 268-277. Scopus. https://doi.org/10.52088/ijesty.v5i3.951

Hernández-Herrera, J. R., Ortiz-Bejar, J., & Ortiz-Bejar, J. (2026). Adaptive and Personalized Learning in Higher Education: An Artificial Intelligence-Based Approach. Education Sciences, 16(1), 109. https://doi.org/10.3390/educsci16010109

Huang, H., Zhang, C., Hu, H., & Tong, X. (2026). Reliability and readability of five AI chatbots for concussion health advice across retrieval augmented and pretrained models. Scientific Reports, 16(1), 20423. https://doi.org/10.1038/s41598-026-51281-9

Ifenthaler, D., & Yau, J. (2020). Utilising learning analytics to support study success in higher education: A systematic review. Educational Technology Research and Development, 68, 1961-1990. https://doi.org/10.1007/s11423-020-09788-z

Jathaur, R. K., Srivastava, A., Dubey, V. K., Kasodhan, A., & Srivastava, A. P. (2026). A Study on the Design and Development of AI Driven Student Performance and Recommendation Dashboard. JOURNAL UGC-CARE IJCRT (2349-3194) | ISSN Approved Journal, 16(2), 51314-51326. https://doi.org/10.5281/zenodo.19876547

Jiang, Y., Shao, Y., Ma, D., Semnani, S. J., & Lam, M. S. (2024). Into the Unknown Unknowns: Engaged Human Learning through Participation in Language Model Agent Conversations. En Al-Onaizan Y., Bansal M., & Chen Y.-N. (Eds.), EMNLP - Conf. Empir. Methods Nat. Lang. Process., Proc. Conf. (pp. 9917-9955). Association for Computational Linguistics (ACL). Scopus. https://doi.org/10.18653/v1/2024.emnlp-main.554

Kasaii, M. S., Rossetti, R. J. F., & Campos, P. (2025). Agent-Based Approaches Towards Smart Higher Education: A Preliminary Review. Proc. IEEE Int. Smart Cities Conf:Resilient Sustain. Smart Commun., ISC2. Scopus. Proceedings of the 11th IEEE International Smart Cities Conference:Resilient and Sustainable Smart Communities, ISC2 2025. https://doi.org/10.1109/ISC266238.2025.11293344

Khan, U. A., Khan, E., Khan, F., & Moinuddin, A. A. (2025). Towards Efficient Educational Chatbots: Benchmarking RAG Frameworks (arXiv:2503.00781; Versión 1). arXiv. https://doi.org/10.48550/arXiv.2503.00781

Khasanova Zafar kizi, M., & Suh, Y. (2025). Design and Performance Evaluation of LLM-Based RAG Pipelines for Chatbot Services in International Student Admissions. Electronics, 14(15), 3095. https://doi.org/10.3390/electronics14153095

Koutsiaki, M. E., Delianidi, M., Mizeli, C., Diamantaras, K., Grigoropoulos, I., & Koutlianos, N. (2025). From Textbook to Talkbot: A Case Study of a Greek-Language RAG-Based Chatbot in Higher Education. 171-182. https://doi.org/10.22492/issn.2435-9467.2025.15

Li, B., Tan, L., Zakharov, W., Qiu, Q., & Acton, C. B. (2026). Tutor, Not Solver: Designing a Guardrailed AI Assistant for Learning in Higher Education: A Design Case of PeteChat (arXiv:2606.09845; Versión 1). arXiv. https://doi.org/10.48550/arXiv.2606.09845

Li, J., & Zhao, H. (2026). Workflow-embedded AI as a cognitive scaffold: A randomized trial on knowledge retention and diagnostic competency in undergraduate radiology education. European Journal of Radiology Open, 16, 100724. https://doi.org/10.1016/j.ejro.2026.100724

Neumann, A. T., Yin, Y., Sowe, S., Decker, S., & Jarke, M. (2025). An LLM-Driven Chatbot in Higher Education for Databases and Information Systems. IEEE Transactions on Education, 68(1), 103-116. Scopus. https://doi.org/10.1109/TE.2024.3467912

Nimy, E., Mosia, M., & Chibaya, C. (2023). Identifying At-Risk Students for Early Intervention—A Probabilistic Machine Learning Approach. Applied Sciences, 13(6). https://doi.org/10.3390/app13063869

Noraset, T., Supratak, A., Ragkhitwetsagul, C., Worathong, N., & Tuarob, S. (2026). Evaluating lab assistant chatbot on student learning and behaviors in a programming short course. Computers and Education: Artificial Intelligence, 10, 100527. https://doi.org/10.1016/j.caeai.2025.100527

Opesemowo, O. A. G., Adewale, S., & Opesemowo, T. R. (2026). Efficacy of e-supervision on students’ academic behaviour in the era of artificial intelligence. Discover Artificial Intelligence, 6(1), 185. https://doi.org/10.1007/s44163-026-00893-1

Osborne, J. B., & Lang, A. S. I. D. (2023). Predictive Identification of At-Risk Students: Using Learning Management System Data. Journal of Postsecondary Student Success, 2(4), 108-126. https://doi.org/10.33009/fsop_jpss132082

Ouhaddou, C., Retbi, A., & Bennani, S. (2025). Enhancing Career Counseling for Baccalaureate Students in Morocco through Retrieval-Augmented Generation Technology: A RAG-Based Chatbot. Journal of Advances in Information Technology, 16(11), 1577-1585. https://doi.org/10.12720/jait.16.11.1577-1585

Phuc, T. Q. B., Thangovich, N. Y., & Parveen, K. (2026). The impact of RAG chatbots on writing proficiency: A study of Vietnamese Grade 6 EFL students. Social Sciences and Humanities Open, 14. Scopus. https://doi.org/10.1016/j.ssaho.2026.103135

Qiang, M., Liu, Z., & Zhang, R. (2026). Explainable AI in education: Integrating educational domain knowledge into the deep learning model for improved student performance prediction. Scientific Reports, 16(1), 9515. https://doi.org/10.1038/s41598-026-40538-y

Ra, E., Kim, S. J., Seo, E.-Y., & So, G. (2025). Designing LMS and Instructional Strategies for Integrating Generative-Conversational AI (arXiv:2509.00709). arXiv. https://doi.org/10.48550/arXiv.2509.00709

Rochelle, S. & Sushith. (2024). Exploring the AI Era: A Comparative Analysis of AI-Driven Education and Traditional Teaching Methods. International Journal For Multidisciplinary Research. https://doi.org/10.36948/ijfmr.2024.v06i04.24635

Rouhani, S., & Yadegari, M. (2025). Semantic and User Experience Evaluation of a RAG-Based Educational Chatbot for Data Science Learning (SSRN Scholarly Paper No. 5910800). Social Science Research Network. https://doi.org/10.2139/ssrn.5910800

Rugemalila, I. E., Cai, W., Zhang, X., Liu, C., & Wang, B. (2026). Curriculum-Aware Retrieval-Augmented Generation for Bilingual Tutoring in Low-Resource Swahili–English Secondary Schools. Technologies, 14(2). https://doi.org/10.3390/technologies14020129

Sajeev, A. S., Joseph, A. S., T, A. M., Varghese, S. M., & T, A. A. (2024). VisionVerse: Dynamic Video Question Answering Through Retrieval-Augmented Generation. In Review. https://doi.org/10.21203/rs.3.rs-4372886/v1

Sajja, R., Sermet, Y., Cwiertny, D., & Demir, I. (2023). Integrating AI and Learning Analytics for Data-Driven Pedagogical Decisions and Personalized Interventions in Education. ArXiv, abs/2312.09548. https://doi.org/10.48550/arxiv.2312.09548

Salazar Alberto, R., Guzman Aquije, E. H., & Lozada Flores, R. M. (2024). Application of AI to predict academic performance and prevent dropout in higher education (RSL). Proceedings of the 22nd LACCEI International Multi-Conference for Engineering, Education and Technology (LACCEI 2024): “Sustainable Engineering for a Diverse, Equitable, and Inclusive Future at the Service of Education, Research, and Industry for a Society 5.0.” 22nd LACCEI International Multi-Conference for Engineering, Education and Technology (LACCEI 2024): “Sustainable Engineering for a Diverse, Equitable, and Inclusive Future at the Service of Education, Research, and Industry for a Society 5.0.” https://doi.org/10.18687/LACCEI2024.1.1.1426

Salman, H., Ahmad, M. A., Ibrahim, R., & Mahmood, J. (2025). Systematic analysis of generative AI tools integration in academic research and peer review. Online Journal of Communication and Media Technologies. https://doi.org/10.30935/ojcmt/15832

Santos, R. M., & Henriques, R. (2023). Accurate, timely, and portable: Course-agnostic early prediction of student performance from LMS logs. Computers and Education: Artificial Intelligence, 5, 100175. https://doi.org/10.1016/j.caeai.2023.100175

Saurel, R., Silvestre, F., Raclet, J.-B., & Lescure, E. (2026). MAESTRO: Multi-agent Educational System for Tutoring and Recommendation Orchestration. En Tammets K., Sosnovsky S., Ferreira Mello R., Pishtari G., & Nazaretsky T. (Eds.), Lect. Notes Comput. Sci.: 16064 LNCS (pp. 380-385). Springer Science and Business Media Deutschland GmbH. Scopus. https://doi.org/10.1007/978-3-032-03873-9_53

Seshadri, V., Berrachid, Y., Hugh, E., Madan, A., & Emara, S. (2026). Alan: A Classroom Deployment of An Educational Chatbot That Cites Resources. Proceedings of the 57th ACM Technical Symposium on Computer Science Education V.2, SIGCSE TS 2026, 2, 1511-1512. https://doi.org/10.1145/3770761.3777344

Shahnawaz, A., Shafique, A., Wang, D., & Mustafa, M. (2026). Designing Around Stigma: Human-Centered LLMs for Menstrual Health. Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems, CHI ’26, 1-23. https://doi.org/10.1145/3772318.3791318

Silva, M. (2023). AI-Driven Personalized Learning Systems. Information Sciences.

Siragusa, I., & Pirrone, R. (2024). Unipa-GPT: Large Language Models for university-oriented QA in Italian. Italian Journal of Computational Linguistics, 10(2 Special Issue), 107-130. Scopus. https://doi.org/10.17454/IJCOL102.06

Son, N., Kang, I., Kim, I., Lee, K., Nam, S., & Lee, D. (2025). Development and Evaluation of a Retrieval-Augmented Generation-Based Electronic Medical Record Chatbot System. Healthc Inform Res, 31(3), 218-225. https://doi.org/10.4258/hir.2025.31.3.218

Steininger, S., Kezer, S., Rief, J., Spicker, E., Preis, S., & Fottner, J. (2025). ChAx: A RAG-based chatbot for CAx education. En di Milano P. (Ed.), Proc. Des. Soc. (Vol. 5, pp. 921-930). Cambridge University Press. Scopus. https://doi.org/10.1017/pds.2025.10106

Swacha, J., & Gracel, M. (2025). Retrieval-Augmented Generation (RAG) Chatbots for Education: A Survey of Applications. Applied Sciences (Switzerland), 15(8). Scopus. https://doi.org/10.3390/app15084234

Tamascelli, M., Bunch, O., Fowler, B., Taeb, M., & Cohen, A. (2025). Academic Advising Chatbot Powered with AI Agent. ACMSE - Proc. ACM Southeast Conf., 195-202. Scopus. https://doi.org/10.1145/3696673.3723065

Tebourbi, H., Nouzri, S., Mualla, Y., El Fatimi, M., Najjar, A., Abbas-Turki, A., & Dridi, M. (2025). BPMN-Based Design of Multi-Agent Systems: Personalized Language Learning Workflow Automation with RAG-Enhanced Knowledge Access. Information, 16(9). https://doi.org/10.3390/info16090809

Thoeni, A., & Fryer, L. K. (2026). AI chatbots in higher education: Comparing expectations to evidence. Computers in Human Behavior Reports, 22, 101061. https://doi.org/10.1016/j.chbr.2026.101061

Thway, M., Recatala-Gomez, J., Lim, F. S., Hippalgaonkar, K., & Ng, L. W. T. (2024). Battling Botpoop using GenAI for Higher Education: A Study of a Retrieval Augmented Generation Chatbots Impact on Learning (arXiv:2406.07796; Versión 2). arXiv. https://doi.org/10.48550/arXiv.2406.07796

Ujkani, B., Minkovska, D., & Hinov, N. (2024). Course Success Prediction and Early Identification of At-Risk Students Using Explainable Artificial Intelligence. Electronics, 13(21), 4157. https://doi.org/10.3390/electronics13214157

Urs, A. L. A. D., & Sudharshan, A. (2025). A multi-factor machine learning framework for predicting and profiling student academic performance using behavioral, financial, and wearable data. MethodsX, 15, 103673. (pub.1193747937). https://doi.org/10.1016/j.mex.2025.103673

Valan, P., & Venugopal, P. (2025). Evaluating a retrieval-augmented pregnancy chatbot: A comprehensibility–accuracy-readability study of the DIAN AI assistant. Frontiers in Artificial Intelligence, 8. Scopus. https://doi.org/10.3389/frai.2025.1640994

Vidivelli, S., Ramachandran, M., & Dharunbalaji, A. (2024). Efficiency-Driven Custom Chatbot Development: Unleashing LangChain, RAG, and Performance-Optimized LLM Fusion. Computers, Materials & Continua, 80(2), 2423-2442. https://doi.org/10.32604/cmc.2024.054360

Wang, Y. (2025). Artificial intelligence in student management systems to enhance academic performance monitoring and intervention. Scientific Reports, 15(1), 35122. (pub.1193664396). https://doi.org/10.1038/s41598-025-19159-4

Xu, H., Wan, L., Li, Y., Liu, J., & Lau, A. S. M. (2025). Comparative Analysis of Chatbot Systems. En Lau A. & Tallon-Ballesteros A.J. (Eds.), Front. Artif. Intell. Appl. (Vol. 412, pp. 392-398). IOS Press BV. Scopus. https://doi.org/10.3233/FAIA250737

Yadav, V. (2025). Rag Based Personal AI Chatbot for College Information System. International Journal for Research in Applied Science and Engineering Technology, 13(11), 2546-2549. https://doi.org/10.22214/ijraset.2025.75924

Zhang, J. (2025). AI Agents in Education: Four Trends and a Practical Workflow. Proceedings of the AAAI Symposium Series, 5(1), 131-132. https://doi.org/10.1609/aaaiss.v5i1.35578

Zhang, K., Jiang, B., Guo, Y., & Liu, X. (2026). Knowledge Base Scope Matters: A Comparative Study of Retrieval-Augmented Generation in Academic Library Collection Development. https://doi.org/10.21203/rs.3.rs-9463160/v1

Zhao, C., Maria, R. D., Kumarage, T., Chaudhary, K. S., Agrawal, G., Li, Y., Park, J., Deng, Y., Chen, Y.-C., & Liu, H. (2025). CyberBOT: Towards Reliable Cybersecurity Education via Ontology-Grounded Retrieval Augmented Generation. Proceedings of the 34th ACM International Conference on Information and Knowledge Management, 6752-6756. https://doi.org/10.1145/3746252.3761478

Back to Top

Document information

Published on 21/07/26

Licence: CC BY-NC-SA license

Document Score

0

Views 12
Recommendations 0

Share this document