El framework DIVA
Un modelo para diagnosticar si una evaluación todavía produce evidencia de aprendizaje cuando la inteligencia artificial generativa puede resolverla, y para orientar su rediseño.
Miguel Morales-Chan · Universidad Galileo · Versión 1.0
Un problema de validez, no de integridad
La discusión sobre inteligencia artificial en educación superior se organizó alrededor de una pregunta: ¿usó IA el estudiante? Esa pregunta orientó políticas institucionales, adquisición de detectores y procedimientos disciplinarios. Y no ha producido mejoras observables en el diseño de las evaluaciones.
Hay una razón estructural para ello. La pregunta por el uso de IA pertenece al ámbito de la integridad académica, mientras que el fenómeno que estamos observando pertenece al de la validez. Son problemas distintos y admiten soluciones distintas.
Cuando un sistema generativo puede producir el entregable completo de una actividad, el entregable deja de ser evidencia del aprendizaje del estudiante, con independencia de quién lo haya producido. La calificación sigue existiendo, pero ha perdido su capacidad de representar lo que sabe quien la recibe. El problema persiste aunque ningún estudiante haya usado IA.
Una actividad puede estar libre de IA y no evidenciar nada. Otra puede permitir su uso y evidenciar mucho. El marco de la integridad no distingue esos dos casos; el de la validez sí.
De ahí se sigue la limitación de la detección automatizada. Aun asumiendo una fiabilidad que hoy no tiene, un detector devuelve una probabilidad de uso de IA, no una respuesta sobre qué aprendió el estudiante. Responde a una pregunta que no es la que necesitamos responder.
Dos ejes independientes
DIVA —Diagnóstico del Valor de la Evaluación ante la IA— cruza dos dimensiones que no covarían necesariamente. Que una actividad puntúe alto en una no predice su posición en la otra, y de esa independencia proviene su utilidad diagnóstica.
Sustituibilidad por IA
¿Puede un sistema generativo producir el entregable completo sin intervención sustantiva del estudiante?
| Aumenta con | Disminuye con |
|---|---|
| Productos puramente textuales sin proceso visible | Datos o contexto que solo el estudiante posee |
| Respuestas convergentes con solución única | Problemas abiertos con múltiples soluciones defendibles |
| Consignas genéricas y localizables | Interacción en tiempo real o respuesta a estímulos imprevisibles |
| Entrega única sin trazabilidad | Proceso documentado por fases con evidencia intermedia |
Valor diagnóstico
¿La actividad permite inferir qué aprendió el estudiante y en qué grado?
| Aumenta con | Disminuye con |
|---|---|
| Trazabilidad del proceso y de las decisiones tomadas | Evaluación exclusiva del producto final |
| Validación de autoría en algún momento del recorrido | Criterios centrados en forma, estructura y corrección |
| Justificación explícita de decisiones que exigen criterio | Ausencia de momentos donde el estudiante deba elegir y defender |
| Alineación entre el nivel cognitivo declarado y el exigido | Objetivos de orden superior evaluados con evidencias de orden inferior |
La segunda dimensión merece una precisión: describe una propiedad del diseño de la evaluación, no del estado de la tecnología. Una actividad que documenta su proceso y valida autoría seguirá evidenciando aprendizaje aunque los modelos mejoren. Esta característica distingue a DIVA de los marcos que se apoyan en las limitaciones actuales de la IA, cuya vigencia caduca con cada nueva generación de modelos.
Qué revela el cruce
Zona crítica
Alta sustituibilidad y bajo valor diagnóstico. El sistema resuelve la tarea completa y el diseño no deja rastro del proceso. El entregable no permite inferir aprendizaje.
Zona de riesgo
Sustituibilidad alta con valor diagnóstico moderado. Actividades que aparentan exigencia y producen confianza injustificada. El esfuerzo visible enmascara la ausencia de evidencia.
Zona de transformación
Baja sustituibilidad pero también bajo valor diagnóstico. La IA no puede sustituir al estudiante, pero el diseño tampoco evidencia lo aprendido. Potencial desaprovechado.
Zona óptima
Baja sustituibilidad y alto valor diagnóstico. La IA puede apoyar sin sustituir, y el diseño produce evidencia de aprendizaje auténtico.
Una precisión sobre la Zona de Riesgo
Q2 concentra el interés diagnóstico del modelo, y conviene formular con exactitud qué la define. No es la zona donde la inteligencia artificial interviene mucho: es la zona donde el diseño no distingue entre las operaciones que pueden delegarse legítimamente y aquellas que constituyen el aprendizaje a formar.
Una actividad puede admitir que un sistema realice la búsqueda bibliográfica, la organización del texto y el formato de las referencias sin comprometer nada esencial. Lo que no puede delegarse es la decisión sobre la fiabilidad de una fuente contradictoria, la interpretación sostenida ante evidencia divergente, o la defensa de una conclusión ante quien la discute. Cuando el diseño no separa unas operaciones de otras, el estudiante delega todo y el docente no puede saber qué se delegó.
De esta formulación se sigue una consecuencia contraintuitiva: una sustituibilidad baja no es en sí misma preferible. Una actividad donde nada puede delegarse podría estar exigiendo trabajo mecánico sin valor formativo. Lo determinante no es cuánto puede delegarse, sino si lo no delegable está protegido por el diseño.
De dónde viene el modelo
DIVA no propone principios pedagógicos nuevos. Su aporte es articular en un instrumento diagnóstico aplicable un conjunto de conceptos ya establecidos, que hasta ahora operaban por separado.
| Fundamento | Aporte al modelo |
|---|---|
| Validez y seguridad de la evaluación Dawson (2021) |
La distinción entre proteger la evaluación y asegurar que mida lo que declara medir. Sustenta el desplazamiento del marco de integridad al de validez. |
| Propósitos de la evaluación Archer (2017) |
No toda evaluación persigue el mismo fin. El valor diagnóstico debe interpretarse en relación con el propósito declarado: apoyar el aprendizaje, certificar o rendir cuentas. |
| Alineación constructiva Biggs (1996) |
La coherencia entre objetivos, actividades y criterios. Fundamenta que el diagnóstico considere la rúbrica junto con la consigna. |
| Evaluación auténtica Wiggins; Villarroel et al. (2018) |
Contextualización, realismo y transferencia. Define las características de la Zona Óptima. |
| Juicio evaluativo Tai, Ajjawi, Boud, Dawson (2018) |
La capacidad de emitir juicios sobre la calidad del propio trabajo y del ajeno. Justifica que la auditoría crítica de salidas de IA constituya evidencia de aprendizaje. |
| Carga de evaluación Tomas y Jessop (2019) |
La carga excesiva produce aprendizaje superficial y presión temporal. Fundamenta que el rediseño se restrinja al tiempo real disponible. |
| Principio AAA Lye y Lim (2024) |
Marco prescriptivo para el rediseño ante IA generativa. Complementario: DIVA diagnostica el estado actual, AAA orienta la modalidad de intervención. |
| Descarga cognitiva estructurada Hong et al. (2025) |
Evidencia cuasiexperimental de que delegar tareas de orden inferior y conservar el análisis mejora el pensamiento crítico. Sustenta que el rediseño produce efectos, no solo evita riesgos. |
Qué afirma el modelo y cómo puede refutarse
DIVA formula proposiciones contrastables. Se enuncian aquí explícitamente para que puedan someterse a prueba en el estudio en curso.
La sustituibilidad por IA y el valor diagnóstico son dimensiones independientes: la posición de una actividad en un eje no predice su posición en el otro.
La mayoría de las actividades de evaluación vigentes en educación superior se ubican en los cuadrantes de alta sustituibilidad (Q1 y Q2), con independencia de la disciplina.
Una actividad diagnosticada puede desplazarse hacia la Zona Óptima mediante intervenciones acotadas de diseño, sin incremento proporcional de la carga de revisión docente.
Las propuestas de rediseño que exceden el tiempo de revisión disponible del docente no se implementan, con independencia de su calidad pedagógica.
El uso reiterado del diagnóstico con retroalimentación explicada incrementa la capacidad del docente para identificar vulnerabilidades en sus propias evaluaciones sin asistencia.
La quinta es la más exigente y la más importante: si se sostiene, el instrumento no sustituye criterio profesional sino que lo construye. Su contrastación requiere medir el desempeño del docente trabajando sin la herramienta tras un número determinado de usos.
Un caso documentado
El siguiente caso corresponde a una actividad real de un curso universitario de administración, diagnosticada y rediseñada con el instrumento derivado del modelo.
Investigar un caso real de aplicación de inteligencia artificial generativa en el sector bancario o empresarial. Elaborar una presentación de cuatro diapositivas y grabar un video de dos minutos explicando el caso. Entrega única. Grupo de 25 estudiantes.
Sustituibilidad 82 · Valor 52
Sustituibilidad 34 · Valor 78
Por qué Q2 y no Q1. La actividad exige tres entregables y contiene un componente audiovisual, lo que produce apariencia de exigencia. Sin embargo, el caso es externo y genérico, el video admite lectura de guion, y no existe validación posterior. La sustituibilidad es alta con esfuerzo visible: el perfil característico de la zona de riesgo.
Intervenciones aplicadas. Tres cambios acotados, ninguno de los cuales añade entregables:
- El caso deja de elegirse libremente y se analiza contra un perfil de organización que asigna el docente, con datos distintos por estudiante. Un contexto asignado no puede generarse sin ese insumo.
- El video responde a una pregunta revelada al iniciar la grabación, en una sola toma. Sustituye una restricción no verificable —«no leer un guion»— por un mecanismo comprobable.
- Se exige verificación de dos fuentes primarias con evidencia del contraste, atendiendo a la tendencia de los sistemas generativos a fabricar referencias.
Carga de revisión. El diseño original implicaba 15,1 horas de calificación para el grupo completo. El rediseño, con muestreo en la fase de auditoría, requiere 2,6 horas. La reducción proviene de sustituir entregables extensos por evidencias breves y verificables.
El caso ilustra la Proposición 3: el desplazamiento entre cuadrantes se produjo mediante intervenciones de diseño acotadas y con reducción, no incremento, de la carga docente.
Qué no resuelve el modelo
La utilidad de un instrumento diagnóstico depende de que sus límites estén declarados.
El propósito de la evaluación condiciona la lectura
DIVA trata la Zona Óptima como destino deseable, pero no toda evaluación debe alcanzarla. Una prueba de opción múltiple destinada a certificar contenidos exigidos por un organismo profesional puede ser válida para su propósito. En ese caso la respuesta adecuada no es rediseñar, sino aplicar condiciones de supervisión. La incorporación del propósito como variable de entrada corrige esta limitación y está prevista para la siguiente versión del modelo.
La unidad de análisis es la actividad, no el programa
El modelo diagnostica actividades aisladas. La literatura de evaluación programática sostiene que ninguna evaluación individual debe satisfacer todos los propósitos: lo relevante es la suficiencia del conjunto. Una extensión a nivel de curso permitiría analizar la distribución de las evaluaciones de un programa completo.
La puntuación es un promedio de operaciones heterogéneas
Un valor único de sustituibilidad agrega operaciones cognitivas de naturaleza distinta. Una descomposición por operación —distinguiendo lo delegable de lo que constituye la competencia a formar— produciría un diagnóstico más accionable.
El juicio automatizado requiere validación
El diagnóstico se genera mediante un modelo de lenguaje aplicando criterios explícitos. Esa aplicación puede errar. El instrumento registra el grado de acuerdo del docente con cada diagnóstico precisamente para estimar su validez percibida, y la propuesta de rediseño se entrega en formato editable: el criterio profesional decide.
Del modelo a la práctica
Un marco conceptual que exige aplicación manual actividad por actividad no se implementa. Por esa razón DIVA se operacionalizó en Reeval-IA, un instrumento que aplica los criterios del modelo a una actividad concreta, fundamenta el diagnóstico, propone un rediseño ajustado a las restricciones declaradas por el docente y vuelve a diagnosticar el resultado para hacer observable el desplazamiento.
La distinción entre modelo e instrumento es deliberada: DIVA puede utilizarse, citarse y enseñarse con independencia del software.
Aplica el modelo a una actividad tuya
Diagnostica una evaluación real de tu curso y obtén su rediseño.
Solicitar acceso →Fuentes
- Archer, E. (2017). The assessment purpose triangle: Balancing the purposes of educational assessment. Frontiers in Education, 2, 41.
- Biggs, J. (1996). Enhancing teaching through constructive alignment. Higher Education, 32(3), 347–364.
- Dawson, P. (2021). Defending Assessment Security in a Digital World: Preventing e-Cheating and Supporting Academic Integrity in Higher Education. Routledge.
- Hong, H., Vate-U-Lan, P. y Viriyavejakul, C. (2025). Cognitive Offload Instruction with Generative AI: A Quasi-Experimental Study on Critical Thinking Gains in English Writing. Forum for Linguistic Studies.
- Lodge, J. M., Thompson, K. y Corrin, L. (2023). Mapping out a research agenda for generative artificial intelligence in tertiary education. Australasian Journal of Educational Technology, 39(1), 1–8.
- Lye, C. Y. y Lim, L. (2024). Generative Artificial Intelligence in Tertiary Education: Assessment Redesign Principles and Considerations. Education Sciences, 14(6), 569.
- Miao, F. y Holmes, W. (2023). Guidance for Generative AI in Education and Research. UNESCO.
- Moorhouse, B. L., Yeo, M. A. y Wan, Y. (2023). Generative AI tools and assessment: Guidelines of the world's top-ranking universities. Computers and Education Open, 5, 100151.
- Tai, J., Ajjawi, R., Boud, D., Dawson, P. y Panadero, E. (2018). Developing evaluative judgement: enabling students to make decisions about the quality of work. Higher Education, 76, 467–481.
- Tomas, C. y Jessop, T. (2019). Struggling and juggling: a comparison of student assessment loads across research and teaching-intensive universities. Assessment & Evaluation in Higher Education, 44(1), 1–10.
- Villarroel, V., Bloxham, S., Bruna, D., Bruna, C. y Herrera-Seda, C. (2018). Authentic assessment: creating a blueprint for course design. Assessment & Evaluation in Higher Education, 43(5), 840–854.
El framework DIVA es un modelo desarrollado por Miguel Morales-Chan y se distribuye bajo licencia CC BY 4.0. Puede usarse, citarse y enseñarse indicando la autoría.