El framework DIVA

Un modelo para diagnosticar si una evaluación todavía produce evidencia de aprendizaje cuando la inteligencia artificial generativa puede resolverla, y para orientar su rediseño.

Miguel Morales-Chan · Universidad Galileo · Versión 1.0

01 · El problema

Un problema de validez, no de integridad

La discusión sobre inteligencia artificial en educación superior se organizó alrededor de una pregunta: ¿usó IA el estudiante? Esa pregunta orientó políticas institucionales, adquisición de detectores y procedimientos disciplinarios. Y no ha producido mejoras observables en el diseño de las evaluaciones.

Hay una razón estructural para ello. La pregunta por el uso de IA pertenece al ámbito de la integridad académica, mientras que el fenómeno que estamos observando pertenece al de la validez. Son problemas distintos y admiten soluciones distintas.

Cuando un sistema generativo puede producir el entregable completo de una actividad, el entregable deja de ser evidencia del aprendizaje del estudiante, con independencia de quién lo haya producido. La calificación sigue existiendo, pero ha perdido su capacidad de representar lo que sabe quien la recibe. El problema persiste aunque ningún estudiante haya usado IA.

Una actividad puede estar libre de IA y no evidenciar nada. Otra puede permitir su uso y evidenciar mucho. El marco de la integridad no distingue esos dos casos; el de la validez sí.

De ahí se sigue la limitación de la detección automatizada. Aun asumiendo una fiabilidad que hoy no tiene, un detector devuelve una probabilidad de uso de IA, no una respuesta sobre qué aprendió el estudiante. Responde a una pregunta que no es la que necesitamos responder.

02 · El modelo

Dos ejes independientes

DIVA —Diagnóstico del Valor de la Evaluación ante la IA— cruza dos dimensiones que no covarían necesariamente. Que una actividad puntúe alto en una no predice su posición en la otra, y de esa independencia proviene su utilidad diagnóstica.

Eje vertical

Sustituibilidad por IA

¿Puede un sistema generativo producir el entregable completo sin intervención sustantiva del estudiante?

Aumenta conDisminuye con
Productos puramente textuales sin proceso visible Datos o contexto que solo el estudiante posee
Respuestas convergentes con solución única Problemas abiertos con múltiples soluciones defendibles
Consignas genéricas y localizables Interacción en tiempo real o respuesta a estímulos imprevisibles
Entrega única sin trazabilidad Proceso documentado por fases con evidencia intermedia
Eje horizontal

Valor diagnóstico

¿La actividad permite inferir qué aprendió el estudiante y en qué grado?

Aumenta conDisminuye con
Trazabilidad del proceso y de las decisiones tomadas Evaluación exclusiva del producto final
Validación de autoría en algún momento del recorrido Criterios centrados en forma, estructura y corrección
Justificación explícita de decisiones que exigen criterio Ausencia de momentos donde el estudiante deba elegir y defender
Alineación entre el nivel cognitivo declarado y el exigido Objetivos de orden superior evaluados con evidencias de orden inferior

La segunda dimensión merece una precisión: describe una propiedad del diseño de la evaluación, no del estado de la tecnología. Una actividad que documenta su proceso y valida autoría seguirá evidenciando aprendizaje aunque los modelos mejoren. Esta característica distingue a DIVA de los marcos que se apoyan en las limitaciones actuales de la IA, cuya vigencia caduca con cada nueva generación de modelos.

03 · Las cuatro zonas

Qué revela el cruce

Q1

Zona crítica

Evaluaciones colapsadas

Alta sustituibilidad y bajo valor diagnóstico. El sistema resuelve la tarea completa y el diseño no deja rastro del proceso. El entregable no permite inferir aprendizaje.

Ejemplos: ensayos tradicionales, resúmenes, ejercicios cerrados, correcciones de texto, explicación de conceptos.
Q2

Zona de riesgo

Evaluaciones engañosas

Sustituibilidad alta con valor diagnóstico moderado. Actividades que aparentan exigencia y producen confianza injustificada. El esfuerzo visible enmascara la ausencia de evidencia.

Ejemplos: proyectos sin defensa, casos sin validación oral, ensayos reflexivos sin proceso documentado.
Q3

Zona de transformación

Recuperables con ajustes

Baja sustituibilidad pero también bajo valor diagnóstico. La IA no puede sustituir al estudiante, pero el diseño tampoco evidencia lo aprendido. Potencial desaprovechado.

Ejemplos: trabajos colaborativos sin trazabilidad individual, prácticas sin registro de proceso, proyectos sin criterios explícitos.
Q4

Zona óptima

A prueba de IA

Baja sustituibilidad y alto valor diagnóstico. La IA puede apoyar sin sustituir, y el diseño produce evidencia de aprendizaje auténtico.

Ejemplos: defensa oral, análisis crítico de salidas de IA, contexto personal, iteraciones documentadas, problemas abiertos.

Una precisión sobre la Zona de Riesgo

Q2 concentra el interés diagnóstico del modelo, y conviene formular con exactitud qué la define. No es la zona donde la inteligencia artificial interviene mucho: es la zona donde el diseño no distingue entre las operaciones que pueden delegarse legítimamente y aquellas que constituyen el aprendizaje a formar.

Una actividad puede admitir que un sistema realice la búsqueda bibliográfica, la organización del texto y el formato de las referencias sin comprometer nada esencial. Lo que no puede delegarse es la decisión sobre la fiabilidad de una fuente contradictoria, la interpretación sostenida ante evidencia divergente, o la defensa de una conclusión ante quien la discute. Cuando el diseño no separa unas operaciones de otras, el estudiante delega todo y el docente no puede saber qué se delegó.

De esta formulación se sigue una consecuencia contraintuitiva: una sustituibilidad baja no es en sí misma preferible. Una actividad donde nada puede delegarse podría estar exigiendo trabajo mecánico sin valor formativo. Lo determinante no es cuánto puede delegarse, sino si lo no delegable está protegido por el diseño.

04 · Fundamentos

De dónde viene el modelo

DIVA no propone principios pedagógicos nuevos. Su aporte es articular en un instrumento diagnóstico aplicable un conjunto de conceptos ya establecidos, que hasta ahora operaban por separado.

FundamentoAporte al modelo
Validez y seguridad de la evaluación
Dawson (2021)
La distinción entre proteger la evaluación y asegurar que mida lo que declara medir. Sustenta el desplazamiento del marco de integridad al de validez.
Propósitos de la evaluación
Archer (2017)
No toda evaluación persigue el mismo fin. El valor diagnóstico debe interpretarse en relación con el propósito declarado: apoyar el aprendizaje, certificar o rendir cuentas.
Alineación constructiva
Biggs (1996)
La coherencia entre objetivos, actividades y criterios. Fundamenta que el diagnóstico considere la rúbrica junto con la consigna.
Evaluación auténtica
Wiggins; Villarroel et al. (2018)
Contextualización, realismo y transferencia. Define las características de la Zona Óptima.
Juicio evaluativo
Tai, Ajjawi, Boud, Dawson (2018)
La capacidad de emitir juicios sobre la calidad del propio trabajo y del ajeno. Justifica que la auditoría crítica de salidas de IA constituya evidencia de aprendizaje.
Carga de evaluación
Tomas y Jessop (2019)
La carga excesiva produce aprendizaje superficial y presión temporal. Fundamenta que el rediseño se restrinja al tiempo real disponible.
Principio AAA
Lye y Lim (2024)
Marco prescriptivo para el rediseño ante IA generativa. Complementario: DIVA diagnostica el estado actual, AAA orienta la modalidad de intervención.
Descarga cognitiva estructurada
Hong et al. (2025)
Evidencia cuasiexperimental de que delegar tareas de orden inferior y conservar el análisis mejora el pensamiento crítico. Sustenta que el rediseño produce efectos, no solo evita riesgos.
Nota sobre las referencias. Este listado corresponde a las fuentes que fundamentan el modelo. Para uso académico, conviene consultar cada obra en su publicación original: las descripciones anteriores resumen su aporte a DIVA, no sustituyen la lectura de las fuentes.
05 · Proposiciones

Qué afirma el modelo y cómo puede refutarse

DIVA formula proposiciones contrastables. Se enuncian aquí explícitamente para que puedan someterse a prueba en el estudio en curso.

Proposición 1 · Independencia de los ejes

La sustituibilidad por IA y el valor diagnóstico son dimensiones independientes: la posición de una actividad en un eje no predice su posición en el otro.

Proposición 2 · Concentración inicial

La mayoría de las actividades de evaluación vigentes en educación superior se ubican en los cuadrantes de alta sustituibilidad (Q1 y Q2), con independencia de la disciplina.

Proposición 3 · Movilidad

Una actividad diagnosticada puede desplazarse hacia la Zona Óptima mediante intervenciones acotadas de diseño, sin incremento proporcional de la carga de revisión docente.

Proposición 4 · Restricción de viabilidad

Las propuestas de rediseño que exceden el tiempo de revisión disponible del docente no se implementan, con independencia de su calidad pedagógica.

Proposición 5 · Desarrollo de criterio

El uso reiterado del diagnóstico con retroalimentación explicada incrementa la capacidad del docente para identificar vulnerabilidades en sus propias evaluaciones sin asistencia.

La quinta es la más exigente y la más importante: si se sostiene, el instrumento no sustituye criterio profesional sino que lo construye. Su contrastación requiere medir el desempeño del docente trabajando sin la herramienta tras un número determinado de usos.

06 · Aplicación

Un caso documentado

El siguiente caso corresponde a una actividad real de un curso universitario de administración, diagnosticada y rediseñada con el instrumento derivado del modelo.

Actividad original

Investigar un caso real de aplicación de inteligencia artificial generativa en el sector bancario o empresarial. Elaborar una presentación de cuatro diapositivas y grabar un video de dos minutos explicando el caso. Entrega única. Grupo de 25 estudiantes.

Diagnóstico inicial
Q2 · Zona de riesgo
Sustituibilidad 82 · Valor 52
→
Tras el rediseño
Q4 · Zona óptima
Sustituibilidad 34 · Valor 78

Por qué Q2 y no Q1. La actividad exige tres entregables y contiene un componente audiovisual, lo que produce apariencia de exigencia. Sin embargo, el caso es externo y genérico, el video admite lectura de guion, y no existe validación posterior. La sustituibilidad es alta con esfuerzo visible: el perfil característico de la zona de riesgo.

Intervenciones aplicadas. Tres cambios acotados, ninguno de los cuales añade entregables:

  • El caso deja de elegirse libremente y se analiza contra un perfil de organización que asigna el docente, con datos distintos por estudiante. Un contexto asignado no puede generarse sin ese insumo.
  • El video responde a una pregunta revelada al iniciar la grabación, en una sola toma. Sustituye una restricción no verificable —«no leer un guion»— por un mecanismo comprobable.
  • Se exige verificación de dos fuentes primarias con evidencia del contraste, atendiendo a la tendencia de los sistemas generativos a fabricar referencias.

Carga de revisión. El diseño original implicaba 15,1 horas de calificación para el grupo completo. El rediseño, con muestreo en la fase de auditoría, requiere 2,6 horas. La reducción proviene de sustituir entregables extensos por evidencias breves y verificables.

El caso ilustra la Proposición 3: el desplazamiento entre cuadrantes se produjo mediante intervenciones de diseño acotadas y con reducción, no incremento, de la carga docente.

07 · Límites

Qué no resuelve el modelo

La utilidad de un instrumento diagnóstico depende de que sus límites estén declarados.

El propósito de la evaluación condiciona la lectura

DIVA trata la Zona Óptima como destino deseable, pero no toda evaluación debe alcanzarla. Una prueba de opción múltiple destinada a certificar contenidos exigidos por un organismo profesional puede ser válida para su propósito. En ese caso la respuesta adecuada no es rediseñar, sino aplicar condiciones de supervisión. La incorporación del propósito como variable de entrada corrige esta limitación y está prevista para la siguiente versión del modelo.

La unidad de análisis es la actividad, no el programa

El modelo diagnostica actividades aisladas. La literatura de evaluación programática sostiene que ninguna evaluación individual debe satisfacer todos los propósitos: lo relevante es la suficiencia del conjunto. Una extensión a nivel de curso permitiría analizar la distribución de las evaluaciones de un programa completo.

La puntuación es un promedio de operaciones heterogéneas

Un valor único de sustituibilidad agrega operaciones cognitivas de naturaleza distinta. Una descomposición por operación —distinguiendo lo delegable de lo que constituye la competencia a formar— produciría un diagnóstico más accionable.

El juicio automatizado requiere validación

El diagnóstico se genera mediante un modelo de lenguaje aplicando criterios explícitos. Esa aplicación puede errar. El instrumento registra el grado de acuerdo del docente con cada diagnóstico precisamente para estimar su validez percibida, y la propuesta de rediseño se entrega en formato editable: el criterio profesional decide.

08 · Instrumento

Del modelo a la práctica

Un marco conceptual que exige aplicación manual actividad por actividad no se implementa. Por esa razón DIVA se operacionalizó en Reeval-IA, un instrumento que aplica los criterios del modelo a una actividad concreta, fundamenta el diagnóstico, propone un rediseño ajustado a las restricciones declaradas por el docente y vuelve a diagnosticar el resultado para hacer observable el desplazamiento.

La distinción entre modelo e instrumento es deliberada: DIVA puede utilizarse, citarse y enseñarse con independencia del software.

Aplica el modelo a una actividad tuya

Diagnostica una evaluación real de tu curso y obtén su rediseño.

Solicitar acceso →
09 · Referencias

Fuentes

  1. Archer, E. (2017). The assessment purpose triangle: Balancing the purposes of educational assessment. Frontiers in Education, 2, 41.
  2. Biggs, J. (1996). Enhancing teaching through constructive alignment. Higher Education, 32(3), 347–364.
  3. Dawson, P. (2021). Defending Assessment Security in a Digital World: Preventing e-Cheating and Supporting Academic Integrity in Higher Education. Routledge.
  4. Hong, H., Vate-U-Lan, P. y Viriyavejakul, C. (2025). Cognitive Offload Instruction with Generative AI: A Quasi-Experimental Study on Critical Thinking Gains in English Writing. Forum for Linguistic Studies.
  5. Lodge, J. M., Thompson, K. y Corrin, L. (2023). Mapping out a research agenda for generative artificial intelligence in tertiary education. Australasian Journal of Educational Technology, 39(1), 1–8.
  6. Lye, C. Y. y Lim, L. (2024). Generative Artificial Intelligence in Tertiary Education: Assessment Redesign Principles and Considerations. Education Sciences, 14(6), 569.
  7. Miao, F. y Holmes, W. (2023). Guidance for Generative AI in Education and Research. UNESCO.
  8. Moorhouse, B. L., Yeo, M. A. y Wan, Y. (2023). Generative AI tools and assessment: Guidelines of the world's top-ranking universities. Computers and Education Open, 5, 100151.
  9. Tai, J., Ajjawi, R., Boud, D., Dawson, P. y Panadero, E. (2018). Developing evaluative judgement: enabling students to make decisions about the quality of work. Higher Education, 76, 467–481.
  10. Tomas, C. y Jessop, T. (2019). Struggling and juggling: a comparison of student assessment loads across research and teaching-intensive universities. Assessment & Evaluation in Higher Education, 44(1), 1–10.
  11. Villarroel, V., Bloxham, S., Bruna, D., Bruna, C. y Herrera-Seda, C. (2018). Authentic assessment: creating a blueprint for course design. Assessment & Evaluation in Higher Education, 43(5), 840–854.

El framework DIVA es un modelo desarrollado por Miguel Morales-Chan y se distribuye bajo licencia CC BY 4.0. Puede usarse, citarse y enseñarse indicando la autoría.