← Proctorizer Research
Proctorizer Research

Si una IA califica ensayos, ¿quién verifica a la IA?

Un artículo de PLOS One propone cómo medir confiabilidad, validez y equidad de los puntajes que produce un modelo de IA al calificar ensayos.

Publicado el 11 de septiembre de 2026

"La equidad y la validez no son propiedades de la arquitectura." Es la frase con la que cierra un artículo de PLOS One sobre calificación automática de ensayos, y aplica a cualquier certificadora que esté evaluando usar IA para puntuar.

Los autores, Rudolf Debelak y Matthias Ziegler, parten de que los puntajes de IA deben cumplir los mismos estándares profesionales que cualquier prueba: los Standards for Educational and Psychological Testing y las guías de evaluación basada en tecnología de la International Test Commission. Y proponen cómo medirlos cuando no hay ítems: dividir el texto en mitades para estimar consistencia, perturbar el texto de entrada para probar robustez y validez, y comparar la precisión del modelo entre subgrupos para detectar inequidad.

En su ejemplo con 12.976 ensayos y un modelo DistilBERT, la consistencia interna fue alta (0.77 a 0.92) y hubo evidencia de validez, pero también indicios de inequidad entre temas de ensayo. Su recomendación cuando eso ocurre: más entrenamiento o ajuste fino, y si no alcanza, cambiar de modelo.

Advierten además que el conjunto de datos no tiene edad ni género, así que la equidad por persona no se pudo evaluar.

El patrón: la pregunta ya no es si la IA puede calificar, sino si alguien verificó que califica bien y parejo.

Fuente: Debelak y Ziegler, PLOS One, julio 2026. https://doi.org/10.1371/journal.pone.0354680

Artículos relacionados

11 de septiembre de 2026

92% de estudiantes y 79% de docentes de América Latina ya usan IA

11 de septiembre de 2026

IA en el trabajo universitario: la adopción va por delante de la política

11 de septiembre de 2026

Cuando saben que los evalúa una IA, los candidatos se presentan distinto

¿Tiene un examen ahora? Soporte