Si una IA califica ensayos, ¿quién verifica a la IA?
Un artículo de PLOS One propone cómo medir confiabilidad, validez y equidad de los puntajes que produce un modelo de IA al calificar ensayos.
Publicado el 11 de septiembre de 2026
"La equidad y la validez no son propiedades de la arquitectura." Es la frase con la que cierra un artículo de PLOS One sobre calificación automática de ensayos, y aplica a cualquier certificadora que esté evaluando usar IA para puntuar.
Los autores, Rudolf Debelak y Matthias Ziegler, parten de que los puntajes de IA deben cumplir los mismos estándares profesionales que cualquier prueba: los Standards for Educational and Psychological Testing y las guías de evaluación basada en tecnología de la International Test Commission. Y proponen cómo medirlos cuando no hay ítems: dividir el texto en mitades para estimar consistencia, perturbar el texto de entrada para probar robustez y validez, y comparar la precisión del modelo entre subgrupos para detectar inequidad.
En su ejemplo con 12.976 ensayos y un modelo DistilBERT, la consistencia interna fue alta (0.77 a 0.92) y hubo evidencia de validez, pero también indicios de inequidad entre temas de ensayo. Su recomendación cuando eso ocurre: más entrenamiento o ajuste fino, y si no alcanza, cambiar de modelo.
Advierten además que el conjunto de datos no tiene edad ni género, así que la equidad por persona no se pudo evaluar.
El patrón: la pregunta ya no es si la IA puede calificar, sino si alguien verificó que califica bien y parejo.
Fuente: Debelak y Ziegler, PLOS One, julio 2026. https://doi.org/10.1371/journal.pone.0354680