Iniciativa · Global · Observación de aula

Teach + IA

Escalamiento de la observación de aula del Banco Mundial con LLMs. En 199 aulas primarias en Perú, un modelo cuidadosamente calibrado alcanza los estándares de confiabilidad de observadores humanos certificados — 92,9% de acuerdo con el observador certificado, 81–99% de acuerdo a nivel de elemento.

Teach Primary — manual del observador
Qué es Teach

El marco de observación de aula del Banco Mundial.

Teach es una herramienta gratuita y validada, usada por ministerios de educación de todo el mundo para medir la calidad de las prácticas pedagógicas en aulas de primaria. Requiere observadores humanos entrenados y certificados. Es el estándar operativo del sistema del Banco Mundial de apoyo a docentes en países de ingreso bajo y medio.

  • Rúbrica publicada. Manual del observador disponible en inglés, español, francés, portugués y swahili.
  • Cobertura ECE / primaria / secundaria. Diseñado para todos los niveles de la educación básica.
  • Certificación obligatoria de observadores. Estándar operativo del programa: el observador tiene que pasar una prueba de confiabilidad.
  • Base de datos internacional de referencia para evaluar y comparar entre países.
El problema

Escalar la observación de aula es caro.

Implementar un sistema riguroso de observación a nivel nacional costaría ~$3 mil millones/año solo en Estados Unidos — cerca del 0,3% del gasto total K-12. Es una fracción prohibitiva en la mayoría de los presupuestos educativos de países de ingreso bajo y medio. El resultado: la mayoría de los sistemas educativos no tienen información sistemática sobre qué pasa dentro de sus aulas.

La evidencia es clara: retroalimentación regular y bien informada mejora el desempeño docente. Pero el costo del rater humano limita la frecuencia con la que puede ocurrir. Los docentes que más necesitan feedback son los que menos lo reciben.
El enfoque

La rúbrica humana como fuente de expertise. El LLM como evaluador de alta capacidad y bajo costo marginal.

Un LLM (Gemini 2.0 / 2.5 Flash) aplica la rúbrica completa de Teach Primary a transcripciones de aulas peruanas. La rúbrica humana no cambia: sigue siendo el estándar. El framing correcto es technology-facilitated expert scoring — un escalamiento del juicio experto, no un reemplazo. La IA no descubre una nueva forma de evaluar. Aplica la que ya conocemos, de manera consistente y a escala.

Qué se mantiene

El manual del observador. La rúbrica. Los estándares de certificación. El marco pedagógico. Todo lo que hace de Teach un instrumento validado.

Qué cambia

Quién aplica la rúbrica a cada aula. En vez de un rater humano por aula, el LLM aplica el mismo criterio a decenas de miles de transcripciones — con costo marginal cercano a cero por aula adicional.

Los hallazgos

199 aulas primarias en Perú. Cumple el criterio de certificación de Teach.

La configuración óptima cumple el criterio de certificación within-one-point de Teach en el 92,9% de los exámenes simulados (Monte Carlo), y alcanza acuerdo a nivel de elemento en el rango de raters humanos entrenados. El gold standard es un solo observador de campo certificado, no un master coder del programa.

92.9%
Acuerdo con el observador humano certificado
IC 95% [91.3, 94.5], criterio Teach
199
Aulas primarias en Perú
Transcripciones evaluadas por LLM y humanos
81–99%
Acuerdo a nivel de elemento
Rango de raters humanos entrenados
8
Configuraciones de LLM evaluadas
Gemini 2.0 y 2.5 Flash
~0%
Certificación con una rúbrica mínima
La rúbrica importa. Mucho.
~93%
Certificación con rúbrica bien diseñada
De cero a certificación con solo rediseñar el prompt
Qué importa

La calidad de la rúbrica manda. La verbosidad no.

Una regresión que aísla cada palanca de diseño muestra que la calidad de la rúbrica y los priors distribucionales son los dos drivers dominantes del acuerdo — mientras que el chain-of-thought reasoning y el snapshot tagging no contribuyen. La lección para los equipos técnicos: invertir en ingeniería de rúbricas, no en trucos de prompting.

Qué mueve la aguja

Contenido de la rúbrica — nivel de detalle, ejemplos ancla, ausencia de escape hatches. Y priors distribucionales — dar al LLM la base rate esperada para calibrar sus outputs.

Qué NO mueve la aguja

Chain-of-thought — pedirle al LLM que razone paso a paso. Y snapshot tagging — marcar segmentos con timestamps estructurados. Contra-intuitivo, pero los datos son claros.

Por qué importa

Feedback formativo, más frecuente, al alcance de los ministerios.

Un LLM confiable como rater habilita a ministerios y programas de apoyo docente a entregar retroalimentación formativa de manera más frecuente y con menor costo marginal. No reemplaza al observador certificado. Le da un compañero de bajo costo para escalar el mismo criterio a más aulas.

El equipo

Autoras y autores del estudio.

Jostin Kitmang
Harvard University
Matthew D. Krasnow
Harvard University · Swiftscore
William J. Krasnow
Swiftscore
Carolina Lopez
World Bank
Ezequiel Molina
World Bank
Carolina Moreira Vasquez
World Bank
Recursos

Explorá Teach y descargá el manual.

Sitio · Banco Mundial

Teach — Helping countries track and improve teaching quality

La página oficial de Teach en el Banco Mundial. Manuales, videos, guías de implementación y casos de países.

Explorar Teach en el BM
Manual · WB Documents

Teach Primary — Observer Manual

Manual del observador, disponible en inglés, español, francés, portugués y swahili en el repositorio del Banco Mundial.

Descargar manual
Working paper

Scaling up classroom observation with large language models: A reliability study of the World Bank's Teach framework in Peru

Kitmang, Krasnow, Krasnow, Lopez, Molina, Moreira Vasquez. Metodología completa, análisis de configuraciones y regresión de palancas.

Preprint próximamente