Lo que la IA cambia en un curso de programación
Un asistente de código escribe hoy, en unos minutos, el proyecto que el año pasado les ponía a mis estudiantes: el código, el README, los diagramas. No lo digo para quejarme. Lo digo porque una parte de mi oficio queda caduca, y más vale mirarla de frente que prohibirla.
Muchos docentes reaccionan en dos tiempos: primero la detección y la prohibición, después, más tarde, la integración. Es lo que muestra la encuesta de Lau y Guo entre docentes de programación de nueve países (Lau y Guo, 2023). Ambos reflejos se entienden. El primero fracasa, porque los detectores son poco fiables y un proyecto hecho en casa no se puede comprobar. El segundo se queda a medio camino: «dejar que los estudiantes usen la IA» no es una pedagogía.
Esto es lo que retengo de esta lectura, y el curso que voy a rehacer a partir de ahí.
Lo que el asistente les hace a los principiantes
El resultado más sólido viene de un ensayo controlado realizado con cerca de mil alumnos turcos de secundaria en matemáticas (Bastani et al., 2025). Durante las sesiones de ejercicios, los alumnos que tenían acceso a un asistente tipo ChatGPT rendían claramente mejor que los demás. Retirado el acceso para el examen, rendían peor que quienes nunca habían tenido la herramienta. Solo una versión limitada, que daba pistas en lugar de respuestas, preservaba el aprendizaje. Son alumnos de secundaria en matemáticas, no estudiantes de informática, y traslado el resultado con prudencia; el mecanismo, en cambio, es el que cualquier docente de programación observa cada año: la respuesta generada da la impresión de haber comprendido. Ya había citado este ensayo en el texto del curso previo al inicio en prépa, donde me dirigía a los alumnos; lo que saco de él aquí tiene que ver con el diseño del curso.
Entre los programadores principiantes, Prather y sus colegas observaron dos poblaciones que divergen, en laboratorio y con seguimiento ocular (Prather et al., 2024). Quienes ya dominan las bases usan el asistente para ir más rápido y saben rechazar una sugerencia falsa. Los demás se hunden: aceptan código que no entienden y se construyen modelos mentales falsos. El estudio es cualitativo y la muestra pequeña, pero confirma lo que un experimento anterior con Codex ya dejaba ver: los alumnos mejor preparados son los que más partido sacan de la herramienta (Kazemitabaar et al., 2023).
De ahí saco un principio de trabajo: no se verifica lo que no se comprende. Saber pilotar una IA supone saber leer, diagnosticar y modificar código sin ella.
Dos cosas que enseñar, en este orden
Este principio tiene una consecuencia que no había calibrado al empezar. Un curso de programación debe enseñar ahora dos cosas distintas, y enseñarlas las dos.
La primera son las bases sin IA: leer código, encontrar en él lo que falla, modificarlo, justificar una elección. Nada nuevo en la lista; lo nuevo es que hay que certificarlas de forma explícita, en condiciones en las que el asistente no esté presente, porque ya no las certifica ninguna otra cosa.
La segunda es el uso de la IA para ir más allá de las bases. Esa competencia no es el prompt, que caduca en seis meses. Son cuatro cosas más duraderas: encuadrar un problema antes de delegarlo, empezando por las interfaces; verificar lo que se ha producido, mediante la relectura y mediante pruebas diseñadas para atrapar los errores de la herramienta; integrar veinte contribuciones generadas en una base de código que siga siendo coherente; y responder de cada línea, es decir, poder explicarla y hacerla evolucionar. Bearman y sus colegas llaman a la segunda «juicio evaluativo», la capacidad de juzgar la calidad de un trabajo, el propio y el ajeno, y hacen de ella el aprendizaje central de una formación en la era de la IA generativa (Bearman et al., 2024).
El orden importa. Los puntos dos y cuatro son imposibles sin la primera competencia. Un estudiante que no sabe leer código no pilota la IA, la padece. Enseñar la segunda sin haber certificado la primera es formar a gente que acepta lo que no entiende; es exactamente la población que describe Prather.
Lo que demuestra una entrega
Un proyecto entregado ya no dice gran cosa sobre quien lo entrega. El problema existía antes de los LLM: un estudio finlandés mostraba que una parte notable de los estudiantes no sabía explicar el funcionamiento del código que ellos mismos habían entregado (Lehtinen et al., 2021). La IA ha cambiado la escala.
Varias universidades han sacado de ahí un marco, siendo el de la Universidad de Sídney el más explícito: dos vías de evaluación. Una vía segura, presencial y sin IA, que certifica los aprendizajes. Una vía abierta, donde la IA está permitida puesto que no se puede prohibir, y que sirve para aprender. La escala AIAS de Perkins y sus colegas formaliza la misma idea en niveles de uso autorizado, que se fijan para cada evaluación según lo que esta mide (Perkins et al., 2024).
Lo resumo con una imagen: el carné y la conducción. La prueba sin IA expide el carné, el proyecto con IA califica la conducción, y una nota de conducción sin carné no certifica nada. La imagen tiene sus límites, y uno de ellos cuenta: nadie vuelve a examinarse del carné cada semestre, mientras que un estudiante progresa justo mientras se le evalúa. Mi examen parcial será por eso en papel, y pedirá leer código, encontrar en él el defecto, proponer la modificación y justificarla. También código generado por una IA, con defectos plantados, ya que la relectura se ha vuelto una competencia central.
Sobre este último punto, un estudio de METR merece citarse con sus límites. En 2025, dieciséis desarrolladores experimentados tardaron un 19 % más en sus tareas con un asistente de IA, mientras tenían la impresión de haber ido más rápido (Becker et al., 2025). La muestra es minúscula y el intervalo de confianza amplio; la réplica de 2026, con 57 desarrolladores, ya solo encuentra un efecto cercano a cero. Queda la distancia entre la sensación y la medida, y es esa la que me interesa como docente. Un desarrollador no sabe, desde dentro, si la IA le ayuda. Hay que enseñarle, pues, a verificar en vez de fiarse de su impresión.
Dos formatos que se mueren
Dos formatos no sobreviven a lo anterior, y prefiero decirlo con claridad.
La clase magistral, primero. Su función era transmitir información, y eso se ha convertido en el recurso menos escaso que existe. Un asistente explica el polimorfismo tan bien como un aula magna, a demanda, a las tres de la madrugada, y responde a las preguntas. Lo que no da es un retorno sobre lo que el estudiante produce, y un juicio ejercido delante de él. El formato dedicaba lo esencial del tiempo presencial a lo que abunda, y casi nada a lo que escasea.
La práctica guiada, después. Un enunciado paso a paso, con el esqueleto dado y el nombre del patrón en el título, se resuelve en treinta segundos con un asistente. Ya antes producía código que funciona sin que el estudiante hubiera tomado una sola decisión. Ya no tiene valor formativo, puesto que en él no se aprende nada que no se pueda delegar, ni valor evaluativo, puesto que el resultado no dice nada sobre su autor.
Lo que se muere es la transmisión oral larga y el ejercicio de aplicación sin decisión. Lo que no se muere es la explicación, cuando es corta y llega en el momento en que la necesidad acaba de sentirse, y la práctica con el ordenador, cuando parte de una situación y exige una elección.
Mis vídeos, y la inversión para nada
Ya había pasado mis cursos en línea, en forma de vídeos. Muchas horas de grabación. Mi primera reacción al leer todo esto fue decirme que era inversión perdida: si el asistente explica mejor que el aula magna, también explica mejor que el aula magna grabada.
Es en parte cierto, y hay que decirlo. Un vídeo que reproduce una clase magistral reproduce sus defectos, sin siquiera la presencia del docente. El estudio de referencia sobre el tema, hecho sobre cerca de siete millones de sesiones de visionado de cursos en línea, muestra que la atención cae a partir de los seis minutos sea cual sea la duración del vídeo, que las clases grabadas en el aula enganchan poco, y que los formatos en los que se resuelve un problema en pantalla funcionan mejor que las diapositivas comentadas (Guo, Kim y Rubin, 2014). Mide el enganche, no el aprendizaje, y sobre MOOC, no sobre formación reglada. Pero el mensaje no es ambiguo: el túnel grabado no es mejor que el túnel en el aula.
En parte solamente. Lo que pierde valor es la idea de que el vídeo sustituye al curso. Lo que lo conserva es el vídeo como recurso a demanda: seis minutos sobre un punto concreto, que un estudiante mira porque ha tropezado con él, seguidos de una pregunta que debe contestar. En el curso que rehago, pasa a ser la mitad de lo que ocurre fuera de la sesión: el apoyo de quien se descolgó durante la explicación, lo que el avanzado se salta, y el sitio al que remitir cuando un cuestionario revela una noción floja. Mis horas de grabación no están perdidas; voy a recortarlas, y nadie volverá a mirarlas pasivamente. Mirar un vídeo produce la misma ilusión de dominio que leer una respuesta generada. Sin una tarea detrás, no vale nada.
El tiempo presencial
Lo que la IA vuelve obsoleto es la transmisión de información. El tiempo presencial va ahora al retorno y al juicio.
La investigación lo decía antes de los LLM. El metaanálisis de Freeman y sus colegas, sobre 225 estudios en ciencias e ingeniería, encuentra una ganancia de alrededor de media desviación típica en los exámenes para las pedagogías activas, y una tasa de fracaso que pasa del 34 % al 22 % (Freeman et al., 2014). En informática, la instrucción por pares, donde se vota, se discute con el compañero y se vuelve a votar, reduce la tasa de fracaso aproximadamente a la mitad en cuatro asignaturas seguidas durante diez años (Porter, Bailey Lee y Simon, 2013).
Una reserva, de peso. «Activo» no quiere decir «apáñense». Para novatos, la enseñanza explícita y los ejemplos resueltos funcionan mejor que el descubrimiento (Kirschner, Sweller y Clark, 2006). Ese artículo está discutido, y se lee como una posición fuerte más que como un consenso, pero su núcleo se sostiene: la guía ayuda a quienes todavía no saben, y estorba a quienes ya saben. De ahí el formato que adopto: aportes cortos de cinco a siete minutos, en directo sobre código, seguidos de una tarea con tres profundidades a elegir. Todo el mundo avanza a la misma hora, no a la misma profundidad.
Y una advertencia que daré a mis estudiantes desde la primera sesión: en un experimento aleatorizado en Harvard, los estudiantes en pedagogía activa aprendían más, pero tenían la impresión de aprender menos (Deslauriers et al., 2019). La comodidad del aula magna es una ilusión de dominio, igual que la respuesta generada.
Leer antes de escribir
La página en blanco es el terreno donde los LLM son mejores. Un código existente, con sus restricciones, sus fallos y una petición de cambio, obliga a comprender antes de actuar. Es además el día a día del oficio: se mantiene mucho más código del que se escribe.
La didáctica de la programación apunta en ese sentido desde hace tiempo. Saber trazar y explicar código predice la capacidad de escribirlo (Lopez et al., 2008; Xie et al., 2019), y los enfoques que hacen predecir, ejecutar, examinar y modificar antes de crear dan mejores resultados en clases heterogéneas (Sentance, Waite y Kallia, 2019). Estos trabajos tratan a menudo con principiantes más jóvenes que mis estudiantes, y los primeros son correlacionales; convergen de todos modos.
Mis ejercicios empezarán por eso con un fallo, una revisión de código o una petición de cambio, nunca con «cree una clase».
Lo que queda por demostrar
No voy a pretender que todo lo que acabo de describir esté validado. Dos de estas opciones no tienen, que yo sepa, ningún estudio publicado detrás: ponderar la nota de un proyecto hecho con IA por la de una prueba individual sin IA, y hacer que cada estudiante modifique su propio repositorio, sin conexión y con tiempo limitado. Son hipótesis coherentes con lo anterior, no resultados. Las pongo en marcha, recojo los datos, y diré lo que muestran, incluso si me quitan la razón.
Lo establecido cabe en unas líneas. La IA amplía la distancia entre quienes tienen las bases y quienes no. Hay que enseñar por tanto las dos cosas, las bases sin la herramienta, luego la herramienta para superarlas, y certificar la primera antes de calificar la segunda. La entrega ya no demuestra nada; explicar y modificar todavía demuestran algo. El tiempo presencial vale más cuando sirve al retorno y al juicio que a la transmisión. Y la sensación de aprender es un mal indicador, tanto en el estudiante como en el docente.
Me queda escribir el examen de enero. Cabrá en dos páginas de código que no he escrito, y la primera pregunta será: ¿qué falla aquí?
Referencias
- Bastani, H., Bastani, O., Sungu, A., Ge, H., Kabakcı, Ö. y Mariman, R. (2025). Generative AI without guardrails can harm learning: Evidence from high school mathematics. PNAS, 122(26). https://doi.org/10.1073/pnas.2422633122
- Bearman, M., Tai, J., Dawson, P., Boud, D. y Ajjawi, R. (2024). Developing evaluative judgement for a time of generative artificial intelligence. Assessment & Evaluation in Higher Education, 49(6). https://doi.org/10.1080/02602938.2024.2335321
- Becker, J., Rush, N., Barnes, E. y Rein, D. (2025). Measuring the impact of early-2025 AI on experienced open-source developer productivity. METR. https://arxiv.org/abs/2507.09089
- Deslauriers, L., McCarty, L. S., Miller, K., Callaghan, K. y Kestin, G. (2019). Measuring actual learning versus feeling of learning. PNAS, 116(39). https://doi.org/10.1073/pnas.1821936116
- Freeman, S. et al. (2014). Active learning increases student performance in science, engineering, and mathematics. PNAS, 111(23). https://doi.org/10.1073/pnas.1319030111
- Guo, P. J., Kim, J. y Rubin, R. (2014). How video production affects student engagement: An empirical study of MOOC videos. Learning at Scale '14. https://doi.org/10.1145/2556325.2566239
- Kazemitabaar, M. et al. (2023). Studying the effect of AI code generators on supporting novice learners in introductory programming. CHI '23. https://doi.org/10.1145/3544548.3580919
- Kirschner, P. A., Sweller, J. y Clark, R. E. (2006). Why minimal guidance during instruction does not work. Educational Psychologist, 41(2). https://doi.org/10.1207/s15326985ep4102_1
- Lau, S. y Guo, P. J. (2023). From «Ban It Till We Understand It» to «Resistance is Futile». ICER '23. https://doi.org/10.1145/3568813.3600138
- Lehtinen, T., Lukkarinen, A. y Haaranen, L. (2021). Students struggle to explain their own program code. ITiCSE '21. https://doi.org/10.1145/3430665.3456322
- Lopez, M., Whalley, J., Robbins, P. y Lister, R. (2008). Relationships between reading, tracing and writing skills in introductory programming. ICER '08. https://doi.org/10.1145/1404520.1404531
- Perkins, M., Furze, L., Roe, J. y MacVaugh, J. (2024). The Artificial Intelligence Assessment Scale (AIAS). Journal of University Teaching and Learning Practice, 21(6). https://doi.org/10.53761/q3azde36
- Porter, L., Bailey Lee, C. y Simon, B. (2013). Halving fail rates using peer instruction. SIGCSE '13. https://doi.org/10.1145/2445196.2445250
- Prather, J. et al. (2024). The widening gap: The benefits and harms of generative AI for novice programmers. ICER '24. https://doi.org/10.1145/3632620.3671116
- Sentance, S., Waite, J. y Kallia, M. (2019). Teaching computer programming with PRIMM. Computer Science Education, 29(2-3). https://doi.org/10.1080/08993408.2019.1608781
- Universidad de Sídney. Two-lane approach to assessment (marco de evaluación en contexto de IA generativa).
- Xie, B. et al. (2019). A theory of instruction for introductory programming skills. Computer Science Education, 29(2-3). https://doi.org/10.1080/08993408.2019.1565235