Cómo explica cada diapositiva
Una diapositiva no es un texto corrido: son bloques sueltos en una hoja. Filmina trabaja sobre eso, y de ahí salen las dos cosas que la separan de un lector en voz alta: que explica en vez de leer, y que puede señalar de qué habla.
Lo que se lee de la lámina
De cada página se guardan dos cosas: el dibujo, tal como se ve, y los bloques de texto con sus coordenadas. Las coordenadas son lo que después le permite al marco rodear el bloque exacto del que habla la voz.
No todo lo que hay escrito en la hoja es contenido. Antes de explicar se descartan los encabezados corridos, los pies, el número de página, la fecha y la ruta del archivo: se detectan porque se repiten página tras página. Si pasaran, la regla de cobertura total obligaría a explicarte el pie de página.
Los segmentos
La explicación no vuelve como un bloque de texto: vuelve partida en segmentos de una o dos ideas, entre tres y siete por lámina, de diez a treinta segundos hablados cada uno. Cada segmento sabe qué bloques de la hoja cubre.
Eso es lo que hace que el marco pueda moverse: el segmento que suena dice dónde mirar. Y es también la unidad con la que se navega, porque con las flechas de arriba y abajo se salta de una idea a la otra, no de un segundo al otro.
Lo que el modelo tiene prohibido
La explicación se escribe para ser escuchada, no leída, y eso son reglas concretas:
- No lee textual. Reformula, conecta y dice qué significa cada cosa y por qué importa. La lámina ya está delante.
- Precisión absoluta. Cifras, nombres, fórmulas, fechas y términos técnicos se respetan exactamente como figuran. No se redondea y no se cambia un término por un sinónimo informal.
- Sin preámbulo y sin cierre. Nada de «vamos a ver», «en esta diapositiva vemos» ni «estamos en la 22 de 62». Son los segundos que uno pasa esperando a que empiece lo que importa, así que la primera frase ya está afirmando algo del tema.
- Sin markdown. Prosa corrida: ni asteriscos, ni viñetas, ni numeración, ni tablas, ni emojis. Nada de eso suena.
- La notación, en palabras. «P de A dado B», no «pe paréntesis a barra be». La notación matemática se traduce antes de llegar a la voz, que es donde se rompen los lectores en voz alta.
La cobertura se verifica por código
Pedirle a un modelo que no se saltee nada no alcanza: hay que comprobarlo. En los niveles con cobertura total, cuando la respuesta vuelve se revisa bloque por bloque que ninguno haya quedado sin explicar, y si falta alguno se le vuelve a pedir solo por ese.
La cobertura no depende de que el modelo haga caso. Se comprueba, y lo que falta se pide de nuevo.
Los diagramas y las figuras
El modelo es de texto: no ve las imágenes. Así que no te las explica. Una figura se marca como figura y se te avisa que la mires, que es mejor que contarte un gráfico que nadie vio.
Los rótulos de un diagrama son un caso aparte. Vienen marcados como lo que son y se explican en conjunto, en un solo segmento, describiendo qué muestra el esquema y cómo se relacionan esos elementos según la lámina. Son etiquetas de un dibujo, no afirmaciones del material: dedicarle un segmento a cada palabra suelta sería inventarle una definición a cada una.
La cola: no esperas dos veces
Mientras escuchas una diapositiva, las que siguen se van generando por detrás. Se encola el documento entero, así que a la larga no esperas en ninguna.
La cola es por prioridad y no por orden de llegada: la diapositiva que estás mirando va primero. Si saltas a otra, lo que se estaba pensando se corta, pero no se tira: lo que el modelo alcanzó a escribir queda guardado para retomarlo, en vez de pensarlo dos veces.
Lo generado queda en tu disco. El guion se guarda por nivel de detalle y por idioma, y el audio por voz: cambiar de voz no vuelve a pensar la explicación, la vuelve a decir.