La voz que explica
La voz también es local. La sintetiza Kokoro, un modelo de 82 millones de parámetros que viaja dentro de la app y trabaja contra la GPU de tu Mac: no hay un servicio de voz del otro lado, así que lo que se dice no sale de tu máquina y no hace falta conexión para escucharlo.
Las voces
Las voces son de un idioma y no de la app: una voz castellana leyendo inglés suena a alguien leyendo en un idioma que no sabe. Según el idioma en el que estés escuchando, hay tres:
- En español: Dora (femenina), Alex (masculina) y Santa (masculina, grave).
- En inglés: Heart (femenina), Michael (masculina) y George (masculina, británica).
La voz se cambia desde los ajustes del dock, en cualquier momento. Cambiarla no vuelve a pensar la explicación: el guion ya está escrito y lo que se hace de nuevo es decirlo.
La velocidad
De 0,8× a 1,75×, en siete pasos. La velocidad no regenera nada: es el audio que ya está, dicho más rápido, así que se puede mover en la mitad de una frase sin esperar.
De corrido
Al terminar la última idea de la lámina, y la pregunta si están encendidas, pasa a la siguiente y sigue. Es lo que convierte a Filmina en algo que se escucha de corrido en vez de algo que se le va pidiendo de a una. Para quedarte en una lámina, pausa.
Por qué no se pisan
La voz que habla y el oído que te escucha usan los dos la GPU, y en macOS, los dos a la vez, cierran el proceso. Así que se turnan: mientras uno trabaja, el otro espera su turno. Lo que se pierde son un par de segundos; lo que se gana es que la app no se cierre en la mitad de una clase.