De niño me perdí en Hong Kong. No hablaba el idioma.
En viajes posteriores, a China y a otros países donde no conozco el idioma, no podía usar datos móviles. Cada vez deseaba lo mismo: un traductor que no necesitara conexión, para poder entender a la gente y hablar con ella.
Knowless es mi intento de conseguirlo. Convierte la voz en transcripción y traducción en vivo, en el propio teléfono. La diseñé, y la construí con herramientas asistidas por IA.1 Probablemente es la app más sencilla que he hecho: una pantalla y un botón. Para dejarla así de sencilla me equivoqué de camino tres veces.
Primer intento: un radar
La primera versión era un radar que escuchaba todo el tiempo. Imaginé que podría saber dónde estaba quien hablaba solo por el audio.
No tardé en ver que no podía. Mi teléfono no me da audio espacial a partir de una grabación, así que en ella no hay nada que diga de dónde viene una voz. Por lo que leí, un modelo más nuevo quizá sí. No tengo ninguno. Dejé de intentarlo con el sonido.
Segundo intento: las dos cámaras
Así que probé con ojos en vez de oídos. La cámara frontal y la trasera funcionando a la vez, buscando la cara que estaba hablando, para que la app supiera dónde estaba esa persona.
Llegué a tener una versión que funcionaba en mi teléfono, con todo en el dispositivo y sin servidor: miraba por las dos cámaras e intentaba asociar cada voz a una cara. Falló en lo que importa. El teléfono se calentaba. La batería se agotaba rápido. Se quedaba congelado, a menudo. También lo descarté.
Escuchar con mis propios oídos
Algunas decisiones fueron más pequeñas e importaron igual. Sobre el papel, la reducción de ruido para lugares ruidosos sonaba razonable. Luego escuché con mis propios oídos una grabación con ruido. No distinguía lo que yo mismo estaba diciendo. Eso no lo iba a arreglar ninguna reducción de ruido, así que descarté la idea.
A eso me refiero con “human in the loop”. Construyo con IA, y tengo que comprobar una y otra vez que lo que pido tiene sentido en la situación real. Las decisiones son extremadamente importantes.
Con los modelos pasó lo mismo. Los probé uno por uno, y eso llevó mucho tiempo. Al principio, con los modelos descargados en el teléfono, la app habría ocupado unos cuatro gigabytes. El primer prototipo guardaba además un historial de conversaciones. Lo quité para publicar a tiempo para Shipaton, y aun así casi se me pasa el plazo.
si yo no lo oigo, ningún filtro lo va a oír
Lo que quedó
Una pantalla y un botón. Pulsar, hablar, traducir.
La línea traducida es grande. El original va justo debajo: más pequeño, gris, en cursiva.
El orden se mantiene cuando el texto crece. Se escala del 50% al 300% con un pellizco. Los idiomas de escucha, hasta tres, se eligen de antemano. Y puedes llevarte una línea: copiarla o hacer que se lea en voz alta.
Los dos días
Una función muy pequeña resultó extremadamente compleja: cómo aparecen las palabras.
Parece que el audio se convierte en texto y el texto va a la pantalla. No es así. El audio se convierte en una suposición, y la suposición va a la pantalla al instante, así que se siente en vivo. Luego la suposición se corrige y, si la corrección es distinta, la pantalla cambia. Después de una frase larga hay otra pasada que la corrige de nuevo, usando el contexto de toda la frase.
Cada uno de esos estados tiene que verse bien, y la espera entre uno y otro también. Una línea que todavía está llegando se dibuja como glifos cambiantes detrás de un cursor ámbar. Una línea ya asentada es texto normal, y no se mueve.
Estuve más de dos días yendo y viniendo entre la app y una maqueta de diseño. Desde el principio supe que quería que resultara intuitiva, y creía que la gente lo iba a notar. No esperaba que llevara tanto tiempo.

hay cosas que no deberían estar ahí. no todo el mundo lo nota.
Decir exactamente lo que es cierto
El reconocimiento de voz y la traducción funcionan en el teléfono. Los idiomas hay que descargarlos una vez, con conexión; después, lo esencial funciona sin ella. Por eso la captura que preparé para la tienda dice “works offline” y añade su condición en la misma frase: después de descargar los idiomas compatibles.
Lo que esto no demuestra
Aquí no hay resultados: ni puntuaciones de comprensión, ni estudio de usabilidad, ni cifras de adopción. Lo que puedo mostrar es el camino, y dónde terminó.
Lo siguiente que quiero: dos personas, cada una con su teléfono, y traducción en vivo entre las dos. Eso todavía no está hecho.
