Quand j’étais petit, je me suis perdu à Hong Kong. Je ne parlais pas la langue.
Plus tard, lors de voyages en Chine et dans d’autres pays dont je ne connais pas la langue, je ne pouvais pas utiliser les données mobiles. À chaque fois, j’aurais voulu la même chose : un traducteur qui n’a besoin d’aucune connexion, pour comprendre les gens et parler avec eux.
Knowless est ma tentative d’en faire un. L’app transforme la parole en transcription et en traduction en direct, sur le téléphone même. Je l’ai conçue, et développée avec des outils d’IA.1 C’est probablement l’app la plus simple que j’aie faite : un écran et un bouton. Pour arriver à cette simplicité, j’ai fait fausse route trois fois.
Premier essai : un radar
La première version était un radar qui écoutait en permanence. J’imaginais qu’il pourrait situer la personne qui parle rien qu’avec l’audio.
Je n’ai pas mis longtemps à comprendre qu’il ne pouvait pas. Mon téléphone ne me donne pas d’audio spatial à partir d’un enregistrement, donc rien n’y indique d’où vient une voix. D’après ce que j’ai lu, un modèle plus récent le pourrait peut-être. Je n’en ai pas. J’ai arrêté d’essayer avec le son.
Deuxième essai : les deux caméras
J’ai donc essayé les yeux à la place des oreilles. Caméras avant et arrière en même temps, à la recherche du visage qui parlait, pour que l’app sache où se trouvait cette personne.
C’est allé jusqu’à une version qui fonctionnait sur mon téléphone, avec tout sur l’appareil et sans serveur : elle surveillait les deux caméras et essayait d’associer chaque voix à un visage. Elle a échoué là où ça compte. Le téléphone chauffait. La batterie se vidait vite. Tout se figeait, souvent. J’ai abandonné ça aussi.
Écouter de mes propres oreilles
Certaines décisions étaient plus petites et comptaient autant. Sur le papier, la réduction de bruit pour les lieux bruyants semblait raisonnable. Puis j’ai écouté un enregistrement bruyant de mes propres oreilles. Je n’arrivais pas à distinguer ce que je disais moi-même. Aucun débruitage n’y changerait rien, alors j’ai abandonné l’idée.
C’est ce que j’entends par « un humain dans la boucle ». Je développe avec l’IA, et je dois sans cesse vérifier que ce que je demande a du sens dans la situation réelle. Les décisions sont extrêmement importantes.
Même chose pour les modèles. Je les ai testés un par un, ce qui a pris longtemps. Au début, avec des modèles téléchargés sur le téléphone, l’app aurait pesé environ quatre gigaoctets. Le premier prototype gardait aussi un historique des conversations. Je l’ai retiré pour sortir l’app à temps pour le Shipaton, et j’ai quand même failli rater la date limite.
si je ne l’entends pas, aucun filtre ne l’entendra
Ce qui restait
Un écran et un bouton. Appuyer, parler, traduire.
La ligne traduite est grande. L’original se place juste en dessous : plus petit, gris, en italique.
Cet ordre tient quand le texte grandit. Un pincement le fait passer de 50% à 300%. On choisit à l’avance jusqu’à trois langues d’écoute. Et vous pouvez emporter une ligne : la copier, ou la faire lire à voix haute.
Les deux jours
Une toute petite fonctionnalité s’est révélée extrêmement complexe : la façon dont les mots apparaissent.
On croirait que l’audio devient du texte et que le texte s’affiche à l’écran. Ce n’est pas ça. L’audio devient une hypothèse, et l’hypothèse s’affiche aussitôt, pour donner une impression de direct. Puis l’hypothèse est corrigée, et si la correction est différente, l’écran change. Après une longue phrase, une autre passe la corrige encore, à l’aide du contexte de la phrase entière.
Chacun de ces états doit paraître juste, tout comme l’attente entre deux états. Une ligne qui n’a pas fini d’arriver est dessinée en glyphes changeants derrière un curseur ambré. Une ligne stabilisée est du texte simple, et elle ne bouge pas.
J’ai fait des allers-retours entre l’app et une maquette pendant plus de deux jours. Dès le départ, je savais que je voulais quelque chose d’intuitif, et je pensais que les gens le sentiraient. Je ne m’attendais pas à ce que ça prenne autant de temps.

certaines choses ne devraient pas être là. tout le monde ne le remarque pas.
Dire exactement ce qui est vrai
La reconnaissance vocale et la traduction fonctionnent sur le téléphone. Les langues doivent être téléchargées une fois, avec une connexion ; ensuite, l’essentiel fonctionne sans. La capture d’écran que j’ai préparée pour l’App Store dit donc « works offline » et précise aussitôt sa condition : après téléchargement des langues prises en charge.
Ce que cela ne prouve pas
Il n’y a pas de résultats ici : pas de scores de compréhension, pas d’étude d’utilisabilité, pas de chiffres d’adoption. Ce que je peux montrer, c’est le chemin parcouru, et là où il a mené.
Ensuite, je veux pouvoir traduire en direct deux personnes, chacune avec son téléphone, l’une pour l’autre. Ce n’est pas encore fait.
