Als ich klein war, bin ich in Hongkong verloren gegangen. Ich konnte die Sprache nicht.
Auf späteren Reisen, nach China und in andere Länder, deren Sprache ich nicht spreche, konnte ich keine mobilen Daten nutzen. Jedes Mal habe ich mir dasselbe gewünscht: einen Übersetzer, der keine Verbindung braucht, damit ich die Leute verstehen und mit ihnen reden kann.
Knowless ist mein Versuch, so einen Übersetzer zu bauen. Die App macht aus gesprochener Sprache live ein Transkript und eine Übersetzung, direkt auf dem Handy. Ich habe sie gestaltet und mit KI-gestützten Tools gebaut.1 Es ist wahrscheinlich die einfachste App, die ich gemacht habe: ein Screen und ein Button. Bis sie so einfach war, bin ich dreimal falsch abgebogen.
Erster Versuch: ein Radar
Die erste Version war ein Radar, das die ganze Zeit zuhörte. Ich stellte mir vor, es könnte allein aus dem Audio erkennen, wo jemand spricht.
Es dauerte nicht lange, bis ich wusste: Das konnte es nicht. Mein Handy liefert bei einer Aufnahme kein räumliches Audio, also steckt darin nichts, was verrät, woher eine Stimme kommt. Nach dem, was ich gelesen habe, kann ein neueres Modell das vielleicht. Ich habe keins. Ich habe aufgehört, es über den Ton zu versuchen.
Zweiter Versuch: beide Kameras
Also habe ich es mit Augen statt Ohren versucht. Front- und Rückkamera liefen gleichzeitig und suchten das Gesicht, das gerade sprach, damit die App wusste, wo diese Person war.
Das kam bis zu einem lauffähigen Build auf meinem Handy, alles auf dem Gerät und ohne Server: Er beobachtete beide Kameras und versuchte, jede Stimme einem Gesicht zuzuordnen. Er scheiterte dort, wo es zählt. Das Handy wurde heiß. Der Akku lief schnell leer. Es fror ein, oft. Auch das habe ich verworfen.
Mit eigenen Ohren hören
Manche Entscheidungen waren kleiner und genauso wichtig. Auf dem Papier klang Geräuschunterdrückung für laute Orte vernünftig. Dann habe ich mir eine Aufnahme voller Lärm mit eigenen Ohren angehört. Ich konnte nicht verstehen, was ich selbst sagte. Da hilft auch noch so viel Filtern nichts, also habe ich die Idee verworfen.
Das meine ich mit „Human in the Loop“. Ich baue mit KI, und ich muss immer wieder prüfen, ob das, was ich verlange, in der echten Situation Sinn ergibt. Die Entscheidungen sind extrem wichtig.
Das Gleiche galt für die Modelle. Ich habe sie einzeln getestet, und das hat lange gedauert. Am Anfang, mit Modellen, die aufs Handy heruntergeladen werden, wäre die App auf etwa vier Gigabyte gekommen. Der erste Prototyp hat auch einen Gesprächsverlauf gespeichert. Den habe ich gestrichen, um die App rechtzeitig zum Shipaton herauszubringen, und hätte die Deadline trotzdem fast verpasst.
wenn ich es nicht höre, hört es auch kein Filter
Was übrig blieb
Ein Screen und ein Button. Drücken, sprechen, übersetzen.
Die übersetzte Zeile ist groß. Das Original steht direkt darunter: kleiner, grau, kursiv.
Die Ordnung bleibt, wenn der Text wächst. Er lässt sich mit zwei Fingern von 50% bis 300% skalieren. Bis zu drei Sprachen, denen die App zuhört, werden vorher ausgewählt. Und du kannst eine Zeile mitnehmen: sie kopieren oder vorlesen lassen.
Die zwei Tage
Ein sehr kleines Feature hat sich als extrem komplex herausgestellt: wie die Wörter erscheinen.
Es sieht aus, als würde Audio zu Text und der Text käme auf den Bildschirm. So ist es nicht. Aus Audio wird eine Vermutung, und die Vermutung kommt sofort auf den Bildschirm, damit es sich live anfühlt. Dann wird die Vermutung korrigiert, und wenn die Korrektur abweicht, ändert sich der Bildschirm. Nach einem langen Satz gibt es einen weiteren Durchgang, der noch einmal korrigiert, mit dem Kontext des ganzen Satzes.
Jeder dieser Zustände muss richtig aussehen, und das Warten dazwischen auch. Eine Zeile, die noch ankommt, wird als wechselnde Glyphen hinter einem bernsteinfarbenen Cursor gezeichnet. Steht eine Zeile, ist sie schlichter Text und bewegt sich nicht.
Mehr als zwei Tage bin ich zwischen der App und einem Design-Mock-up hin- und hergesprungen. Ich wusste von Anfang an, dass es sich intuitiv anfühlen sollte, und ich glaubte, dass die Leute das spüren würden. Wie lange es dauern würde, hatte ich nicht erwartet.

manches gehört da nicht hin. nicht jeder merkt das.
Genau sagen, was stimmt
Spracherkennung und Übersetzung laufen auf dem Handy. Sprachen müssen einmal heruntergeladen werden, mit Verbindung; danach funktioniert der Kern ohne. Deshalb steht auf dem Store-Screenshot, den ich vorbereitet habe, „works offline“, und im selben Atemzug die Bedingung: nach dem Download der unterstützten Sprachen.
Was das nicht beweist
Ergebnisse gibt es hier keine: keine Verständniswerte, keine Usability-Studie, keine Nutzerzahlen. Was ich zeigen kann, ist der Weg und wohin er geführt hat.
Als Nächstes will ich, dass zwei Menschen, jeder mit einem Handy, live füreinander übersetzt werden. Das ist noch nicht gebaut.
