Waktu kecil, saya tersesat di Hong Kong. Saya tidak bisa bahasanya.
Dalam perjalanan-perjalanan berikutnya, ke Tiongkok dan ke negara lain yang bahasanya tidak saya mengerti, saya tidak bisa memakai data seluler. Setiap kali, yang saya harapkan selalu sama: alat penerjemah yang tidak butuh koneksi, supaya saya bisa memahami orang dan mengobrol dengan mereka.
Knowless adalah upaya saya mewujudkannya. Aplikasi ini mengubah ucapan menjadi transkripsi dan terjemahan langsung, di ponsel itu sendiri. Saya mendesainnya, dan membangunnya dengan alat berbantuan AI.1 Mungkin ini aplikasi paling sederhana yang pernah saya buat: satu layar dan satu tombol. Untuk bisa sesederhana itu, saya tiga kali salah belok.
Percobaan pertama: radar
Versi pertamanya adalah radar yang mendengarkan terus-menerus. Saya membayangkan radar itu bisa tahu posisi orang yang sedang bicara hanya dari audionya.
Tidak lama kemudian saya tahu, itu tidak bisa. Rekaman dari ponsel saya tidak punya audio spasial, jadi tidak ada apa pun di dalamnya yang menunjukkan dari mana suara datang. Dari yang saya baca, model yang lebih baru mungkin bisa. Saya tidak punya. Saya berhenti mencobanya dengan suara.
Percobaan kedua: dua kamera
Jadi saya mencoba pakai mata, bukan telinga. Kamera depan dan belakang menyala bersamaan, mencari wajah yang sedang bicara, supaya aplikasi tahu di mana orang itu berada.
Percobaan ini sampai menjadi build yang berjalan di ponsel saya, semuanya di perangkat dan tanpa server: build itu memantau kedua kamera dan mencoba mencocokkan setiap suara dengan satu wajah. Gagalnya justru di hal yang penting. Ponselnya panas. Baterainya cepat terkuras. Ponselnya hang, dan sering. Itu pun saya tinggalkan.
Mendengar dengan telinga sendiri
Ada keputusan-keputusan yang lebih kecil tapi sama pentingnya. Di atas kertas, peredaman bising untuk tempat ramai terdengar masuk akal. Lalu saya mendengarkan rekaman yang bising dengan telinga saya sendiri. Saya tidak bisa menangkap apa yang saya sendiri ucapkan. Peredaman sehebat apa pun tidak akan menolong, jadi ide itu saya buang.
Itulah yang saya maksud dengan “human in the loop”. Saya membangun aplikasi dengan AI, dan saya harus terus memeriksa apakah yang saya minta itu masuk akal dalam situasi nyata. Keputusan-keputusannya luar biasa penting.
Begitu juga dengan model-modelnya. Saya mengujinya satu per satu, dan itu makan waktu lama. Di awal, dengan model yang diunduh ke ponsel, ukuran aplikasinya akan mencapai sekitar empat gigabyte. Prototipe pertamanya juga menyimpan riwayat percakapan. Itu saya pangkas supaya sempat rilis untuk Shipaton, dan tetap saja nyaris lewat deadline.
kalau saya tidak bisa dengar, filter pun tidak
Yang tersisa
Satu layar dan satu tombol. Tekan, bicara, terjemahkan.
Baris terjemahannya besar. Kalimat aslinya tepat di bawahnya: lebih kecil, abu-abu, miring.
Urutan itu tetap sama saat teksnya membesar. Ukurannya bisa diubah dari 50% sampai 300% dengan gestur cubit. Bahasa yang didengarkan, paling banyak tiga, dipilih sebelumnya. Dan satu baris bisa kamu bawa: salin, atau minta dibacakan.
Dua hari itu
Satu fitur yang sangat kecil ternyata luar biasa rumit: cara kata-kata muncul.
Kelihatannya audio menjadi teks, lalu teks tampil di layar. Bukan begitu. Audio menjadi tebakan, dan tebakan itu langsung tampil di layar, supaya terasa real-time. Lalu tebakan itu dikoreksi, dan kalau koreksinya berbeda, layar berubah. Setelah satu kalimat panjang, ada satu putaran lagi yang mengoreksinya sekali lagi, memakai konteks seluruh kalimat.
Setiap state itu harus terlihat pas, begitu juga waktu tunggu di antaranya. Baris yang masih masuk digambar sebagai glif yang terus berganti di belakang kursor berwarna amber. Baris yang sudah tetap adalah teks biasa, dan tidak bergerak.
Saya bolak-balik antara aplikasi dan mockup desain selama lebih dari dua hari. Sejak awal saya tahu saya ingin aplikasinya terasa intuitif, dan saya yakin orang akan merasakannya. Saya tidak menyangka akan selama itu.

ada hal-hal yang seharusnya tidak ada di situ. tidak semua orang menyadarinya.
Mengatakan persis apa adanya
Pengenalan ucapan dan penerjemahan berjalan di ponsel. Bahasa harus diunduh sekali, dengan koneksi; setelah itu fungsi intinya berjalan tanpa koneksi. Jadi tangkapan layar App Store yang saya siapkan bertuliskan “works offline” dan menyebut syaratnya dalam satu tarikan napas: setelah mengunduh bahasa yang didukung.
Yang tidak dibuktikan di sini
Tidak ada hasil di sini: tidak ada skor pemahaman, tidak ada studi usability, tidak ada angka adopsi. Yang bisa saya tunjukkan adalah jalan yang ditempuh, dan ke mana ujungnya.
Berikutnya saya ingin dua orang, masing-masing dengan ponselnya, saling diterjemahkan secara langsung. Itu belum dibuat.
