बचपन में मैं हांगकांग में खो गया था। मुझे वहाँ की भाषा नहीं आती थी।
बाद की यात्राओं में, चीन और दूसरे ऐसे देशों में जहाँ की भाषा मुझे नहीं आती, मैं मोबाइल डेटा इस्तेमाल नहीं कर पाता था। हर बार मैं एक ही चीज़ चाहता था: ऐसा ट्रांसलेटर जिसे कनेक्शन की ज़रूरत न हो, ताकि मैं लोगों की बात समझ सकूँ और उनसे बात कर सकूँ।
Knowless उसी को बनाने की मेरी कोशिश है। यह बोली हुई बात को फ़ोन पर ही लाइव ट्रांसक्रिप्शन और अनुवाद में बदलता है। मैंने इसे डिज़ाइन किया, और AI की मदद वाले टूल्स से बनाया।1 शायद यह मेरा बनाया सबसे सरल ऐप है: एक स्क्रीन और एक बटन। इसे इतना सरल बनाने में मैं तीन बार ग़लत रास्ते पर गया।
पहली कोशिश: रडार
पहला वर्शन एक रडार था जो हर वक़्त सुनता रहता था। मैंने सोचा था कि वह सिर्फ़ ऑडियो से बता देगा कि बोलने वाला कहाँ है।
जल्दी ही पता चल गया कि वह ऐसा नहीं कर सकता। मेरा फ़ोन रिकॉर्डिंग में स्पेशियल ऑडियो नहीं देता, इसलिए उसमें ऐसा कुछ नहीं होता जो बताए कि आवाज़ किधर से आ रही है। जितना मैंने पढ़ा, नया मॉडल शायद दे सकता है। मेरे पास वह नहीं है। मैंने आवाज़ से यह करने की कोशिश छोड़ दी।
दूसरी कोशिश: दोनों कैमरे
तो मैंने कानों की जगह आँखें आज़माईं। आगे और पीछे के कैमरे एक साथ चलते, बोलने वाला चेहरा ढूँढ़ते, ताकि ऐप को पता रहे कि वह इंसान कहाँ है।
बात यहाँ तक पहुँची कि मेरे फ़ोन पर एक चलता हुआ बिल्ड था, सब कुछ डिवाइस पर, कोई सर्वर नहीं: वह दोनों कैमरों से देखता था और हर आवाज़ को एक चेहरे से मिलाने की कोशिश करता था। वह ठीक वहीं फ़ेल हुआ जहाँ फ़र्क़ पड़ता है। फ़ोन गरम हो गया। बैटरी तेज़ी से उतरी। वह हैंग हुआ, बार-बार। मैंने वह भी छोड़ दिया।
अपने कानों से सुनना
कुछ फ़ैसले छोटे थे, पर उतने ही अहम। काग़ज़ पर, शोर वाली जगहों के लिए नॉइज़ रिडक्शन वाजिब लगता था। फिर मैंने एक शोर भरी रिकॉर्डिंग अपने कानों से सुनी। मुझे समझ नहीं आया कि मैं ख़ुद क्या कह रहा हूँ। शोर कितना भी हटा लिया जाए, यह ठीक होने वाला नहीं था, इसलिए मैंने वह आइडिया छोड़ दिया।
“human in the loop” से मेरा मतलब यही है। मैं AI के साथ ऐप बनाता हूँ, और मुझे बार-बार जाँचते रहना होता है कि जो मैं माँग रहा हूँ उसका असल हालात में कोई मतलब बनता है या नहीं। फ़ैसले बेहद अहम हैं।
मॉडलों के साथ भी यही हुआ। मैंने उन्हें एक-एक करके टेस्ट किया, जिसमें काफ़ी वक़्त लगा। शुरू में, जब मॉडल फ़ोन में डाउनलोड होते थे, ऐप क़रीब चार गीगाबाइट का हो जाता। पहले प्रोटोटाइप में बातचीत की हिस्ट्री भी रहती थी। Shipaton के लिए ऐप वक़्त पर रिलीज़ हो जाए, इसलिए मैंने वह काट दी, और फिर भी डेडलाइन छूटते-छूटते बची।
जो मैं नहीं सुन सकता, वह कोई फ़िल्टर भी नहीं सुन सकता
जो बचा
एक स्क्रीन और एक बटन। दबाएँ, बोलें, अनुवाद।
अनुवाद वाली लाइन बड़ी है। मूल वाक्य ठीक उसके नीचे है: छोटा, ग्रे, इटैलिक।
टेक्स्ट बड़ा होने पर भी यह क्रम बना रहता है। पिंच करने पर वह 50% से 300% तक छोटा-बड़ा होता है। सुनने की भाषाएँ पहले से चुन ली जाती हैं, ज़्यादा से ज़्यादा तीन। और आप कोई लाइन अपने साथ ले जा सकते हैं: उसे कॉपी करें, या पढ़कर सुनवा लें।
वे दो दिन
एक बहुत छोटा फ़ीचर बेहद पेचीदा निकला: शब्द कैसे उभरते हैं।
देखने में लगता है कि ऑडियो टेक्स्ट बनता है और टेक्स्ट स्क्रीन पर आ जाता है। ऐसा नहीं है। ऑडियो पहले एक अंदाज़ा बनता है, और वह अंदाज़ा तुरंत स्क्रीन पर आ जाता है, इसलिए सब लाइव लगता है। फिर अंदाज़ा सुधारा जाता है, और अगर सुधरा हुआ रूप अलग हो तो स्क्रीन बदल जाती है। लंबे वाक्य के बाद एक और दौर चलता है जो उसे फिर सुधारता है, पूरे वाक्य का संदर्भ देखकर।
इनमें से हर स्टेट को सही दिखना है, और बीच के इंतज़ार को भी। जो लाइन अभी आ ही रही है, वह एम्बर रंग के कर्सर के पीछे बदलते चिह्नों के रूप में दिखती है। जो लाइन ठहर चुकी है वह सादा टेक्स्ट है, और वह हिलती नहीं।
मैं दो दिन से ज़्यादा ऐप और डिज़ाइन मॉक के बीच आता-जाता रहा। शुरू से पता था कि मैं चाहता हूँ यह सहज लगे, और मुझे यक़ीन था कि लोग यह महसूस करेंगे। यह अंदाज़ा नहीं था कि इसमें इतना वक़्त लगेगा।

कुछ चीज़ें वहाँ नहीं होनी चाहिए। हर किसी का ध्यान नहीं जाता।
ठीक वही कहना जो सच है
बोली पहचानने और अनुवाद का काम फ़ोन पर होता है। भाषाएँ एक बार डाउनलोड करनी पड़ती हैं, और उसके लिए कनेक्शन चाहिए; उसके बाद इसका मुख्य हिस्सा बिना कनेक्शन के चलता है। इसलिए स्टोर के लिए जो स्क्रीनशॉट मैंने तैयार किया, उस पर लिखा है “works offline”, और उसी साँस में उसकी शर्त भी: सपोर्टेड भाषाएँ डाउनलोड करने के बाद।
इससे क्या साबित नहीं होता
यहाँ कोई नतीजे नहीं हैं: न समझ के स्कोर, न यूज़ेबिलिटी स्टडी, न यह आँकड़ा कि कितने लोगों ने इसे अपनाया। जो मैं दिखा सकता हूँ वह रास्ता है, और यह कि वह कहाँ पहुँचा।
आगे मैं चाहता हूँ कि दो लोग हों, हर एक के पास अपना फ़ोन, और दोनों की बात एक-दूसरे के लिए लाइव अनुवाद होती रहे। वह अभी बना नहीं है।
