Lê Xuân Lộcपाँचों ऐप्स पर वापस

एक स्क्रीन और एक बटन।

Knowless · लेख · अक्टूबर 2026

बचपन में मैं हांगकांग में खो गया था। मुझे वहाँ की भाषा नहीं आती थी।

बाद की यात्राओं में, चीन और दूसरे ऐसे देशों में जहाँ की भाषा मुझे नहीं आती, मैं मोबाइल डेटा इस्तेमाल नहीं कर पाता था। हर बार मैं एक ही चीज़ चाहता था: ऐसा ट्रांसलेटर जिसे कनेक्शन की ज़रूरत न हो, ताकि मैं लोगों की बात समझ सकूँ और उनसे बात कर सकूँ।

Knowless उसी को बनाने की मेरी कोशिश है। यह बोली हुई बात को फ़ोन पर ही लाइव ट्रांसक्रिप्शन और अनुवाद में बदलता है। मैंने इसे डिज़ाइन किया, और AI की मदद वाले टूल्स से बनाया।1 शायद यह मेरा बनाया सबसे सरल ऐप है: एक स्क्रीन और एक बटन। इसे इतना सरल बनाने में मैं तीन बार ग़लत रास्ते पर गया।

पहली कोशिश: रडार

पहला वर्शन एक रडार था जो हर वक़्त सुनता रहता था। मैंने सोचा था कि वह सिर्फ़ ऑडियो से बता देगा कि बोलने वाला कहाँ है।

जल्दी ही पता चल गया कि वह ऐसा नहीं कर सकता। मेरा फ़ोन रिकॉर्डिंग में स्पेशियल ऑडियो नहीं देता, इसलिए उसमें ऐसा कुछ नहीं होता जो बताए कि आवाज़ किधर से आ रही है। जितना मैंने पढ़ा, नया मॉडल शायद दे सकता है। मेरे पास वह नहीं है। मैंने आवाज़ से यह करने की कोशिश छोड़ दी।

दूसरी कोशिश: दोनों कैमरे

तो मैंने कानों की जगह आँखें आज़माईं। आगे और पीछे के कैमरे एक साथ चलते, बोलने वाला चेहरा ढूँढ़ते, ताकि ऐप को पता रहे कि वह इंसान कहाँ है।

बात यहाँ तक पहुँची कि मेरे फ़ोन पर एक चलता हुआ बिल्ड था, सब कुछ डिवाइस पर, कोई सर्वर नहीं: वह दोनों कैमरों से देखता था और हर आवाज़ को एक चेहरे से मिलाने की कोशिश करता था। वह ठीक वहीं फ़ेल हुआ जहाँ फ़र्क़ पड़ता है। फ़ोन गरम हो गया। बैटरी तेज़ी से उतरी। वह हैंग हुआ, बार-बार। मैंने वह भी छोड़ दिया।

अपने कानों से सुनना

कुछ फ़ैसले छोटे थे, पर उतने ही अहम। काग़ज़ पर, शोर वाली जगहों के लिए नॉइज़ रिडक्शन वाजिब लगता था। फिर मैंने एक शोर भरी रिकॉर्डिंग अपने कानों से सुनी। मुझे समझ नहीं आया कि मैं ख़ुद क्या कह रहा हूँ। शोर कितना भी हटा लिया जाए, यह ठीक होने वाला नहीं था, इसलिए मैंने वह आइडिया छोड़ दिया।

“human in the loop” से मेरा मतलब यही है। मैं AI के साथ ऐप बनाता हूँ, और मुझे बार-बार जाँचते रहना होता है कि जो मैं माँग रहा हूँ उसका असल हालात में कोई मतलब बनता है या नहीं। फ़ैसले बेहद अहम हैं।

मॉडलों के साथ भी यही हुआ। मैंने उन्हें एक-एक करके टेस्ट किया, जिसमें काफ़ी वक़्त लगा। शुरू में, जब मॉडल फ़ोन में डाउनलोड होते थे, ऐप क़रीब चार गीगाबाइट का हो जाता। पहले प्रोटोटाइप में बातचीत की हिस्ट्री भी रहती थी। Shipaton के लिए ऐप वक़्त पर रिलीज़ हो जाए, इसलिए मैंने वह काट दी, और फिर भी डेडलाइन छूटते-छूटते बची।

जो मैं नहीं सुन सकता, वह कोई फ़िल्टर भी नहीं सुन सकता

जो बचा

एक स्क्रीन और एक बटन। दबाएँ, बोलें, अनुवाद।

अनुवाद वाली लाइन बड़ी है। मूल वाक्य ठीक उसके नीचे है: छोटा, ग्रे, इटैलिक।

100% टेक्स्ट साइज़ पर ‘Thank you for your help.’, और उसके नीचे छोटे ग्रे इटैलिक में ‘Gracias por su ayuda.’ वही वाक्य 300% पर। अब वह तीन लाइनों में पूरी चौड़ाई भर लेता है; स्पैनिश का मूल वाक्य भी बड़ा हो गया है, पर अब भी अनुवाद से छोटा और ग्रे है।

टेक्स्ट बड़ा होने पर भी यह क्रम बना रहता है। पिंच करने पर वह 50% से 300% तक छोटा-बड़ा होता है। सुनने की भाषाएँ पहले से चुन ली जाती हैं, ज़्यादा से ज़्यादा तीन। और आप कोई लाइन अपने साथ ले जा सकते हैं: उसे कॉपी करें, या पढ़कर सुनवा लें।

वे दो दिन

एक बहुत छोटा फ़ीचर बेहद पेचीदा निकला: शब्द कैसे उभरते हैं।

देखने में लगता है कि ऑडियो टेक्स्ट बनता है और टेक्स्ट स्क्रीन पर आ जाता है। ऐसा नहीं है। ऑडियो पहले एक अंदाज़ा बनता है, और वह अंदाज़ा तुरंत स्क्रीन पर आ जाता है, इसलिए सब लाइव लगता है। फिर अंदाज़ा सुधारा जाता है, और अगर सुधरा हुआ रूप अलग हो तो स्क्रीन बदल जाती है। लंबे वाक्य के बाद एक और दौर चलता है जो उसे फिर सुधारता है, पूरे वाक्य का संदर्भ देखकर।

इनमें से हर स्टेट को सही दिखना है, और बीच के इंतज़ार को भी। जो लाइन अभी आ ही रही है, वह एम्बर रंग के कर्सर के पीछे बदलते चिह्नों के रूप में दिखती है। जो लाइन ठहर चुकी है वह सादा टेक्स्ट है, और वह हिलती नहीं।

मैं दो दिन से ज़्यादा ऐप और डिज़ाइन मॉक के बीच आता-जाता रहा। शुरू से पता था कि मैं चाहता हूँ यह सहज लगे, और मुझे यक़ीन था कि लोग यह महसूस करेंगे। यह अंदाज़ा नहीं था कि इसमें इतना वक़्त लगेगा।

Knowless की लाइव स्क्रीन: अनुवाद की लाइनें, और हर एक के नीचे उसका मूल वाक्य।

कुछ चीज़ें वहाँ नहीं होनी चाहिए। हर किसी का ध्यान नहीं जाता।

ठीक वही कहना जो सच है

बोली पहचानने और अनुवाद का काम फ़ोन पर होता है। भाषाएँ एक बार डाउनलोड करनी पड़ती हैं, और उसके लिए कनेक्शन चाहिए; उसके बाद इसका मुख्य हिस्सा बिना कनेक्शन के चलता है। इसलिए स्टोर के लिए जो स्क्रीनशॉट मैंने तैयार किया, उस पर लिखा है “works offline”, और उसी साँस में उसकी शर्त भी: सपोर्टेड भाषाएँ डाउनलोड करने के बाद।

अनुवाद की दो लाइनें और उनके स्पैनिश मूल वाक्य, उस स्क्रीनशॉट से जो मैंने ऑफ़लाइन इस्तेमाल के बारे में App Store के लिए तैयार किया।

इससे क्या साबित नहीं होता

यहाँ कोई नतीजे नहीं हैं: न समझ के स्कोर, न यूज़ेबिलिटी स्टडी, न यह आँकड़ा कि कितने लोगों ने इसे अपनाया। जो मैं दिखा सकता हूँ वह रास्ता है, और यह कि वह कहाँ पहुँचा।

आगे मैं चाहता हूँ कि दो लोग हों, हर एक के पास अपना फ़ोन, और दोनों की बात एक-दूसरे के लिए लाइव अनुवाद होती रहे। वह अभी बना नहीं है।

App Store पर Knowless मैं डिज़ाइन के रोल के लिए उपलब्ध हूँ। संपर्क करें

  1. AI की मदद के बारे में: यहाँ बताए गए फ़ैसले मेरे हैं। मैं टूल्स को बताता हूँ कि क्या करना है, वे जो बनाते हैं उसे पढ़ता हूँ, और डिवाइस पर जाँचता हूँ। मैं यह दावा नहीं करता कि कोड की हर लाइन हाथ से लिखी गई है। ↩
  2. तस्वीरों के बारे में: क्लिप उस प्रीव्यू वीडियो से काटी गई है जो मैंने App Store के लिए बनाया, बिना आवाज़ के। उसमें, और इस पेज की हर स्क्रीन में, जो बातचीत है वह समझाने के लिए है, असली नहीं। स्थिर तस्वीरें उस स्क्रीनशॉट सेट से हैं जो मैंने App Store के लिए तैयार किया; App Store के पेज पर कोई दूसरा सेट दिख सकता है। रडार की ड्रॉइंग इस पेज के लिए बनाई गई है; वह स्क्रीनशॉट नहीं है। जिस रीडिंग स्क्रीन को आप आज़मा सकते हैं वह इस पेज के लिए बनाई गई एक छोटी नक़ल है, ख़ुद ऐप नहीं।