प्रौद्योगिकी

अलीबाबा की AI जो आपकी स्क्रीन पढ़ती है, असली फ़ोन पर 92% स्कोर करती है और आपके हार्डवेयर पर चलती है

Susan Hill

अलीबाबा का Qwen-UI-Agent आपके ऐप्स तक पहुँचने के लिए किसी खास अनुमति की ज़रूरत नहीं रखता। यह स्क्रीन पढ़ता है, उस पर मौजूद चीज़ों की पहचान करता है, और क्लिक करता है — मैसेजिंग से लेकर डॉक्यूमेंट एडिटिंग तक के काम सिर्फ़ विज़ुअल परसेप्शन के ज़रिए करता है। इसके मॉडल वेट — MAI-UI-2B और MAI-UI-8B — इस हफ़्ते Hugging Face पर आ गए हैं, जिससे यह सिस्टम किसी भी डेवलपर की पहुँच में आ गया है जिसके पास GPU है।

बेंचमार्क ठोस हैं। MobileWorld पर, जो मोबाइल एजेंटों के मूल्यांकन का मानक है, Qwen-UI-Agent ने 82.1% स्कोर किया — GPT-5.6 से 12 प्रतिशत अंक और Claude Opus 4.8 से 14.6 अंक आगे। यह अंतर मामूली नहीं है — तुलनीय पश्चिमी सिस्टम महीनों से इसी टेस्ट पर 70 के दशक के मध्य-निचले स्तर पर अटके हुए हैं। असली डिवाइस परीक्षण में — यानी इम्यूलेटर के बजाय असली एंड्रॉइड हैंडसेट पर किए गए कार्य — स्कोर 92.2% तक पहुँच गया। AndroidDaily पर, जो एक व्यापक रियल-फ़ोन मूल्यांकन है, मॉडल ने 97.5% हासिल किया। डेस्कटॉप कंप्यूटर उपयोग के लिए, OSWorld-Verified के ज़रिए मापा गया, इसने 79.5% स्कोर किया, जो GPT-5.5 और Gemini 3.1 Pro दोनों से आगे है।

अलीबाबा ने मॉडल को 100 से अधिक असली मोबाइल डिवाइसों के डेटा पर प्रशिक्षित किया, जो 150 अलग-अलग एप्लिकेशन चला रहे थे, फिर अपना खुद का बेंचमार्क — MobileWorld-Real — बनाया जिसमें लैब के बाहर प्रदर्शन को सत्यापित करने के लिए 400 से अधिक कार्य शामिल हैं। डेस्कटॉप कार्यों में लगभग 40% में विज़ुअल क्लिक के साथ-साथ बैच कमांड-लाइन ऑपरेशन शामिल थे — यह एक डिज़ाइन विकल्प है जो दर्शाता है कि असली कंप्यूटिंग कैसे काम करती है, न कि डेमो कैसे स्टेज किए जाते हैं।

वर्कफ़्लो में एक सुरक्षा परत बनाई गई है। मॉडल उन कार्यों को अस्वीकार करता है जिन्हें वह अवैध या उच्च-जोखिम वाला मानता है, और संवेदनशील ऑपरेशनों — भुगतान, डेटा हटाना, गोपनीयता प्राधिकरण — पर रुक जाता है, और आगे बढ़ने से पहले उपयोगकर्ता से स्पष्ट पुष्टि माँगता है। सिस्टम 100 से अधिक चरणों वाले अनुक्रमों को लगभग 10,000 एक साथ सिम्युलेटेड वातावरणों में प्रशिक्षित रीइन्फोर्समेंट लर्निंग के ज़रिए संभालता है।

बेंचमार्क स्कोर कठिन सवालों को खुला छोड़ देते हैं। Qwen-UI-Agent का मूल्यांकन संरचित कार्यों पर किया गया था; असली फ़ोन का उपयोग इंटरप्शन-भारी, नोटिफिकेशन-अटा हुआ होता है, और इसमें ऐसे ऐप्स शामिल होते हैं जो बिना चेतावनी के अपने इंटरफ़ेस अपडेट करते हैं। स्क्रीन-रीडिंग AI एक गोपनीयता प्रश्न भी उठाता है जिसे अलीबाबा की तकनीकी रिपोर्ट संबोधित नहीं करती: एक मॉडल जो आपकी स्क्रीन के हर पिक्सेल को प्रोसेस करता है, उसके पास बैंकिंग विवरण, निजी संदेश और वह डेटा पहुँच होती है जिसे अधिकांश उपयोगकर्ताओं ने कभी किसी तीसरे पक्ष के सिस्टम को सौंपने पर विचार नहीं किया। तीसरे पक्ष के डिप्लॉयमेंट में उस डेटा के साथ क्या होता है, इसके लिए दिशानिर्देश अनुपस्थित हैं।

यह प्रोजेक्ट GitHub पर Tongyi-MAI/MAI-UI पर होस्ट किया गया है; मॉडल वेट अब Hugging Face पर हैं। कोई वाणिज्यिक API या डिप्लॉयमेंट मूल्य निर्धारण घोषित नहीं किया गया है। Qwen-UI-Agent के लिए अगला परीक्षण कोई बेंचमार्क नहीं है — यह है कि क्या ओपन वेट पर निर्माण करने वाले डेवलपर प्रोडक्शन में वही मेल कर पाते हैं जो अलीबाबा ने लैब में दर्ज किया।

टैग: , , , , ,

चर्चा

0 टिप्पणियाँ हैं।