पूर्ण agent workflows कडे Qwen ला वळवत आहे Alibaba
Alibaba च्या Qwen टीमने Qwen3.7-Plus जारी केले आहे, एक नवीन multimodal model जो visual understanding ला coding आणि tool use सारख्या पारंपरिक agent capabilities सोबत एकत्र करतो. कंपनी त्याचे वर्णन multimodal interactive hybrid agent असे करते, आणि त्याची मांडणी लक्षणीय आहे: हे image input असलेले chatbot म्हणून नव्हे, तर interfaces ओळखून त्यांच्यात कार्य करण्यासाठी असलेले system म्हणून सादर केले आहे.
दिलेल्या source text नुसार, Qwen3.7-Plus प्रत्यक्ष जगातील दृश्ये ओळखणे, screen content वाचणे, graphical user interfaces operate करणे, visual templates मधून code लिहिणे, आणि mobile apps end to end navigate करणे यासाठी तयार केले आहे. Operating model महत्त्वाचा आहे. UI clicks आणि command-line instructions एकाच agent loop मध्ये चालतात, ज्यामुळे Alibaba perception, planning, आणि execution साठी वेगवेगळ्या models ऐवजी automation च्या अधिक एकात्मिक रूपाकडे जात असल्याचे सूचित होते.
दीर्घकालीन tasks हे या मांडणीचे केंद्र आहेत
Alibaba चे showcase examples दीर्घ workflows मधील autonomy वर लक्ष केंद्रित करतात. एका demonstration मध्ये, एका hybrid agent system ने 11 तासांहून अधिक काळ एक English vocabulary learning app तयार केले. source नुसार, त्या run मध्ये 1,000 हून अधिक agent calls मधून 10,000 हून अधिक code lines निर्माण झाल्या.
नोंदवलेली प्रक्रिया requirements documentation, automated code generation, dependency installation, test-case creation, GUI-based testing, parallel test scenarios, आणि version management यांचा समावेश करते. हे तपशील महत्त्वाचे आहेत, कारण ते कथेला एका वेळी केलेल्या coding demo च्या पुढे नेतात. Alibaba चा दावा असा आहे की model अनेक टप्प्यांच्या software project मध्ये टिकून काम करू शकते आणि वारंवार मानवी मदतीशिवाय tools आणि interfaces मधून काम सुरू ठेवू शकते.
दुसरी demonstration software generation मधून software imitation कडे गेली. Alibaba म्हणते की agent ने interface parse करून, SwiftUI code तयार करून, बाह्य real-time stock data API जोडून, निकाल compile करून, आणि स्वतःहून दहा functional tests चालवून Apple च्या native macOS Stocks app चे पुनर्निर्माण केले. जर ही कामगिरी सर्वसाधारण ठरली, तर model चे मूल्य prompts ला उत्तर देण्यापेक्षा कार्यरत interface पाहून ते code मध्ये पुन्हा उभे करण्यातील वेळ कमी करण्यात अधिक असू शकते.
Browser आणि cloud operations कक्षा वाढवतात
तिसरा use case model ला browser-based operations मध्ये विस्तारित करतो. Qwen for Chrome नावाच्या sidebar extension द्वारे, system user permission घेऊन agent mode मध्ये स्विच होऊ शकते आणि cloud console tasks पार पाडू शकते. source text मध्ये एका उदाहरणाचा उल्लेख आहे, ज्यात model ने image, storage, आणि security-group options ची setup करून उपलब्ध असलेला सर्वात स्वस्त virtual server instance खरेदी केला.
Alibaba असेही सांगते की model ने पुढील scaling आणि maintenance tasks हाताळल्या. हे महत्त्वाचे आहे, कारण यामुळे मांडणी केवळ एक-वेळचे task पूर्ण करण्यापासून lifecycle management कडे जाते. एखादे service तयार, test, configure, आणि नंतर maintain करू शकणारे model त्या क्षेत्रात प्रवेश करते, जे enterprises नेहमीच engineers, scripts, आणि workflow tools यांच्या संयोजनासाठी राखून ठेवले आहे.
मजबूत GUI कामगिरी, पण pure reasoning मध्ये कमकुवतपणा
दिलेल्या material मधील benchmark चित्र मिश्र आहे. Alibaba चे प्रकाशित निकाल reportedly दाखवतात की Qwen3.7-Plus graphical interface tasks वर विशेष चांगली कामगिरी करत आहे. AndroidWorld आणि ScreenSpot Pro वर, model GPT-5.4 (xhigh) पेक्षा बर्याच पुढे असल्याचे वर्णन केले आहे. यामुळे Alibaba ला crowded market मध्ये एक ठोस आघाडी मिळते: जर interface manipulation हे AI युद्धभूमीचे मोठे क्षेत्र बनले, तर Qwen केवळ संभाषणावर नव्हे, तर execution वर स्पर्धा करू इच्छिते.
त्याच वेळी, source text म्हणते की system pure logic benchmarks मध्ये मागे पडते. हा caveat महत्त्वाचा आहे. याचा अर्थ असा होतो की पर्यावरण स्वतः structure, visual anchors, आणि action affordances पुरवते तेव्हा Qwen3.7-Plus अधिक उपयुक्त ठरू शकते, तुलनेत जेव्हा model ला त्या context शिवाय abstract reasoning tasks सोडवावी लागतात.
प्रत्यक्षात, model ची ताकद software पाहण्यात आणि त्यात कृती करण्यात आहे असे दिसते. ही intelligence ची संकुचित पण व्यावसायिकदृष्ट्या महत्त्वाची व्याख्या आहे, विशेषतः enterprise automation, testing, customer operations, आणि software prototyping साठी.
ही रिलीझ का महत्त्वाची आहे
Qwen3.7-Plus ला Alibaba Cloud द्वारे proprietary पण तुलनेने स्वस्त पर्याय म्हणूनही मांडले जात आहे. किंमत आणि deployment path महत्त्वाचे आहेत, कारण agentic systems दीर्घ sessions चालवताना, अनेक calls execute करताना, आणि external tools सोबत संवाद साधताना खर्च झपाट्याने वाढू शकतो. Alibaba ने operating costs कमी ठेवून मजबूत interface performance दिली, तर frontier-model किंमत नको असलेल्या developers आणि businesses मध्ये त्याला चांगला प्रतिसाद मिळू शकतो.
मोठा अर्थ असा की Qwen3.7-Plus AI vendors progress कसे परिभाषित करत आहेत त्यातील बदल दाखवते. केवळ benchmark scores किंवा chat quality वर लक्ष केंद्रित करण्याऐवजी, Alibaba हे पाहत आहे की model interface पाहू शकते का, निर्णय घेऊ शकते का, tools call करू शकते का, code लिहू शकते का, आणि तासन्तास task वर टिकून राहू शकते का. यामुळे reliability, oversight, आणि failure handling संदर्भातील कठीण प्रश्न सुटत नाहीत. पण स्पर्धा कोणत्या दिशेने जात आहे हे ते दाखवते: अशा AI systems कडे, ज्यांचे मूल्यमापन ते काय बोलतात यावर नाही, तर ते काय पूर्ण करतात यावर केले जाईल.
हा लेख The Decoder च्या रिपोर्टिंगवर आधारित आहे. मूळ लेख वाचा.
Originally published on the-decoder.com


