阿里巴巴推动 Qwen 向完整 agent 工作流转型

阿里巴巴的 Qwen 团队发布了 Qwen3.7-Plus,这是一款新的多模态模型,将视觉理解与编码和工具使用等经典 agent 能力结合在一起。公司将其描述为多模态交互式混合 agent,而这一定位颇具意味:它并不是被界定为一款支持图像输入的聊天机器人,而是一个旨在感知界面并在其中执行操作的系统。

根据所提供的原文,Qwen3.7-Plus 旨在识别现实世界场景、读取屏幕内容、操作图形用户界面、根据视觉模板编写代码,并端到端地导航移动应用。其运行方式很重要。UI 点击和命令行指令都在同一个 agent 循环中执行,这表明阿里巴巴的目标是实现一种更统一的自动化形式,而不是将感知、规划和执行拆分为不同模型。

长时间运行任务是其主打重点

阿里巴巴展示的案例将重点放在跨越较长工作流的自主性上。在一项演示中,一个混合 agent 系统用了超过十一小时构建了一款英语词汇学习应用。原文称,这次运行在超过 1,000 次 agent 调用中生成了 10,000 多行代码。

据报道,这一过程涵盖了需求文档、自动代码生成、依赖安装、测试用例创建、基于 GUI 的测试、并行测试场景以及版本管理。这些细节之所以重要,是因为它们把故事带出了“一次性编码演示”的范畴。阿里巴巴试图说明,这个模型能够持续完成一个多阶段软件项目,并在不同工具和界面之间保持运行,而无需人类反复手把手介入。

第二个演示则从软件生成转向软件模仿。阿里巴巴称,该 agent 通过解析界面、生成 SwiftUI 代码、连接一个外部实时股票数据 API、编译结果,并独立运行 10 项功能测试,重建了苹果原生 macOS 股票应用。如果这种表现能够推广,其价值可能不在于回答提示词,而在于压缩“看到一个可运行界面”与“用代码复现它”之间的时间差。

浏览器与云操作扩大了适用范围

第三个用例将该模型扩展到基于浏览器的操作。通过一个名为 Qwen for Chrome 的侧边栏扩展,系统可以在用户许可下切换到 agent 模式并执行云控制台任务。原文引用了一个示例:模型购买了最便宜的可用虚拟服务器实例,包括镜像、存储和安全组选项的设置。

阿里巴巴还表示,该模型处理了后续的扩容和维护任务。这一点很重要,因为它把卖点从单次任务完成推进到了生命周期管理。一个能够创建、测试、配置并在之后维护服务的模型,已经进入了企业通常留给工程师、脚本和工作流工具组合来处理的领域。

GUI 表现强劲,纯推理相对较弱

所提供材料中的基准测试结果较为混合。阿里巴巴公布的结果据称显示,Qwen3.7-Plus 在图形界面任务上表现尤其出色。在 AndroidWorld 和 ScreenSpot Pro 上,该模型被描述为明显领先于 GPT-5.4 (xhigh)。这为阿里巴巴在拥挤市场中提供了一个明确切入点:如果界面操作成为 AI 的主要战场之一,Qwen 试图竞争的将是执行能力,而不仅仅是对话能力。

与此同时,原文也提到该系统在纯逻辑基准上表现不足。这个限制很关键。它表明,Qwen3.7-Plus 也许在环境本身提供结构、视觉锚点和可执行动作的情况下更有用,而不是在缺乏这些上下文、需要模型独立解决抽象推理问题时更有优势。

从实际角度看,该模型的优势似乎建立在“看见软件并在其中行动”之上。这是对智能更狭义但具有商业价值的定义,尤其适用于企业自动化、测试、客户运营和软件原型开发。

此次发布的意义

Qwen3.7-Plus 也被定位为一种通过阿里云提供的专有但相对低成本的选择。价格和部署路径都很重要,因为 agentic 系统在长时间运行、执行大量调用并与外部工具交互时,成本会迅速上升。如果阿里巴巴能够在保持较低运行成本的同时提供强大的界面表现,它可能会在希望获得自动化、又不想承担前沿模型定价的开发者和企业中找到受众。

更广泛的意义在于,Qwen3.7-Plus 反映了 AI 厂商定义进步方式的转变。阿里巴巴强调的不再只是基准分数或聊天质量,而是模型能否观察界面、做出决策、调用工具、编写代码,并在数小时内持续完成任务。这并不能解决围绕可靠性、监管和故障处理的更难问题,但它确实展示了竞争正在朝哪个方向发展:AI 系统将按它们能完成什么来衡量,而不仅仅是它们能说什么。

本文基于 The Decoder 的报道。阅读原文

Originally published on the-decoder.com