阿里巴巴旗下Qwen团队于周二正式发布Qwen Image 3.0,其核心宣传点并非图像的美观程度,而是能否真正应用于工作场景。多数AI图像工具如Reve、Nano Banana、Seedream等均专注于特定领域——创意、真实感、编辑能力等,而Qwen Image 3.0选择了不同的方向。
“Qwen-Image-3.0追求的不仅是‘好看’,更是‘有用’,旨在让图像生成成为真正可部署的生产力工具。”Qwen团队在官方公告中写道。
富内容:一次生成多面板信息图
该模型的核心卖点被阿里巴巴称为“富内容”。模型可接受高达4500个token的输入,是前一代产品的4.5倍。token是AI读取的文本单位,大致相当于一个单词或部分单词,4500个token相当于几页详细的指令。这足以在单个提示词中描述九个独立的信息图面板,并一次性生成完整的图像。

“上图完全由Qwen-Image-3.0一次性生成,而非多张图像拼接而成。”阿里巴巴在博客中写道。演示中的每个面板均包含独立的图表、公式、标题和小字文本——一次渲染完成,无需后期组装。这是唯一能够实现此功能且无明显错误的模型。
真实细节:支持10像素小字与LaTeX公式
第二个支柱是“真实细节”。据阿里巴巴介绍,该模型“支持精确渲染小至10px的文本,逼真再现毛孔、发丝等细节,达到微米级生动描绘”。10像素相当于药品说明书上的免责声明字体。模型还能准确处理LaTeX——研究人员用于书写复杂数学方程的符号系统——可完整生成学术论文样图。
在常规测试中,我们通常给模型几个句子并评估其处理能力。Qwen Image 3.0能够生成下图(来自阿里巴巴官方博客)。

我们使用该模型最快的配置进行了测试。Qwen Image 3.0成功复制了Decrypt的一整篇文章。效果令人印象深刻,但并非完美无瑕。

深度知识:多语言渲染与联网数据
Qwen Image 3.0的第三个支柱是“深度知识”。据Qwen团队介绍,该模型“支持原生渲染12种语言,模拟网页、游戏、直播等主流界面,并调用丰富的世界知识”。它还能连接到互联网获取实时数据,这意味着输入某个城市和日期的天气预报提示后,会返回准确的图形,而非猜测结果。
例如,阿里巴巴分享了一张昆虫落在叶子上的照片。模型能够基于对图像的理解生成相关文字。

定位与不足
阿里巴巴将目标客户定为设计工作室、内容团队、电商运营人员以及需要批量生产就绪视觉素材的教育工作者。但值得注意的是,在阿里巴巴自家的Qwen-Image-Bench评估中——该基准测试对18个模型的图像质量、美学和真实世界保真度进行评分——上一代旗舰Qwen Image 2.0 Pro仅排名第五,OpenAI的GPT Image 2位居榜首。新模型可能表现更好,但发布时并未提供可验证的测量数据,因为没有附带基准测试表格、可下载权重或技术报告。
回顾历史,Qwen Image 1.0以Apache 2.0许可证开源,并同日发布了技术报告。而本次发布并未如此。作为阿里巴巴近期AI布局的一部分,所有证据仅来自公司精心挑选的示例图像。API试用已在chat.qwen.ai开放,定价尚未公布。
