通义发布 Qwen-Image-3.0,支持 4.5K Token 长指令与 12 种语言

通义发布 Qwen-Image-3.0,最长可处理 4.5K Token 的图像生成指令,并支持 10px 小字、12 种语言和 100 多种艺术风格。新版本面向信息图、报纸、分镜、试卷与界面等文字密集型图片,普通用户可从发布页面进入千问网页端体验。
Qwen-Image-3.0 长指令与多语言图像生成模型

最长可处理 4.5K Token 指令

Qwen-Image-3.0 是 Qwen-Image 系列的第三代图像生成基础模型。它把可接受的指令长度提高到 4.5K Token。Token 是模型处理文字时使用的基本单位;可用长度越高,一条提示词就能容纳越多场景、文字、位置和版式要求。

长指令主要服务于信息密度较高的图片。用户可以在一次生成中描述报纸、分镜、试卷、数学课件或多格信息图,并分别指定每个区域的内容。Qwen-Image-3.0 的发布示例中,一条约 3.7K Token 的指令用于生成 3×3 信息图,九个区域包含不同主题、公式、图表与中英文文字,整张图一次完成,不需要逐格拼接。

支持 10px 小字和 12 种语言

Qwen-Image-3.0 支持渲染小至 10px 的文字,覆盖正文、公式、上下标、注释和图表标签等细小元素。对于海报、课件和社交图片之外的任务,这项能力更适合报纸页面、论文排版、知识图解等文字占比较高的画面。

模型原生支持 12 种语言、多种字体和 100 多种艺术风格。多语言文字可以与插图、照片质感和界面元素放在同一张图里,适合制作本地化海报、商品页和面向不同语言用户的内容素材。

同一模型覆盖生成与编辑场景

Qwen-Image-3.0 既能根据文字从零生成图片,也能在已有图片上继续编辑。可用方式包括给书页添加手写批注、补全受损画面、为照片加入信息标注,以及把现有素材整理成结构化信息图。

编辑任务仍然通过自然语言描述目标。用户需要说明要修改的区域、保留的内容和新增元素,模型据此处理图片,不必先在图像软件中完成复杂选区。

普通用户怎么用

普通用户可从 Qwen-Image-3.0 发布页面进入千问网页端,使用图像生成功能输入提示词。制作复杂图片时,可以先写清画布用途和整体风格,再按区域列出文字、对象与位置关系;需要编辑现有图片时,则先上传图片并说明修改范围。

4.5K Token 指令更适合一次描述完整成品,但指令仍需具体。报纸、课件或多格信息图应分别写明标题、分区、文字内容和视觉层级,减少同一区域出现相互冲突的要求。