IT加油站

Qwen-Image-3.0发布 3x3网格10px文字

4浏览 2小时前 科技综合 MA122051

Qwen团队于7月16日通过官方博客发布第三代基础图像生成模型Qwen-Image-3.0。这一代模型将文本到图像的能力推向更复杂的维度:单次即可生成3×3网格的密集排版图像,最小10px的文字也能清晰渲染。

新模型最大的变化在于长指令处理能力。Qwen-Image-3.0的输入长度最高支持4.5k token,相比前代在复杂排版需求下容易截断指令的情况有明显改善。提示词中可以一次性包含九个页面模块的详细描述,模型直接生成信息图、网页框架、直播界面乃至游戏HUD布局,无需反复拼贴或局部重绘。

文字渲染精度是这次升级的另一项硬指标。官方规格显示支持最小10px级别文字,实际案例中连人物皮肤的毛孔、发丝卷曲纹理等微观细节也能稳定复现。对经常需要精细排版的插画师、UI设计师或游戏素材制作者来说,以往因分辨率或笔触限制而模糊的刺绣花纹、小号文字、漫画拟声词,现在可以在生成阶段直接处理到位,省去后期补字步骤。

语言覆盖同样更全面。Qwen-Image-3.0原生支持12种语言的本地化渲染,除中英文外,日语、韩语、泰语等亚洲语言以及阿拉伯文这类从右向左书写的文字系统均可正确排版。制作多语言宣传图、直播日程表或游戏界面示意图时,不必再担心缺字或排版错乱。

技术路线上,Qwen-Image-3.0仍基于Transformer架构的自回归模型,但团队在训练数据和提示词理解上做了明显调整,以支撑长序列下的跨区域一致性。对普通用户而言,最直观的体感是:以前需要多步拼接的复杂图表,现在一句话就能生成。

目前模型已通过Qwen Cloud上线,官方博客放出多张实机效果图,包括电商长页、股票看板和直播情报面板。若后续能保持这种多模态精细控制的水准,在UI原型设计、漫画嵌字、游戏素材批量生成等场景中应用,应该只是时间问题。

未经作者允许,禁止转载
#AI #图像生成 #Qwen