Daniel6606 发表于 11 小时前

SenseNova U1.5-Lite-Preview 开源了: 4K 生成、复杂排版和原生图像编辑

这次目前只开源了权重,我还没饭判断本地部署的成本,把主要功能放在这儿

原生 4K 图像生成

U1.5 重新设计了图像生成头,并把训练扩展到 4K 分辨率。

这部分主要改善:

局部纹理和高分辨率细节

材质表现

光影一致性

视觉 Token 网格产生的痕迹

拼接缝和破损纹理

https://i.imgur.com/pdmznqo.png

https://i.imgur.com/Th590uT.png

中英文文字和复杂排版

这次更新加强了中文、英文文字生成,以及海报、信息图和品牌视觉中的复杂布局

简单任务仍然可以使用短提示词, 长提示词和 JSON 一类的结构化指令主要用于提高复杂任务的可控程度,不是每次生成都需要写几千字

这个方向对海报和信息图比较实用。这类任务的难点通常不在于生成一张好看的背景,而在于同时处理文字、层级、对齐、多个主体和局部约束。

https://i.imgur.com/E4zeCTk.png

https://i.imgur.com/i6rcxnq.png

图像编辑能力

U1.5 覆盖的编辑方式比较多:

根据参考图重新解释风格和设计

从多张参考图提取人物、产品、场景或风格并重新组合

根据单张人物或产品图制作新海报

修改信息图中的标题、数字、图标、图表和局部布局

替换现实场景中的文字

通过红框、坐标或标记点指定编辑区域

在当前结果上继续修改

文字编辑会尝试保留原来的字体、材质、透视、布局和遮挡关系。局部编辑则强调保留主体身份、空间结构和未指定区域。

我个人更关注连续编辑。如果模型能够在多轮修改后仍然保持人物、商品和版式的一致性,它会比一次性文生图更接近真正的设计工具。

https://i.imgur.com/vlyT9rI.jpeg

https://i.imgur.com/8z5eKcu.jpeg

Benchmark

官方给出的数据都是 U1.5 Preview 与上一代 U1 的对比:

Benchmark
U1
U1.5 Preview

Qwen-Image-Bench
47.14
55.20 (使用 Prompt Enhance )

ImgEdit-Bench
3.90
4.37

GEdit-Bench-en
7.47
8.17

GEdit-Bench-zh
7.42
8.05

换算下来,四项指标的相对提升大约是 17.1%、12.1%、9.4% 和 8.5%。

这些结果只能说明 U1.5 相比 U1 有进步。由于没有完整的同条件横向测试,目前无法据此判断它和其他开源图像模型的实际差距。Qwen-Image-Bench 的 55.20 也必须带上 Prompt Enhance 这个条件。

目前已知的问题

官方材料列出的待改进项包括:

短提示词的理解和设计能力

小字号文字

人物面部细节

细粒度语义纹理

整体审美一致性

我的看法

从介绍材料来看,U1.5 的方向比较明确:把生成、参考图控制和局部编辑放进同一个工作流

连续编辑几轮以后,主体和布局还能不能保持一致

中文小字和复杂海报能否稳定复现
页: [1]
查看完整版本: SenseNova U1.5-Lite-Preview 开源了: 4K 生成、复杂排版和原生图像编辑