SenseNova U1.5-Lite-Preview 开源了: 4K 生成、复杂排版和原生图像编辑
这次目前只开源了权重,我还没饭判断本地部署的成本,把主要功能放在这儿原生 4K 图像生成
U1.5 重新设计了图像生成头,并把训练扩展到 4K 分辨率。
这部分主要改善:
局部纹理和高分辨率细节
材质表现
光影一致性
视觉 Token 网格产生的痕迹
拼接缝和破损纹理
https://i.imgur.com/pdmznqo.png
https://i.imgur.com/Th590uT.png
中英文文字和复杂排版
这次更新加强了中文、英文文字生成,以及海报、信息图和品牌视觉中的复杂布局
简单任务仍然可以使用短提示词, 长提示词和 JSON 一类的结构化指令主要用于提高复杂任务的可控程度,不是每次生成都需要写几千字
这个方向对海报和信息图比较实用。这类任务的难点通常不在于生成一张好看的背景,而在于同时处理文字、层级、对齐、多个主体和局部约束。
https://i.imgur.com/E4zeCTk.png
https://i.imgur.com/i6rcxnq.png
图像编辑能力
U1.5 覆盖的编辑方式比较多:
根据参考图重新解释风格和设计
从多张参考图提取人物、产品、场景或风格并重新组合
根据单张人物或产品图制作新海报
修改信息图中的标题、数字、图标、图表和局部布局
替换现实场景中的文字
通过红框、坐标或标记点指定编辑区域
在当前结果上继续修改
文字编辑会尝试保留原来的字体、材质、透视、布局和遮挡关系。局部编辑则强调保留主体身份、空间结构和未指定区域。
我个人更关注连续编辑。如果模型能够在多轮修改后仍然保持人物、商品和版式的一致性,它会比一次性文生图更接近真正的设计工具。
https://i.imgur.com/vlyT9rI.jpeg
https://i.imgur.com/8z5eKcu.jpeg
Benchmark
官方给出的数据都是 U1.5 Preview 与上一代 U1 的对比:
Benchmark
U1
U1.5 Preview
Qwen-Image-Bench
47.14
55.20 (使用 Prompt Enhance )
ImgEdit-Bench
3.90
4.37
GEdit-Bench-en
7.47
8.17
GEdit-Bench-zh
7.42
8.05
换算下来,四项指标的相对提升大约是 17.1%、12.1%、9.4% 和 8.5%。
这些结果只能说明 U1.5 相比 U1 有进步。由于没有完整的同条件横向测试,目前无法据此判断它和其他开源图像模型的实际差距。Qwen-Image-Bench 的 55.20 也必须带上 Prompt Enhance 这个条件。
目前已知的问题
官方材料列出的待改进项包括:
短提示词的理解和设计能力
小字号文字
人物面部细节
细粒度语义纹理
整体审美一致性
我的看法
从介绍材料来看,U1.5 的方向比较明确:把生成、参考图控制和局部编辑放进同一个工作流
连续编辑几轮以后,主体和布局还能不能保持一致
中文小字和复杂海报能否稳定复现
页:
[1]