
今年4月商汤科技发布了SenseNova U1首次完整展示了基于NEO-Unify架构的原生统一多模态路线在单一模型中联合建模语言、视觉语义与像素生成让模型能够原生完成视觉理解、推理和生成。过去几个月中商汤科技持续强化模型的图像生成与编辑能力现面向社区开源轻量级统一多模态模型的预览版本SenseNova U1.5-Lite-Preview。SenseNova U1.5-Lite-Preview并非简单的模型规模升级而是基于U1的一次系统性迭代不仅在同一架构中贯通视觉理解、推理、生成与编辑还仅以 8B-MoT 的轻量大小将能力推进到4K、更精细的真实质感、更复杂的视觉控制和可持续迭代编辑。SenseNova U1.5-Lite-Preview 生成相比U1U1.5-Lite-Preview在以下方向上带来了显著提升原生支持4K图像生成更精细的局部纹理、细节与真实世界质感更准确的中英文文字生成与复杂版式组织更稳定的图像编辑和视觉指令遵循如果说U1成功验证了“统一架构是否可行”证明了从像素和语言出发、端到端构建原生统一多模态模型是一条可行的路线那么U1.5将进一步验证“能力能否持续扩展”证明统一架构不仅能够同时承载理解和生成也能够继续扩展到更高分辨率、更复杂的信息表达和更真实的视觉世界。商汤科技相信未来的多模态模型不应只是连接不同模态的系统而应该是一个从一开始就能够跨越语言、视觉与行动进行学习、思考和创造的统一智能体。长上下文视觉控制模型能力与创作辅助的协同U1.5-Lite-Preview在生成能力上做了系统性打磨商汤科技追求的不仅仅只是4K高像素更关注的是模型能否理解超长的自然语言和结构化视觉指令从而实现精准的视觉控制超大画幅下细节是否经得起放大、并保持足够的真实世界质感信息密集的内容里文字和版式是否足够稳定。更高的视觉控制上限写得越细出图越准在海报、信息图、品牌视觉等更复杂的创作任务中一张图往往需要同时满足多类要求画面中有哪些主体、人物与物体如何互动、各元素位于什么位置、采用怎样的视觉风格、呈现哪些文字以及哪些内容必须保持或避免。U1.5-Lite-Preview重点优化了对长篇自然语言、结构化创作指令的理解能力。简单的需求用户用几句大白话就能快速生成复杂的任务则可以给出完整详细的创作要求让模型按明确的视觉结构来执行。在商汤科技看来超长的提示词并不是生成好图的必要条件它的价值是给复杂创作提供了更高的控制上限。下面这张“背包产品解析”信息图使用了1675词的超长 prompt包含复古博物学标本图鉴风格、五章结构、中英双语对照、拉丁文标注等复杂约束。一个重要观察是U1.5-Lite-Preview的强prompt following能力并非主要来自对结构化模板的记忆或适配。即使在没有高度依赖专门Prompt Enhance格式化数据训练的情况下模型依然能够较稳定地执行长篇、多约束、层次化的视觉指令。商汤科技认为这正体现了原生统一多模态路线的优势模型学到的不是某种Prompt格式本身而是从语言描述到视觉结构的原生映射能力。为了降低复杂视觉指令的编写门槛商汤科技还配套了实验性的Prompt Enhance Skill它能把用户简短的想法自动整理成包含主体、布局、风格、文字和各项约束的完整创作方案再交给模型执行帮助用户把需求表达得更周全减少因为描述有遗漏导致效果偏差的情况。原生4K生成超大画幅下细节依然经得起放大4K不只是像素更多更是对细节、材质、光影和整体一致性的更高要求。无论是自然风光、商业摄影、产品海报、超宽幅长卷与高细节视觉内容U1.5-Lite-Preview都能呈现真实的材质质感与光影层次。下面的案例中模型生成了横跨2018至2026年的WAIC发展历程长卷。WAIC 发展历程分辨率4K长宽比10:3prompt 总长 3880 words这幅长卷以传统中国山水长卷的散点透视和连续叙事方式将上海城市、智慧交通、云计算、智能工厂、大模型、生成式人工智能、具身机器人、智能体和未来城市融合在同一片山河之中。即便放大观看大量文字、图标等设计细节依然清晰稳定。除了超大画幅U1.5-Lite-Preview在常规图像的真实感与细节表现上也有明显提升海岸游客中心建筑概念图浪漫生活主题拼贴海报阳光下的面部特写复古手帐页主题创意海报人物摄影与夸张字体融合设计渔民坐在船上整理渔网迷你厨师团队正在装饰一只蓝莓奶油夏日冷萃咖啡时尚广告海报女生站在路边身后车辆穿梭而过文字生成与版式升级信息量再大效果也稳得住U1.5-Lite-Preview强化了中英文文字生成及复杂版式组织能力从杂志内页、旅行攻略到复杂信息图都能在保持视觉风格的同时组织更清晰的版式结构与更准确的文字呈现。杂志内页信息图武康路 Citywalk 攻略编辑能力进化告别单次抽卡哪里不对改哪里图像编辑并非简单的局部像素重绘它要求模型能看懂画面内容、理解用户的真实意图精准判断出 “哪里要改、怎么改以及哪些部分绝对不能动”。依托原生统一多模态架构U1.5-Lite-Preview不需要拼接多个独立模型在同一个模型中协同完成视觉理解、目标定位、约束推理与像素生成的全流程。同时采用了encoder-free视觉建模方式减少了固定视觉编码器带来的信息压缩与表征瓶颈将文字笔画、局部纹理、空间结构等精细信息保留得更加完整进一步提升了编辑的准确度、画面稳定性和可控性。U1.5-Lite-Preview让图像编辑不再是外挂功能而是统一模型在理解视觉状态、执行用户约束并重构目标画面上的原生能力。这使图像创作从一次性的“重新采样”转向可持续迭代的视觉操作过程模型可以在当前生成结果的基础上持续修改文案、调整版式、补充元素从“一次抽卡、不行重来”变成“反复修改、改到满意”。目前U1.5-Lite-Preview已覆盖多类主流创作工作流参考图风格与设计再创作看懂一种风格迁移到任何主题可理解参考图中的配色、构图、材质、字体和视觉语言将其迁移至新的内容主题也可以在保留原始信息的基础上对海报和信息图进行整体美化与设计升级。输入图片输出图片案例青花瓷风格古建筑屋顶图鉴多参考图组合编辑跨图取要素融合成新作可从多张参考图中分别提取人物、产品、场景和风格完成跨图绑定、内容融合与场景重构。输入图片 输出图片案例餐饮海报定制单参考图条件创作以一张图为基础完成完整视觉设计能够以单张人物、产品或场景图片作为视觉条件在保持主体身份、外观和关键细节的基础上生成新的海报、信息图、营销页面或其他设计内容。输入图片输出图片案例人物照片简历排版信息图局部编辑牵一发不动全身可针对信息图中的标题、数字、图标、标注、图表及内容模块进行定向修改支持元素增删、位置调整、局部美化和瑕疵修复。输入图片输出图片案例替换标题文字文字编辑文字改了风格还在可对真实场景中的文字进行编辑并保持原有字体、材质、透视、排版与遮挡关系使文字自然融入原图。输入图片输出图片案例添加手绘注释交互式精准编辑画个框告诉模型“改这里”支持区域标记、坐标定位、marker标记等方式让模型更准确地理解编辑位置与范围可对局部属性进行调整。输入图片输出图片案例红框指定区域修改基于U1的系统性迭代从验证架构可行到真实场景好用U1成功验证了原生统一多模态架构的可行性而在实际落地与社区反馈中商汤科技也看到了这条技术路线仍有可优化的真实场景痛点在生成场景下U1在不同区域之间有时会衔接得不够自然出现细微的网格感、拼接痕迹或纹理断裂而当生成分辨率继续提升时模型对局部细节、复杂空间关系和整体画面一致性的建模难度也会进一步增加。在图像编辑任务中U1已经能够理解自然语言编辑指令但在更复杂的实际工作流中仍可能出现编辑范围外内容发生变化、人物身份或主体结构漂移、局部修改影响整体画面等问题。U1.5-Lite-Preview致力于针对性解决这些真实创作痛点在不盲目扩大模型规模的前提下对生成与编辑全链路进行系统性优化针对网格伪影和高分辨率细节建模问题U1.5-Lite-Preview重新设计了生成头减弱视觉Token网格对最终图像的影响并将训练进一步扩展至4K分辨率。针对图像编辑U1.5-Lite-Preview重新组织了编辑数据与训练任务强化模型对原图内容、主体身份、空间结构和非编辑区域的保持能力使其能够在完成目标修改的同时尽可能保留原图中不需要改变的部分。得益于多项能力强化U1.5-Lite-Preview在多项主流生成/编辑质量评测基准上显著超越U1并以仅 8B-MoT 的轻量级规模实现了可比肩商用闭源模型的图像生成能力与编辑效果Qwen-Image-Bench从47.14提升到了55.20with Prompt EnhanceImgEdit-Bench从3.90提升到4.37GEdit-Bench-en从7.47提升到8.17GEdit-Bench-zh从7.42提升到8.05SenseNova U1.5-Lite-Preview现面向全球用户开源欢迎广大开发者与创作者下载体验提供反馈和建议。GitHubhttps://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/u1.5_preview.mdHugging Facehttps://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview魔搭社区ModelScope 魔搭社区SenseNova-U1.5-8B-MoT-Preview从 U1 到 U1.5 的开源代表了商汤在底层创新上的持续进展。同时面向专业用户的交付级创作模型 U1 Pro 正在紧密邀测将在近期对公众开放服务。