商汤今天凌晨开源了 SenseNova U1.5 Lite 的正式版,说实话看了还挺震惊的,现在国产开源模型真的比想象中要好挺多,先放链接:
GitHub: https://github.com/OpenSenseNova/SenseNova-U1
Hugging Face: https://huggingface.co/collections/sensenova/sensenova-u15
SenseNova Studio ,可以在线体验: https://unify.light-ai.top/
先看图片编辑的例子,输入参考图片以及 prompt:
沿用这张图的复古公益画报形式,做一张博物馆文物防潮保护信息图。
除了图像编辑,还有多图像合成,可以把三张照片一起丢给它,让模型把三个图片里的元素融合到一起。
输入这三张图片:
请将第一张图中的橘猫完美融合到第三张图咖啡馆落地窗边的场景中,并且让它坐在第二张图中的复古金属玩具车上。具体要求如下:
然后就得到了一张哈吉米骑着小车在咖啡馆里的图片⬇️
还有 4K 图片生成,现在噪点也少多了
还可以做到框选+标注的效果,相当于直接把 prompt 放进图里
模型接到任务改完以后是这样:
可以明显看到,几个目标区域都按照要求发生了变化,但床、床头柜、玻璃杯、右侧柜体,包括整个卧室原来的空间关系都基本保留下来
最后还有几个海报,也可以放上来,我很喜欢
图片里面的各个元素的遮挡关系,排列的形式都比较舒服
最重要的是这个才 8B 参数,MoT 模型,应该是能在垂直领域跟闭源模型掰一掰手腕的,这次就是: U1.5 Lite 在复杂排版与精准编辑等核心的场景上,已经能和闭源的 GPT-Image-2 比肩了 benchmark 也验证了:
显存和速度这块前阵子刚优化过,原理大概是:MoT 结构,每层带理解和生成两套权重,但一次前向只用其中一套 之前的 offload 代码两套都搬,白白浪费一半带宽 改成只搬活跃分支之后:
| 模式 | 改前 | 改后 |
|---|---|---|
| full | 21.4s | 21.4s |
| balanced | 64.5s | 32.5s |
| low | 83.1s | 53.1s |
( 2048×2048 、50 步、BF16 、单卡 H100 ) 另外 token embedding 和 LM head 加起来 1.245B 参数在去噪循环里根本用不到,一起赶出去之后峰值显存 19.66 → 17.34 GiB 。 改前改后输出 SHA256 完全一致,没有质量代价 注意这是 H100 的时间,4090 或者 5090 这种消费级显卡跑不出这个秒数,但显存数字应该能对上
这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。
V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。
V2EX is a community of developers, designers and creative people.