现在国产的 8B 模型都这么强了?

8 月 21 日
 Daniel6606

商汤今天凌晨开源了 SenseNova U1.5 Lite 的正式版,说实话看了还挺震惊的,现在国产开源模型真的比想象中要好挺多,先放链接:

GitHub: https://github.com/OpenSenseNova/SenseNova-U1

Hugging Face: https://huggingface.co/collections/sensenova/sensenova-u15

SenseNova Studio ,可以在线体验: https://unify.light-ai.top/

TL;DR 这次主要更新了:

来看看 Showcase:

先看图片编辑的例子,输入参考图片以及 prompt: 沿用这张图的复古公益画报形式,做一张博物馆文物防潮保护信息图。 风格一致性保持的不错,而且会把海报里的元素做一下优化

除了图像编辑,还有多图像合成,可以把三张照片一起丢给它,让模型把三个图片里的元素融合到一起。 输入这三张图片: prompt 是:

请将第一张图中的橘猫完美融合到第三张图咖啡馆落地窗边的场景中,并且让它坐在第二张图中的复古金属玩具车上。具体要求如下:

  1. [角色与道具融合] :提取第一张图中橘猫的标志性面部特征(微胖的脸、绿色的眼睛)以及胸前那块倒三角形状的浓密白色毛发,使其姿态调整为骑在第二张图的金属玩具车上——橘猫的两只前爪需要搭在玩具车的电镀车把上,身体后半部稳稳坐在棕色皮革座椅上,猫咪的肉垫与金属车把、大腿毛发与车鞍边缘要产生自然的挤压、贴合与物理遮挡,绝对不能有生硬的贴纸感。
  2. [空间透视调整] :将第二张图中原本为正面的玩具车,调整为符合第三张图地面透视的四分之三侧面角度,并等比例缩小放置在靠近玻璃窗的木地板上。
  3. [物理光影与材质适配] :严格采用第三张图中斜向射入的金色午后阳光作为主光源。橘猫的背部、耳朵边缘和蓬松的毛发边缘必须被勾勒出一圈温暖闪耀的金色轮廓光(逆光效果);第二张图中的墨绿色金属烤漆车身、金属轮毂和电镀把手需要产生真实的日光高光反射,并映射出窗外的微弱街景;整辆玩具车(包含车上的橘猫)必须在右侧的木地板上投下符合光源方向、带有真实软边过渡的深色阴影。

然后就得到了一张哈吉米骑着小车在咖啡馆里的图片⬇️

还有 4K 图片生成,现在噪点也少多了

还可以做到框选+标注的效果,相当于直接把 prompt 放进图里

模型接到任务改完以后是这样:

可以明显看到,几个目标区域都按照要求发生了变化,但床、床头柜、玻璃杯、右侧柜体,包括整个卧室原来的空间关系都基本保留下来

最后还有几个海报,也可以放上来,我很喜欢

图片里面的各个元素的遮挡关系,排列的形式都比较舒服

benchmark

最重要的是这个才 8B 参数,MoT 模型,应该是能在垂直领域跟闭源模型掰一掰手腕的,这次就是: U1.5 Lite 在复杂排版与精准编辑等核心的场景上,已经能和闭源的 GPT-Image-2 比肩了 benchmark 也验证了:

关于显存:

显存和速度这块前阵子刚优化过,原理大概是:MoT 结构,每层带理解和生成两套权重,但一次前向只用其中一套 之前的 offload 代码两套都搬,白白浪费一半带宽 改成只搬活跃分支之后:

模式 改前 改后
full 21.4s 21.4s
balanced 64.5s 32.5s
low 83.1s 53.1s

( 2048×2048 、50 步、BF16 、单卡 H100 ) 另外 token embedding 和 LM head 加起来 1.245B 参数在去噪循环里根本用不到,一起赶出去之后峰值显存 19.66 → 17.34 GiB 。 改前改后输出 SHA256 完全一致,没有质量代价 注意这是 H100 的时间,4090 或者 5090 这种消费级显卡跑不出这个秒数,但显存数字应该能对上

1886 次点击
所在节点    分享发现
2 条回复
catazshadow
8 月 22 日
有审查吗
Daniel6606
8 月 24 日
@catazshadow 自己本地部署的话是没有的( doge )

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1236244

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX