塔斯娱乐资讯网

这两天,看到海外好几个技术社区都在讨论同一个模型。商汤的SenseNova U1

这两天,看到海外好几个技术社区都在讨论同一个模型。商汤的SenseNova U1.5 Lite,他们刚发布的开源生图模型。

说实话,AI生图模型现在已经快卷成日经了,每隔一段时间就有一个新模型号称SOTA。

但我看到海外社区讨论度这么高,就多花了点时间了解了一下他们的技术细节,发现他们这次的升级思路确实值得聊聊。

1先简单说一下SenseNova U1.5 Lite我印象比较深的几个点。

首先中文文字渲染。U1.5 Lite 在中文这块下了很大功夫,正式版专门训练了 OCR 方向的 Expert 模型,再通过OPD把这个能力蒸馏回主模型。

最终的效果是,不管中文还是英文的海报、信息图,文字基本能做到清晰可读,排版也非常规整。

其次是图像编辑的精准度。比如你有一张图,只想改其中某个元素,别的地方一点都不要动。

听起来简单,但模型做起来很难,因为模型需要同时做两件矛盾的事:在编辑区域大胆改动,在非编辑区域严格保持。

U1.5 Lite 因为本身就能看懂图,所以它能理解原图的空间结构、版式关系,知道哪些东西是该动的,哪些是不该碰的。

第三个是 Native 4K 输出。很多模型号称支持高分辨率,但实际上是先生成小图再放大。这种做法在整体构图上还行,一看细节就纹理糊成一片,光影也不连贯。

U1.5 Lite 做的是原生 4K 生成,也就死活直接在高分辨率上完成整个创作过程,全局结构和局部细节能保持一致。

2SenseNova U1.5 Lite 这次升级,有一个很大的亮点,就是把看图、生图、改图这三件事,塞进同一个模型里。

这个思路跟市面上大多数方案不太一样。

过去的AI生图模型简单的任务可以完成的很漂亮,一旦需求稍微复杂一点,比如同时要求构图、文字、色彩、风格,它就开始顾此失彼。

也就是行业里常说的那个难题:单项能力可以很强,但多个能力同时在线的时候,整体完成度就往下掉。

U1.5 Lite这次的做法,换了一个角度。它没有去做更大的模型,相反,它把发力点放在了怎么让不同的视觉能力在同一个模型里同时做好。

3商汤这次用的是一套叫 NEO-Unify 的原生统一多模态架构,让一个模型同时具备理解、生成和编辑的能力。

换句话说,这个模型自己看得懂图,也能画图,还能对着原图精确地改。

当你给它一个复杂指令的时候,它能整体地理解你到底想要什么,然后一次性交付。因为对图片的"认知"和"创作"共享同一套参数,所以它在编辑的时候天然知道原图的空间结构和版式关系,知道哪些元素该动、哪些不该碰。

他们在训练的过程中,先针对OCR、美学、编辑等不同目标分别训练了好几个专项模型,每个专项模型只管把自己那一块做到最好。然后,再通过OPD把多个Expert的能力重新蒸馏回同一个轻量模型。

最终部署的还是一个U1.5 Lite,用户不需要自己判断该调哪个模型。但这一个模型的内部,已经把多个专家的能力融在一起了。

这个思路本身不算全新,但难的是执行。因为蒸馏的过程中,不同能力之间会互相干扰,压回一个小模型的时候,很容易出现某项能力缩水。

但从他们公布的评测结果来看,这一步至少没有翻车。在图像生成质量的Qwen-Image-Bench上,U1.5 Lite拿到了60.17,相比前代Preview版本又上了一个台阶;图像编辑评分也提升到4.59。

要知道,在高分段每提升一点都意味着大量的工程投入。

4看完技术方案之后,有几个点我觉得是比较有意思的。

首先是它的后训练策略。U1.5 Lite的正式版他们专门用强化学习去优化三个目标:指令是否被准确执行、画面是否好看、编辑时不该改的地方有没有保持住。

强化学习在这里的作用,主要是让模型变得更听话。

第二个是理解能力对生成的反哺。因为U1.5 Lite延续的是原生统一多模态路线,理解和生成共用同一套表征。模型在做图像理解任务时学到的空间关系、结构化认知,可以直接迁移到生成任务里。

这带来了一个很实际的好处。比如你给模型写一段比较复杂的视觉需求描述的时候,它不会因为指令太长就丢掉后半段。

因为它需要先理解这段话里的层级关系和空间逻辑,而不是简单地把关键词提取出来拼一张图。

5而且,U1.5 Lite是开源的,协议友好,可以商用。

海外开发者社区对这次发布的反应比预期更积极,讨论的焦点不在参数量,而在它能不能替代工作流里的某个环节。

这也能说明一个趋势变化。过去两年,AI模型的竞争,大家比的是能力上限;但现在,竞争正在从上限转向下限。一个模型十次出图九次翻车,那一次再好也没用。

商汤这次的选择没有去追更大的参数量,而是把一个8B参数的轻量模型,往稳定、可控、能用的方向反复打磨。

这种事短期看不见太大的声量,但长期来看,能用在生产里的东西,用户自己会帮你传播。

这个模型,确实可以关注一下。