商汤科技正式宣布开源全新的轻量级、原生统一多模态大模型 SenseNova U1.5Lite。作为一款参数量为8B 的轻量化模型,它在多项核心视觉任务中展现出了超越同量级模型的实力,甚至在部分复杂排版与文字渲染上达到了媲美超大规模商业模型的交付水平。
SenseNova U1.5Lite 原生支持3至4K 的上下文长度,能够同时处理主体、数量、空间关系、文字、布局以及风格等多重约束,从而显著提升复杂视觉任务执行时的稳定性。

在具体功能特性方面,该模型带来了多项核心升级。首先是更高质量的视觉生成,显著改善了整体构图、色彩、材质、光影、真实感和局部细节,有效避免了传统模型常见的局部正确但整体完成度不足的问题。其次是更可靠的原生图像编辑能力,增强了对主体身份、空间结构、版式关系以及非编辑区域的保持度,同时全面提升了局部修改、元素替换、文字精修和多参考图编辑的综合表现。
此外,该模型在文字与复杂布局的处理上同样表现亮眼,加强了中英文文字、海报、信息图、品牌视觉及多文本排版能力,推动生成内容向完整的视觉表达迈进。在视觉控制上,它支持 Bounding Box、Visual Marker 以及单图、多图参考等多种方式,能够对指定区域和对象进行更精确的编辑。更值得一提的是,它实现了原生4K 高分辨率输出,在高分辨率生成中能够兼顾整体宏观构图与极精细的肌理、微小文字以及光影折射效果。
项目地址:https://github.com/OpenSenseNova/SenseNova-U1
腾讯混元多模态团队近期深度调整:原xAI多模态理解负责人蔺旭东加盟,任多模态内容生成算法负责人;原负责人胡瀚离职创业,前OpenAI研究员田永龙加入。系列人事变动标志着腾讯在多模态大模型研发上正进行深层次路线重构。
演语科技不研发底层大模型,凭多款AI创作应用三年崛起,现启动香港IPO,估值高达30亿美元,引发AI应用层“中间商”商业价值与竞争壁垒探讨。
NVIDIA推出统一音频-文本大模型Audex,基于纯文本MoE架构,采用单一Transformer,解决多模态模型音频增强导致文本逻辑下降的难题,实现高效音频理解与文本能力的平衡。
谷歌DeepMind的文生视频模型Gemini Omni Flash在权威盲测排行榜Video Arena中以1404Elo分跃居第一,彰显谷歌多模态技术实力,也印证视频生成领域正高速迭代。
商汤科技正秘密研发多模态大模型“U1Pro”,面向设计场景,由首席科学家林达华牵头。该模型隶属“日日新”家族,目标对标OpenAI的GPT-Image2,强调长程逻辑与思考能力,预计7月启动内测并商用。

关注 “悠AI” 更多干货技巧行业动态