商汤开源SenseNova-Vision统一视觉大模型:单模型横扫四大核心视觉任务

时间:2026-07-27 15:26:55 来源:互联网

近日,一款名为“日日新SenseNova-Vision”的视觉大模型正式发布并全面开源。该模型首次实现理解与生成统一,将视觉作为原生能力融入大模型体系,突破了传统打包多个专家模型的局限。本文详解其核心特性与行业对比。

image.png

该模型的分割能力覆盖通用、推理、交互式等多种类型,凭借强大的多模态理解,在推理分割和对话式分割上表现突出。单模型即可高效完成多视角点云重建与相机位姿估计,在通用视觉路线中占据领先地位。

全面超越Vision Banana,同步开放数据集

横向对比显示,相较语义导向模型,SenseNova-Vision在检测、分割、深度等高精度视觉任务上全面领先。面对生成导向模型Vision Banana,则展现出代际优势——在绝大多数权威评测指标上超越并领跑。Vision Banana仅能处理四大核心板块中的两类,而SenseNova-Vision可同时覆盖结构化理解、稠密几何、全景分割及多视角3D等全部任务。

伴随模型开源,同步发布了包含5000万样本的视觉指令语料库,未来核心能力将融入U系列大模型中。这一全任务覆盖的统一视觉大模型,为行业提供了高效、整合的新范式。