群发资讯网

SpatialLM开源!3D空间理解大模型助力机器人“看懂”世界。Spatial

SpatialLM开源!3D空间理解大模型助力机器人“看懂”世界。SpatialLM 的3D空间理解大模型是由杭州六小龙之一的群核科技自主研发的开源模型,能够处理三维点云数据并生成结构化的三维场景理解输出,为机器人、自动导航等领域的3D场景分析任务提供了全新解决方案
什么是SpatialLM?
简单来说,SpatialLM是一款“让机器看懂空间”的黑科技。它可以通过处理从单目视频序列、RGBD图像、LiDAR传感器等多种来源提取的点云数据,精准识别出空间中的墙壁、门窗等建筑元素,以及桌子、椅子、床、电视等物体的边界框和语义类别。这意味着,SpatialLM不仅能“看见”空间里的东西,还能准确判断它们的位置和范围。
核心亮点:从视频到3D场景布局
SpatialLM的核心能力在于将普通手机拍摄的视频转换为精确的3D空间信息。用户只需用手机拍摄一段家中的布局视频,SpatialLM便可生成详细的3D场景,包括房间结构、家具位置、通道宽度等物理规则信息。这种能力突破了传统2D视频数据标注的局限性,为具身智能训练提供了强有力的工具 。
例如,在整理房间的场景中,机器人通过SpatialLM可以快速理解房间的几何关系和物体分布,从而高效完成任务,解决类似“叠被子困境”这样的实际问题。
目前,SpatialLM已正式开源,并在HuggingFace、GitHub、魔搭社区等多个平台上线。这一举措不仅为学术界和工业界提供了宝贵的资源,也为更多开发者和研究者探索3D空间理解技术打开了大门。正如谷歌在其相关论文中对群核科技表示感谢一样,SpatialLM的开源无疑将加速全球范围内具身智能领域的发展 。
应用前景:从机器人到虚拟场景生成
除了机器人应用,SpatialLM还可广泛用于自动导航、虚拟场景生成等领域。比如,通过一段简单的视频,SpatialLM就能生成亿万种虚拟场景,为影视制作、建筑设计等行业提供高效的技术支持。