传统SLAM主要解决“我在哪里”的问题,但无法回答“我看到了什么”和“我应该做什么”。高精地图的静态标注也难以应对动态变化,例如行人移动、货物增减或道路临时封闭。AI技术正被逐步引入导航与SLAM领域,使机器人能够更有效地感知环境并理解语义信息。以下从大语言模型与导航栈集成、语义3D SLAM系统两个方向,介绍近年来的开源项目以及工程落地实例。
🧠 一、LLM + Nav2 + ROS2:从“点到点”到“听令而行”
传统机器人导航依赖预定义航点、精确坐标和复杂操作界面,非专业人员难以使用。大语言模型(LLM)的引入正在改变这一局面。
(一)Nav2 MCP Server:让导航堆栈“听懂”AI指令
2025年发布的Nav2 MCP Server打通了ROS 2导航堆栈(Nav2)与大语言模型之间的通道,通过Model Context Protocol(MCP)协议,Nav2可以接入llamacpp、Ollama、Claude、GitHub Copilot等主流工具,将导航、路径规划、恢复行为和自主充电等动作暴露给大模型调用。
🔗 开源地址:https://github.com/ros-navigation/nav2_mcp_server
(二)GhostPilot:GPS拒止环境中的AI无人机导航
GhostPilot是首个完全开源的端到端无人机导航系统,采用三层架构:底层是Nav2导航栈负责路径规划和避障,中间层是视觉惯性SLAM(VINS-Mono)提供无GPS环境下的六自由度位姿估计,最上层是LLM智能体负责解析自然语言任务并生成执行计划。可运行在Jetson Orin甚至树莓派5上。
🔗 开源地址:https://github.com/amansachan/GhostPilot
(三)基于LLM的四足机器人零样本导航
NYU研究团队在Unitree Go2四足机器人上部署了LLM驱动的导航系统,融合开放词汇语义分割构建分层场景图,在从未见过的新环境中零样本导航任务成功率超过88%。
🔗 开源地址:https://github.com/nyu-robot-learning/llm-zero-shot-navigation (示例)
(四)首个可重复的multi-LLM延迟基准测试
2026年发表的研究提出了统一的多LLM多规划器基准测试框架,将GPT-3.5到GPT-5、Claude-3.7、Gemini-2.5、DeepSeek-R1、LLaMA-3.3-70B等八个模型集成到ROS 2 Nav2栈中,跨越DWB、TEB和RPP三种局部规划器进行评估。
🔗 开源地址:https://github.com/... (需根据实际论文补充)
(五)标杆工具体系
🔍 二、DOPESLAM与语义SLAM:从“画地图”到“看懂地图”
如果说LLM赋予机器人“听得懂”的能力,语义SLAM则赋予机器人“看得懂”的能力——标注每个物体的类别、位姿和语义信息。
(一)DOPESLAM:深度学习驱动的动态环境语义3D SLAM
DOPESLAM将深度物体位姿估计(DOPE)与实时外观建图(RTAB-Map)通过松耦合并行融合,实现在动态环境中自动标注物体并生成高精度3D地图。关键点过滤技术将推理速度提升2.6倍,在无光照场景下优于现有方案。
🔗 开源地址:https://github.com/jesseroch/DOPESLAM
(二)开源生态快速发展
过去一年语义SLAM开源生态呈爆发式增长,多个代表性项目已正式开源。
• Hier-SLAM:层次化语义高斯泼溅,语义渲染帧率高达2000 FPS,支持500+类别。
🔗 https://github.com/boying-li/Hier-SLAM
• DOGL-SLAM:动态场景物体级SLAM,将3D高斯泼溅嵌入核心流程。
🔗 https://github.com/DOGL-SLAM/dogl-slam (示例)
• YOSO-SLAM:ORBSLAM3 + YOLOv8,绝对轨迹误差降低97.92%。
🔗 https://github.com/YOSO-SLAM/YOSO-SLAM (示例)
• SG-SLAM:语义图增强的几何-语义-拓扑三层特征,双线程架构。
🔗 https://github.com/SG-SLAM/SG-SLAM (示例)
• SlideSLAM:多机器人分布式语义建图,异构平台协作。
🔗 https://github.com/SlideSLAM/SlideSLAM (示例)
🔧 三、落地实例:AI导航正在进入真实世界
(一)京东物流“超脑”大模型2.0
2025年9月发布的京东物流超脑大模型2.0构建了与物理世界1:1映射的数字孪生网络,实现贯穿仓储、运输、配送全链路的实时数据同步与智能决策,将千万级别变量模型求解时间缩短至2小时内,AR分拣指导使一线效率提升20%。
(二)智能搬运机器人
苏州某企业基于环视相机与3D相机开发环境感知AI大模型,AMR能够识别静态/动态物体、路况、标识并对托盘料架等末端载具进行3D精准感知,在无高精地图条件下自主导航,已在十余个标杆项目落地。
(三)电力巡检人形机器人
许继电气基于自主研发的激光SLAM建图导航技术,人形巡检机器人可在复杂地形稳健行走,实时构建高精度3D环境地图并动态调整巡检路线,开关柜自主操作效率提升80%以上。
(四)地下矿山巡检机器人
北大信研院与蛙云科技合作,机器狗搭载“Starbrain”算法和AI监察系统,具身视觉导航算法实现无GPS、无预建地图矿井中厘米级精准定位,动态巡检100%覆盖危险工作面。
(五)灾难救援场景
德克萨斯A&M大学开发的AI机器狗使用多模态大模型驱动记忆导航系统,能够在GPS拒止的灾后废墟中高效执行搜救任务。IEEE SSRR 2025发布的搜救副驾驶系统通过LLM结合可执行语义场景图,直接响应自然语言任务指令。
📊 传统SLAM vs AI语义SLAM:关键差异对比
🚀 四、挑战与未来展望
AI驱动的语义SLAM面临多重挑战。实时性制约方面,大语言模型推理延迟使端到端响应时间达数秒级;边缘智能部署需在计算功率与模型容量间权衡;动态环境的长期记忆要求语义图必须能够反映物体增减、移动和动态占用变化;多源数据融合涉及异构传感器信息与高精地图质量的深度融合。与此同时,自然语言地图查询、LLM增强的语义图优化、跨本体共享语义表征等趋势正在将AI导航与语义SLAM从“功能实现”推向“系统能效”的更高维度。




