SLAM 会不会被大模型一键替代?
我的判断是:不会。
但 SLAM 一定会被大模型改造。
这个区别挺重要。因为现在很多技术讨论里,只要 Foundation Model 进入某个领域,大家很容易就会进入一种熟悉的叙事:传统方法是不是要没了?工程经验是不是不重要了?以后是不是一个大模型端到端全解决?
放到 SLAM 里,我觉得这个判断有点太粗暴了。
SLAM 不是普通的图像理解任务。它不是识别一张图里有什么,也不是生成一个看起来合理的三维结果。SLAM 要连续估计相机或机器人位姿,要维护地图,要保证多帧之间的几何一致性,还要在真实机器人上实时运行。
这里面很多东西,不能只靠“模型感觉”。
比如位姿不能大概对,尺度不能随便飘,回环不能凭感觉闭,地图也不能看起来像就行。机器人后面还要拿这张地图去定位、避障、规划、执行任务。一旦 SLAM 漂了,后面的智能基本都会跟着歪。
所以我一直觉得,SLAM 里最核心的东西,不是某个网络结构,而是几何约束和时序一致性。
一、但传统 SLAM 确实也有老问题
当然,传统 SLAM 也不是完美的。
低纹理场景容易虚,光照变化容易崩,单目尺度不稳定,深度估计容易漂,动态物体一多就容易污染地图。尤其是 monocular dense SLAM,想要又稠密、又准确、又鲁棒,这事一直不轻松。
也就是说,传统 SLAM 的几何框架很重要,但它的前端感知经常不够强。
这时候 Foundation Model 就有价值了。
最近有篇工作叫 FoundationSLAM: Unleashing the Power of Depth Foundation Models for End-to-End Dense Visual SLAM(论文链接:https://arxiv.org/abs/2512.25008)。
我觉得这篇有意思的地方,不是它说“用大模型替代 SLAM”,而是把 depth foundation model 的先验引入到 dense visual SLAM 里。
它试图解决的一个核心问题是:之前一些基于 flow 的方法,匹配和跟踪可以做,但几何一致性不够强。
FoundationSLAM 的思路是,用深度基础模型提供更强的几何引导,再通过 Hybrid Flow Network 做 geometry-aware correspondence。简单理解,就是让匹配不只是图像层面的相似,而是带一点三维几何意识。后面再用 Bi-Consistent Bundle Adjustment Layer,把关键帧位姿和深度一起放到多视图约束里优化。
这个方向我觉得挺有代表性。
它不是把传统 SLAM 那套优化思想扔掉,而是把 foundation depth model 当成一个更强的先验来源。模型负责补感知和泛化,几何优化负责兜住一致性。
说白了,这更像是给 SLAM 加了一个外挂,但方向盘还在几何手里。
二、SLAM 更可能走向“模型先验 + 几何优化”
我觉得未来 Visual SLAM 很可能会沿着这条混合路线走。
一边是基础模型提供更强的深度、匹配、语义、动态物体理解能力。另一边是传统 SLAM 里的 BA、多视图约束、回环检测、位姿图优化继续发挥作用。
这两边不是谁取代谁,而是分工会变。
传统 SLAM 最怕的,是前端观测质量不稳定。比如图像纹理少、光照变化大、相机运动快,前端一旦匹配错,后面优化再努力也救不回来。
Foundation Model 的优势,恰好在这里。它看过大量数据,对深度、物体、场景结构有更强的先验。哪怕当前画面条件不理想,它也可能给出一个比传统局部特征更稳的初始判断。
但基础模型也有自己的问题。
它输出的深度不一定天然满足多帧几何一致。它可能单帧看起来很合理,但放到连续视频里,就会出现尺度、边界、细节不一致的问题。这个问题如果不处理,直接拿去做 SLAM,后面一样会翻车。
所以关键不是“用不用 Foundation Model”。
关键是:怎么把它放进 SLAM 的几何闭环里。
我觉得 FoundationSLAM 这类工作的价值就在这里。它不是迷信模型,而是在回答一个更工程的问题:
基础模型的先验,怎么变成一个几何系统可以稳定使用的约束?
这个问题很重要。
因为机器人需要的不是一张漂亮深度图,而是一套连续、一致、可用于行动的空间估计。
三、大模型会增强 SLAM 的哪些环节?
所以我不太认同“SLAM 会不会被大模型替代”这种问法。
更合理的问题应该是:SLAM 里的哪些环节会被基础模型增强?
我觉得至少有几个地方会变。
首先是深度估计。单目 SLAM 过去很难的尺度和稠密深度问题,可能会被 depth foundation model 明显改善。
其次是匹配和跟踪。传统特征在弱纹理、重复纹理、光照变化下容易不稳,而 foundation model 的特征可能提供更强的跨场景鲁棒性。
再往后是语义和动态理解。SLAM 不能一直假设世界是静态的。人、车、门、抽屉、机械臂这些东西都会动,基础模型有机会帮助系统区分哪些结构应该进地图,哪些只是临时出现。
但不管前端怎么变,最后一定还要回到几何一致性。
这也是 SLAM 和普通视觉任务最大的区别。
在分类、检测、分割里,一个结果局部合理,很多时候就够用了。但 SLAM 不是。SLAM 是一个连续系统,今天这一帧的小误差,可能会在后面慢慢滚大。等你发现的时候,地图已经歪了。
这就像做多传感器标定一样,单个指标看着还行,不代表系统就稳。工程里最怕的就是这种“局部看着对,整体越跑越歪”。
四、真正值得关注的不是“大模型替代 SLAM”,而是“SLAM 被重新武装”
所以我现在看 Foundation Model + SLAM,不会只看模型有多强。
我会更关心它有没有把模型输出接进多视图约束里,有没有处理时序一致性,有没有可靠性判断,有没有失败区域的 refinement,有没有在真实复杂场景下长期跑过。
FoundationSLAM 里提到的 Reliability-Aware Refinement,我觉得就是这个方向。不是所有区域都一样可信,系统要知道哪里可靠、哪里不确定,然后动态调整 flow update 和优化过程。
这点很工程。
因为真实图像里,反光、遮挡、动态物体、低纹理区域不可能完全消失。你不能假设模型每个地方都看得一样准。SLAM 系统必须学会“哪里该信,哪里别太信”。
我的判断是,下一代 Visual SLAM 可能会越来越像一个混合系统:
基础模型负责提供强先验,几何优化负责保证一致性,系统工程负责判断什么时候信模型、什么时候信约束、什么时候触发重定位或回环。
这比“端到端一把梭”听起来没那么酷,但更像真实机器人能用的路线。
说白了,SLAM 不是被 Foundation Model 替代,而是会被 Foundation Model 重新武装。
传统 SLAM 的骨架还在,几何和优化还是硬骨头。但感知前端、深度先验、动态理解这些地方,会越来越多地被基础模型接管。
这对机器人其实是好事。
因为具身智能后面要的不是一个单独的 SLAM 模块,而是一套稳定的空间基础设施。机器人要知道自己在哪,环境是什么样,哪些东西会动,哪些地方能走,动作之后世界怎么变。
如果 Foundation Model 能让 SLAM 看得更稳,几何优化能让结果更一致,那这两者结合起来,才有可能支撑后面的 VLA、World Model 和空间智能。
所以回到最开始的问题:
SLAM 会被大模型一键替代吗?
我觉得不会。
更可能发生的是,SLAM 的前端会越来越模型化,后端会继续坚持几何约束,整个系统会变成“基础模型先验 + 几何优化 + 工程可靠性”的混合体。
模型负责看得更懂,几何负责别让它飘。
这可能才是 Foundation Model 进入 SLAM 最值得期待的地方。




