想象一下,,,,,,你买了一台家庭效劳机械人,,,,,,但它每次脱离客厅后,,,,,,就会遗忘沙发在那里,,,,,,只能重新满屋子乱找。。。。。。。缺乏一连使用历史履历的能力,,,,,,是目今许多具身智能体面临的主要挑战。。。。。。。
克日,,,,,,优德官网 具身智能中心关于 StateLinFormer 的论文被 IROS 2026 吸收。。。。。。。研究团队通过“状态化训练(Stateful Training)”与线性注重力机制的团结,,,,,,突破牢靠上下文窗口限制,,,,,,大幅提升长时程导航性能与在线情形顺应能力。。。。。。。
- 论文问题:StateLinFormer: Stateful Training Enhancing Long-term Memory in Navigation
- 论文链接:https://arxiv.org/abs/2603.23571
1.具身智能体的"遗忘" 逆境
现在主流的导航系统往往面临两难:
- 古板建图(如 SLAM):虽然能够实现准确定位与地图构建,,,,,,但通常依赖显式地图体现和重大模??????樯杓,,,,,,难以像端到端模子一样通过大规模数据获得强泛化能力。。。。。。。
基于 Transformer 的端到端模子:靠大规模预训练获得了不错的泛化能力,,,,,,却受限于牢靠的上下文窗口 —— 就像影象力只有几十秒的人,,,,,,时间一长就忘了之前往过那里,,,,,,容易重复探索,,,,,,也没法在一连运行中逐步熟悉情形。。。。。。。
2.StateLinFormer 的“影象接力”
为了让具身智能体过目成诵,,,,,,研究职员引入了 StateLinFormer 模子。。。。。。。它的焦点黑科技在于:拒绝“阅后即焚”的训练方法。。。。。。。
在古板的序列模子训练中,,,,,,模子每学完一小段数据(Batch),,,,,,内部影象就会被清零(Stateless Training),,,,,,这就好比你天天上学都把昨天学的知识全遗忘,,,,,,永远从零基础最先学新内容。。。。。。。这样训练出来的模子,,,,,,只习惯 "从零最先" 的影象状态,,,,,,却历来没学过怎样在 "已经积累了大宗历史信息" 的状态下做决议。。。。。。。比及真实安排时,,,,,,智能体需要一连运行几小时甚至更久,,,,,,训练和推理的场景完全错位,,,,,,影象能力自然施展不出来。。。。。。。
StateLinFormer 立异性地接纳了状态化训练(Stateful Training):模子在训练时保存了上一段数据的影象状态,,,,,,并直接转达给下一段。。。。。。。这让具身智能体在训练历程中一连履历长时间运行所爆发的影象状态,,,,,,而不是每隔几分钟就被强行“洗脑”一次。。。。。。。配合线性注重力机制恒定的影象巨细,,,,,,突破了长序列的盘算瓶颈。。。。。。。

3.焦点亮点
- 无限续航的长时影象:将模子训练与现实安排时的一连性对齐,,,,,,付与了线性模子真正的长时影象能力。。。。。。。
- 涌现的“上下文学习(ICL)”能力:实验发明了一个惊艳的征象——随着具身智能体在统一情形中一直执行使命,,,,,,厥后续使命乐成率显着提升!无需更新任何参数,,,,,,纯靠积累的履历就能举行在线情形顺应。。。。。。。
- 全新一连导航基准(CON):提出了 Continual Object Navigation 测试,,,,,,专门磨练具身智能体在统一个情形中一连吸收新使命、复用历史履历的能力,,,,,,贴近真实的“终身学习”场景。。。。。。。
4.实验体现
在基础的 MAZE 迷宫和高度逼真的 ProcTHOR 3D 室内情形中,,,,,,StateLinFormer 的体现都极为亮眼:
- 在相同的 2 亿参数目下,,,,,,周全逾越了每次都清空影象的古板线性模子。。。。。。。
- 比照拥有 4000 万数据预训练的强盛 SPOC 架构模子,,,,,,仅用 1000 万数据训练的 StateLinFormer 依然实现了乐成率的反超,,,,,,且抵达目的所需的平均步数更短!
影象状态更稳固:研究还发明,,,,,,有状态训练下的模子影象状态波动更小,,,,,,相对标准差更低。。。。。。。这说明模子的影象动力学更趋近于稳固的稳态漫衍,,,,,,而非无状态训练下那种从零最先又快速消逝的瞬态影象。。。。。。。
![]() | ![]() | ![]() |
图1 上下文学习能力更好;;;;;;;;图2 导航乐成率更高;;;;;;;;图3 影象状态更稳固
5.不止导航:为具身智能的恒久影象翻开新思绪
已往我们总在架构上想步伐扩展影象,,,,,,却忽略了训练时的影象一连性。。。。。。。而 StateLinFormer 证实,,,,,,只要让影象在训练中真正 "流动" 起来,,,,,,模子就能自然生生长时程顺应能力,,,,,,甚至涌现出更强的上下文学习能力。。。。。。。关于未来的具身智能而言,,,,,,无论是家庭效劳机械人、工业巡检机械人,,,,,,照旧恒久运行的智能体,,,,,,都需要在统一个情形中一连事情、一直积累履历。。。。。。。有状态训练的思绪,,,,,,恰恰为这类真实场景落地提供了要害的手艺支持。。。。。。。
StateLinFormer 的价值,,,,,,远不止于提升导航使命的指标,,,,,,也带来了更普遍的启发:要让智能体拥有恒久影象,,,,,,未必一定要堆更大的模子、更长的上下文窗口,,,,,,优化训练范式、让训练对齐真实安排的一连场景,,,,,,同样是一条高效的路径。。。。。。。
6.作者简介
第一作者:
- 陈致远:优德官网(优德官网)高级工程师,,,,,,曾任百度高级研发工程师。。。。。。。恒久从事人工智能与交织学科研究。。。。。。。主要研究偏向包括In-Context Learning、World Model以及AI for Science。。。。。。。其相关研究效果已多次揭晓于国际着名聚会及期刊,,,,,,并持有十余项海内外焦点专利。。。。。。。
- 钟雨轩:优德官网助理工程师,,,,,,主要研究偏向包括具身VLA模子、In-Context Learning以及World Model等。。。。。。。
通讯作者:
- 王凡:优德官网具身智能中心研究员,,,,,,王凡博士曾任百度优异架构师,,,,,,主要研究领域和研究兴趣包括端到端机械人模子,,,,,,自然语言大模子,,,,,,AI for Science等。。。。。。。王凡在Nature Machine Intelligence等顶刊和顶会上揭晓凌驾30篇Paper,,,,,,在天生式大语言模子,,,,,,生物分子表征大模子,,,,,,Human-In-The-Loop强化学习,,,,,,元学习等领域揭晓过大宗前沿论文,,,,,,并获得包括吴文俊人工智能科技前进奖特等奖等声誉。。。。。。。
- 刘少山:优德官网具身智能中心主任,,,,,,ACM科技政策委员会成员、IEEE国际装备和系统蹊径图(IRDS)机械人盘算偏向主席。。。。。。。研究偏向为具身智能、盘算系统、科技政策。。。。。。。
焦点团队:俞波(优德官网研究员)、邵鹏韬(优德官网工程师)、叮嘱(优德官网常务副院长)



