新闻动态

  

具身智能需要怎样的基础模子????? ???首先,,,,,,具身智能基础模子需具备强盛的学习能力,,,,,,以便探索未知情形。。。。。。其次,,,,,,具身智能基础模子应能在端上安排,,,,,,从而增强清静性、可靠性、以及安排端性价比。。。。。。

为此,,,,,,优德官网具身智能团队克日宣布了强化学习基座模子OmniRL。。。。。。团队首先提出一种离散随机情形的规 ;; ;;;焐,,,,,,可以天生百万级别马尔可夫决议链使命,,,,,,用于合成数百亿时间步的泛强化学习历程数据举行训练。。。。。。

进一步地,,,,,,团队提出一种在上下文中整合强化学习和模拟学习的数据合成要领和模子结构,,,,,,使用随机天下训练的模子,,,,,,可以无需梯度微挪用于解决没有见过的Gymasium情形。。。。。。

论文地点:https://arxiv.org/abs/2502.02869

开源代码:https://github.com/airs-cuhk/airsoul/tree/main/projects/OmniRL

 

预训练和元训练:授模子以鱼和授模子以渔

预训练最初的目的是让模子完成多种使命,,,,,,而在大规模预训练历程中,,,,,,最要害的能力之一就是上下文学习(In-Context Learning)。。。。。。这种能力使大模子能够通过提醒信息无邪地应对新使命,,,,,,而不需要为每个新使命举行特殊训练。。。。。。然而,,,,,,OmniRL提出的大规模元训练与古板预训练有实质区别。。。。。。它的重点不在于影象使命的详细手艺,,,,,,而是学习怎样举行强化学习的历程自己。。。。。。元学习(Meta-Learning)早在1980年月就已提出,,,,,,但OmniRL论文指出,,,,,,现有的元学习要领经常由于缺乏足够的使命规模和长序列支持,,,,,,陷入“使命识别”模式。。。。。。也就是说,,,,,,模子仅仅记着了训练时的特定情形,,,,,,并通过识别目今所处的情形来“激活”对应的手艺。。。。。。这种模式导致模子无法真正泛化,,,,,,无法有用应对未见使命或漫衍外使命,,,,,,从而限制了其在现实应用中的体现和无邪性。。。。。。

图1. OmniRL模子结构和学习历程示意图

 

首次使用上下文学习统一多强化学习和模拟学习

OmniRL提出了通过同时使用先验信息和后验奖励(Feedback)举行上下文学习的立异要领,,,,,,使得模子能够凭证需求在差别学习模式之间自主切换。。。。。。图2展示了在随机天下中训练的 OmniRL模子,,,,,,证实晰该要领的重大无邪性。。。。。。在不依赖任何梯度优化的情形下,,,,,,模子能够在冷启动时,,,,,,或仅依附给定的一段演示轨迹(无论是专家演示照旧较差的演示),,,,,,通过在线强化学习(Online-RL)、离线强化学习(Offline-RL)和模拟学习(IL)的自主切换,,,,,,实现优异体现。。。。。。这一效果突出批注,,,,,,上下文学习不但具备高度的无邪性,,,,,,还能够在多种学习战略之间自由转化,,,,,,从而顺应重大情形。。。。。。更进一步,,,,,,基于演示轨迹,,,,,,模子通过自主探索一直提升自己的能力,,,,,,展现了极强的自我优化能力。。。。。。

图2. OmniRL能够通过上下文学习举行在线强化学习,,,,,,离线强化学习或者模拟学习。。。。。。并且完全没有履历多智能体训练,,,,,,相比古板人工设计强化学习要领有重大效率优势。。。。。。

 

首次展现出数据多样性和序列长度主要性泉源

OmniRL使用了高效的线性注重力结构举行建模,,,,,,在实验中,,,,,,OmniRL比照了相同数据量但使命数目差别的效果,,,,,,发明当使命数目缺乏时,,,,,,模子会倾向于接纳“影象+情形识别”模式,,,,,,将所有训练情形的特征存储在模子参数中,,,,,,通过上下文举行快速辨识。。。。。。这种模式下,,,,,,智能体能够更高效地顺应训练历程中已见过的情形,,,,,,但却难以泛化到未见情形。。。。。。然而,,,,,,当使命数目充分时,,,,,,模子才会引发出真正的通用上下文学习能力,,,,,,这种能力能够有用地泛化到未见使命,,,,,,但它需要更长的上下文学习周期才华实现最佳体现。。。。。。

这一发明凸显了两个要害看法:数据的完整性和多样性比数据的绝瞄准确性更为主要。。。。。。即便接纳带有失真的数据,,,,,,通过提升上下文学习的泛化能力,,,,,,模子也能够更好地顺应真实使命情形。。。。。。长序列建模和长时影象是通用学习能力的一定选择。。。。。。随着训练使命数目的增添,,,,,,模子自然会选择不再影象使命相关的详细知识,,,,,,而是专注于影象学习要领自己,,,,,,这导致它在应对训练集中的使命时需要更多的顺应时间。。。。。。这正是大规模元学习的焦点特征所在。。。。。。

图3: 相同数据量,,,,,,差别使命量训练的损失值(越低越好)和上下文长度以及元训练迭代次数的关系。。。。。。使命数目越多,,,,,,在已见(seen)和未见(unseen)使命上的体现越一致,,,,,,但在上下文维度上破费更长的下降时间。。。。。。

 

面向下一代通用具身智能体的手艺探索

OmniRL的最终目的是实现能够在恣意情形中完全自主探索和学习的智能体,,,,,,这一目的对具身智能尤为主要。。。。。。与大语言模子差别,,,,,,后者通过参数影象捕获大宗的知识、百科知识和数理逻辑,,,,,,为其零样本能力提供支持,,,,,,具身智能面临的是多样化的情形、使命以及重大的本体异构性,,,,,,这些都使得知识难以成为解决问题的焦点基础。。。。。。

具身智能的焦点在于自主学习能力和长时影象,,,,,,这两者将成为通用具身智能体的要害。。。。。。别的,,,,,,OmniRL的上下文自主学习和影象能力与目今大语言模子在长时序推理和头脑链方面的能力有所差别。。。。。。OmniRL越发着重于“系统1”(直觉头脑)的学习,,,,,,而大语言模子则着重于“系统2”(逻辑头脑和妄想)的提升。。。。。。

只管这两种能力的学习与增强都至关主要,,,,,,但目今主流的大模子尚未充分探索这两个领域,,,,,,而OmniRL恰恰填补了这方面的空缺,,,,,,使其在具身智能应用中展现出奇异的优势。。。。。。