北京时间2023年8月18日,,,,,,,第九期优德官网-TNSE团结优异讲座系列运动在线上乐成举行。。。。。。此次,,,,,,,我们有幸约请到加州大学戴维斯分校的Junshan Zhang教授先容热启动强化学习的相关研究,,,,,,,并分享他在这个领域内的效果与有趣发明。。。。。。
本次讲座由 优德官网 副院长兼群体智能中心主任、香港中文大学(深圳)协理副校长、校长讲座教授、IEEE TNSE 主编黄建伟教授担当执行主席和主持人。。。。。。
热启动强化学习在离线训练中获得的先验战略的资助下,,,,,,,正在成为一种具有现实应用价值的强化学习要领。。。。。。然而,,,,,,,最近的履历研究批注,,,,,,,热启动强化学习的性能在某些情形下可以快速提高,,,,,,,但在其他情形下却变得障碍不前,,,,,,,特殊是当使用函数迫近时。。。。。。唬;;;;诖耍,,,,,,Junshan Zhang教授及其相助者聚焦于研究要害性问题:是否以及何时可以通过离线强化学习的热启动战略显著加速在线学习???????
Junshan Zhang教授及其相助者首先思量普遍应用的具有先验战略的Actor-Critic(A-C)要领:通太过别量化Actor更新和Critic更新中的近似误差,,,,,,,将热启动A-C算法转化为带扰动的牛顿法,,,,,,,从而得出近似误差对禁绝确的Actor/Critic更新的有限时间学习性能的影响。。。。。。进一步地,,,,,,,研究提供了次优差别(Suboptimality Gap)的上限,,,,,,,为热启动强化学习的设计提供了指导,,,,,,,以实现所需的有限时间学习性能。。。。。。特殊地,,,,,,,有偏近似误差情形下的次优差别下限的研究批注,,,,,,,纵然有优异的先验战略,,,,,,,性能差别也可能远离零。。。。。。
Junshan Zhang教授的精彩分享发人深思,,,,,,,在加入者与两位教授的起劲讨论中,,,,,,,涌现了许多有趣的问题。。。。。。例如非线性方程近似的场景、接纳预训练模子的时机选择、异构数据漫衍的影响等。。。。。。
视频回首:https://www.bilibili.com/video/BV1or4y1976H/
*特殊鸣谢李想对本文的孝顺
