新闻动态

  

克日,,,,,,,,我院查宏远教授团队的论文被运筹与治理科学领域顶级期刊 Operations Research 吸收。。。。。

克日,,,,,,,,我院查宏远教授团队的论文“Reliable Off-policy Evaluation for Reinforcement Learning”被运筹与治理科学领域顶级期刊 Operations Research 吸收。。。。。

该文章思量了强化学习中的非战略评估(off-policy evaluation)问题:它希望通过一个以往的战略爆发的历史轨迹,,,,,,,,来预计另一个战略在强化学习情形中的危害。。。。。作者借助漫衍鲁棒优化的想法,,,,,,,,为该战略的危害在种种情形下提供了非渐进性以及渐进性置信区间。。。。。

我们约请到论文第一作者,,,,,,,,现在正在佐治亚理工学院攻读博士学位的港中大(深圳)2020届本科结业生王捷,,,,,,,,分享他在本科生时代的科研心得,,,,,,,,并为我们先容论文。。。。。

Q:“Operations Research 是运筹与治理科学领域极具影响力的 TOP 期刊,,,,,,,,在此期刊上揭晓文章难度极大。。。。。作为论文第一作者,,,,,,,,能否简朴分享您的科研心得??? ?????”

王捷:“积累科研兴趣——从我自己的履历出发,,,,,,,,早先我也没有很好的兴趣做科研,,,,,,,,可是在试着做项目的历程中一直地遇到问题、投入时间、以至于到厥后解决问题。。。。。在这一历程中发明自己在数学和编程这两个维度都在一直地前进。。。。。这样的正向反响蹊径最终让我积累了科研兴趣,,,,,,,,下定刻意走科研蹊径。。。。。

增强科研能力——在正常完本钱科的课程修读以外,,,,,,,,还建议特殊修读我们学校提供的 Graduate Level Courses,,,,,,,,这些课程一方面会教授许多科研所必需具备的理工类知识,,,,,,,,另一方面大多会有一个期末课题。。。。。期末课题会让各人用在这门课上学到的知识做一个关于科研上的开放式问题,,,,,,,,最后形成课题报告和课堂汇报,,,,,,,,很好地磨炼了我的科研能力。。。。。与此同时有兴趣想做科研的同砚,,,,,,,,在具备了基本的理工配景之后,,,,,,,,建议尽早进入实验室富厚科研履历。。。。。”

论文链接:https://pubsonline.informs.org/doi/abs/10.1287/opre.2022.2382

https://arxiv.org/abs/2011.04102

研究配景

在像无人驾驶、自动控制、股票投资这样的高危害高本钱情形下,,,,,,,,怎样在安排新战略之条件前评估它在强化学习情形中的危害是一个很主要的问题。。。。。这一使命的完成依赖于旧战略在情形中爆发的历史轨迹。。。。。以往的文献中大多只提供了关于新战略的危害的点预计,,,,,,,,而本文为其体现提供了置信区间预计,,,,,,,,其中置信区间上界可以为强化学习中的探索(exploration)-使用(exploitation)提供指导,,,,,,,,下界可以为设计鲁棒型战略提供包管。。。。。


研究要领

借助于统计中的主要性采样(importance sampling)的想法,,,,,,,,关于新战略 π 的危害可以通过旧战略 πb 的平稳漫衍来预计。。。。。在现实问题中由于网络数据的有限性以是无法精准地预计关于旧战略的平稳漫衍,,,,,,,,因此我们通过漫衍鲁棒优化的想法提供关于危害的上下界预计:通过已有数据首先找到该漫衍的一个简陋的预计,,,,,,,,随后在其周围用最优传输距离构建概率漫衍的荟萃,,,,,,,,最后在这一荟萃内里找到最坏的和最好的漫衍预计使得危害最大/最小化。。。。。同时我们为求解这样的优化问题设计了鲁棒价值函数迭代(Robust Value Iteration)算法。。。。。

随后我们研究了在两种差别的强化学习情形下该怎样用统计的要领调解关于构建概率漫衍荟萃的巨细。。。。。

首先思量旧战略和新战略都是在统一马尔科夫情形下评估危害的,,,,,,,,在这一情形下最优传输距离的半径应该随着数据量的增大而越来越小。。。。

而当新战略的情形爆发转变的时间,,,,,,,,我们为漫衍荟萃的半径设置为常数情形下的危害预计提供了理论包管:

最后,,,,,,,,我们为更重大的离线强化学习问题设计了一套鲁棒算法,,,,,,,,并且在种种情形下从数值上磨练了提出的框架的优越性。。。。。

研究结论

本文提出了一种基于漫衍鲁棒优化的算法来为非战略评估问题提供置信区间,,,,,,,,同时该要领还可以被用于解决离线强化学习问题。。。。。该算法有助于提升强化学习模子的稳健性。。。。。

作者简介

我院机械学习与应用中心主任、香港中文大学(深圳)校长学勤讲座教授、数据科学学院执行院长查宏远教授为论文第三作者。。。。。

图片
查宏远教授现为香港中文大学(深圳)校长学勤讲座教授、数据科学学院执行院长、优德官网(优德官网)机械学习与应用中心主任。。。。。查宏远教授1984年结业于复旦大学数学系,,,,,,,,并于1993年获得斯坦福大学科学盘算专业博士学位。。。。。查教授于2006年至2020年任职于佐治亚理工学院盘算机学院,,,,,,,,1992年至2006年任职于宾州州立大学盘算机科学与工程系。。。。。他现在的研究偏向是机械学习及应用。。。。。

论文第一作者王捷于2020年获香港中文大学(深圳)理工学院数学与应用数学理学学士学位(乙等一级),,,,,,,,现在在佐治亚理工学院攻读工业工程系博士。。。。。他的研究兴趣包括统计学习、优化理论与算法,,,,,,,,以及网络信息论等偏向。。。。。

论文通讯作者高睿教授现为德克萨斯大学奥斯汀分校麦库姆斯商学院助理教授。。。。。高睿教授于2013年获西安交通大学数学与应用数学理学学士学位,,,,,,,,并于2018年获佐治亚理工学院运筹学博士学位。。。。。他的研究兴趣包括数据驱动下的决议以及指示性剖析。。。。。

期刊先容

Operations Research 建设于1952年,,,,,,,,前身为美国运筹学学会期刊(Journal of the Operations Research Society of America),,,,,,,,1955年获得现名。。。。。它是美国运筹与治理学会(Institute for Operations Research and the Management Sciences )的旗舰期刊。。。。。