新闻动态

  
我院群体智能中心黄建伟教授、范晨悠博士和智能机械人中心胡君杰博士在多媒体与人工智能 CCF-A 类聚会 ACM Multimedia 2021揭晓了题为“Few-Shot Multi-Agent Perception(小样本多智能体协同感知)”的文章。。。。。。。。

        我院群体智能中心黄建伟教授、范晨悠博士和智能机械人中心胡君杰博士在多媒体与人工智能 CCF-A 类聚会 ACM Multimedia 2021揭晓了题为“Few-Shot Multi-Agent Perception(小样本多智能体协同感知)”的文章。。。。。。。。该论文研究怎样使用大宗“具有有限自主算力和通讯带宽的智能体”,,, ,,,,执行团结的情形感知使命。。。。。。。。

        ACM Multimedia 是全球压倒一切的学术峰会,,, ,,,,旨在展示多媒体领域科学效果和立异工业产品。。。。。。。。

研究配景

        设想在未来的校园中,,, ,,,,校园送餐车或者警务车执行点到点的个体效劳使命,,, ,,,,首先需要在人群中识别目的个体再举行路径妄想。。。。。。。。我们设计一种高效的逍遥协同模式:1)使用多个无人机举行人脸识别,,, ,,,,获取校园内人群动态信息;;;;;2)自动驾驶送餐车或者警务车通过发送目的人脸到多个无人机数据举行匹配,,, ,,,,再返回相似度,,, ,,,,从而确定目的使命的地理位置再举行路径妄想。。。。。。。。


图1:多智能体协同感知示意图

        我们研究这个历程中的多智能体协同感知历程。。。。。。。。如图1所示,,, ,,,,盘问智能体(Query agent,,, ,,,,左)通过发送自己的少样本数据特征(如单张人脸图片)到多个支持智能体(Support agent,,, ,,,,右)。。。。。。。。支持智能体自身可以一直更新自己的人脸数据库,,, ,,,,通过一直地航行一连感知地面情形,,, ,,,,更新目的的坐标和外观特征。。。。。。。。支持智能体接受盘问智能体的盘问,,, ,,,,通过比对自身的数据,,, ,,,,提供相似度盘算效果并返回给盘问智能体。。。。。。。。盘问智能体吸收所有支持智能体的返回值举行排序和筛选。。。。。。。,, ,,,,从而最终确定目的位置。。。。。。。。

研究要领

        通过上述多智能体感知的历程,,, ,,,,我们需要解决如下两个难点。。。。。。。。1)盘问智能体怎样提取感知数据的特征并发送给支持智能体;;;;;2)漫衍式支持智能体怎样高效地盘算盘问-支持数据之间的相似度。。。。。。。。


图2:漫衍式怀抱学习框架示意图

        我们设计一种漫衍式特征提取与怀抱学习的架构,,, ,,,,如图2所示。。。。。。。。关于典范的感知数据,,, ,,,,如图像、音一再谱,,, ,,,,我们首先举行编码,,, ,,,,即天生其深度特征。。。。。。。。通过使用深度学习网络(如CNN),,, ,,,,天生紧凑的盘问数据的特征qu(用于发出广播盘问),,, ,,,,以及在各个漫衍式智能体外地天生维度较大的支持数据特征kv,,, ,,,,其维度巨细可以凭证使命精度举行选取。。。。。。。,, ,,,,并且可以设置为非对称巨细。。。。。。。。我们进一步将图像 2D 特征平面分成 N-by-N 个特征区域,,, ,,,,使用余弦距离来盘算盘问特征与支持特征的图像各区域的相似度,,, ,,,,

        并通过该相似度的累加来权衡盘问及支持特征的区域主要性水平。。。。。。。。

        通过盘算盘问数据与所有漫衍式支持数据之间的相似度,,, ,,,,获得最优匹配支持数据,,, ,,,,从而付与其响应的数据标签作为回覆。。。。。。。。

        为了包管对图像数据的移动、视角和旋转等变换的鲁棒性,,, ,,,,我们使用最优传输(Optimal transport)优化目的得出盘问-支持数据各个区域之间最佳匹配,,, ,,,,如下图所示。。。。。。。。

        最后,,, ,,,,通过加权平均最优匹配值获得盘问-支持数据整体的最优匹配值,,, ,,,,获得越发鲁棒的相似度怀抱。。。。。。。。如上图所示,,, ,,,,我们给出多项式时间的算法,,, ,,,,团结深度学习网络举行训练。。。。。。。。

研究效果

        我们通过实验验证了所提要领,,, ,,,,在图像分类、图像支解、人脸识别、音一再谱剖析等现在人工智能的典范应用场景下,,, ,,,,均大幅逾越现有的要领。。。。。。。。


图4:多智能体视频、人脸图像、音频收罗示意图

        在人脸识别方面,,, ,,,,我们网络了“Celebrity of 优德官网”数据,,, ,,,,验证了在小样本学习设定下(5-way 1-shot/5-shot)无人机和地面的人脸识别精度为 67%/70%,,, ,,,,精度比原有要领(拜见下方参考文献[2]、[3])提高了10-15%。。。。。。。。在蹊径支解使命上,,, ,,,,我们使用 Air-Sim 无人机模拟数据,,, ,,,,在蹊径的语义支解使命上举行验证,,, ,,,,在小样本学习设定下(3-way 1-shot/5-shot)精度为72%/78%,,, ,,,,比原有要领提高5%左右。。。。。。。。同样的,,, ,,,,在少样本图像分类和音一再谱气概分类使命上精度均有大幅度提高。。。。。。。。


图5:Air-Sim 少样本蹊径支解效果

研究总结

        我们提出了一种有用的漫衍式多智能体小样本感知的学习框架。。。。。。。。该框架体现了多智能体数据网络的优势,,, ,,,,即海量数据的协同网络;;;;;同时体现了多智能体协同感知的算力优势,,, ,,,,即通过漫衍式执行的方法,,, ,,,,实现数据处置惩罚的外地化;;;;;最后,,, ,,,,体现了多智能体少样本学习的算法优势,,, ,,,,即通过解耦漫衍式数据之间的关联,,, ,,,,包管了漫衍式执行返回的效果为全局最优,,, ,,,,而无需漫衍式节点之间的通讯,,, ,,,,节约了通讯开销。。。。。。。。

参考文献:

[1] Chenyou Fan, Junjie Hu, Jianwei Huang. "Few-Shot Multi-Agent Perception." 29th ACM International Conference on Multimedia 2021 (ACM MM'21)

[2] Abhishek Das, Théophile Gervet, Joshua Romoff, Dhruv Batra, Devi Parikh, Mike Rabbat, and Joelle Pineau. 2019. Tarmac: Targeted multi-agent communication. In ICML.

[3] Jake Snell, Kevin Swersky, and Richard Zemel. 2017. Prototypical networks forfew-shot learning. In NIPS.

作者简介

        论文通讯作者为优德官网(优德官网)副院长,,, ,,,,群体智能中心主任黄建伟教授。。。。。。。。他同时也是香港中文大学(深圳)校长讲座教授,,, ,,,,理工学院副院长。。。。。。。;;;;;平淌谑巧钲谑信舫翘仄附淌凇EEE Fellow、IEEE通讯学会优异讲者、汤森路透盘算机科学领域全球高被引科学家。。。。。。。。他恒久专注于网络通讯、网络经济学和群体智能交织领域的开创性研究。。。。。。。。他已揭晓 7部学术专著、 125 篇 JCR一区论文和 170 余篇国际聚会论文,,, ,,,,被谷歌学术引用凌驾 13900 次,,, ,,,, H-index为 59(位列全球盘算机领域学者中前 0.05%)。。。。。。。。

        论文第一作者为 优德官网 群体智能中心助理研究员范晨悠博士,,, ,,,,范博士结业于美国印第安纳大学,,, ,,,,并在美国谷歌等IT公司有三年研发工程师履历。。。。。。。。他的主要研究偏向包括深度学习、盘算机视觉、少样本学习,,, ,,,,和联邦学习等。。。。。。。。他以第一作者在机械学习和盘算机视觉领域聚会揭晓多篇研究文章,,, ,,,,包括CVPR、ACM MM、AAAI、 KDD、NeurIPS。。。。。。。。

        论文第二作者为 优德官网 智能机械人中心胡君杰博士,,, ,,,,胡博士于2020年3月结业于日本东北大学,,, ,,,,研究偏向为机械人感知、模式识别、盘算机视觉。。。。。。。。他在相关领域已揭晓十几篇学术论文,,, ,,,,其中包括 wacv 2019(100+引用)、iccv 2019、Remote Sensing 2020、ral2021 等。。。。。。。。

点击链接可审查“小样本多智能体协同感知”手艺的应用场景之一:通过遍布都会中的多智能体间的协同感知与交互,,, ,,,,资助自动驾驶车辆做出最优判断与妄想。。。。。。。。https://www.bilibili.com/video/BV1sF411Y72b/