基于强化学习与安全约束的自动驾驶决策方法
王宇霄1,2; 刘敬玉3; 李忠飞3; 朱凤华1
Source Publication交通运输研究
ISSN2095-9931
2023-02
Volume9Issue:1Pages:31-39
Subtype研究型论文
Abstract

在自动驾驶决策场景下,为解决强化学习算法安全性差、学习效率低的问题,提出一种在算法的训练阶段添加基于价值的安全约束和虚拟奖励的方法。首先,利用状态、动作价值函数和安全判断规则,对智能体执行的动作进行基于价值的安全约束,选择价值高且安全的动作。然后,向回放池添加包含虚拟奖励的预测轨迹数据,以补充由于约束而未能获取的试错动作信息和相应的状态、奖励信息。最后,为进行加减速和换道决策实验,基于修改后的高速公路仿真环境highway-env搭建了3车道高速公路场景,并以深度Q网络(Deep Q Network, DQN)算法为基础,分别训练和测试了无安全约束的算法、拥有基于规则的安全约束的算法和拥有基于价值的安全约束的算法。结果表明,考虑加速、减速、保持车速和车道、向左换道、向右换道共5种动作时,基于价值的安全约束算法的成功率比无安全约束的算法高3倍以上,平均回报提升28%;仅考虑向左换道、向右换道、保持车道这3种换道动作时,基于价值的安全约束算法的成功率比基于规则的安全约束算法高0.11,平均回报提升6%;都添加基于价值的安全约束时,考虑5种动作的算法相较于考虑3种动作的算法成功率低0.06但平均行驶速度快0.26m/s,也即前者实现了对安全和速度的平衡。由此可知,基于价值的安全约束算法比基于规则的算法更能提升强化学习算法的安全性和训练效率,而包含更多决策动作的动作空间设置可实现更高的驾驶技巧,避免算法过于保守。

Keyword深度强化学习 自动驾驶 决策 安全约束
MOST Discipline Catalogue工学 ; 工学::计算机科学与技术(可授工学、理学学位)
DOI10.16503/j.cnki.2095-9931.2023.01.004
URL查看原文
Indexed By其他
Language中文
Sub direction classification人工智能+交通
planning direction of the national heavy laboratory实体人工智能系统决策-控制
Paper associated data
Chinese guide/
Video parsing/
Citation statistics
Document Type期刊论文
Identifierhttp://ir.ia.ac.cn/handle/173211/57360
Collection多模态人工智能系统全国重点实验室_平行智能技术与系统团队
Corresponding Author朱凤华
Affiliation1.中国科学院自动化研究所多模态人工智能全国重点实验室
2.中国科学院大学人工智能学院
3.内蒙古电投能源股份有限公司北露天煤矿
First Author AffilicationInstitute of Automation, Chinese Academy of Sciences
Corresponding Author AffilicationInstitute of Automation, Chinese Academy of Sciences
Recommended Citation
GB/T 7714
王宇霄,刘敬玉,李忠飞,等. 基于强化学习与安全约束的自动驾驶决策方法[J]. 交通运输研究,2023,9(1):31-39.
APA 王宇霄,刘敬玉,李忠飞,&朱凤华.(2023).基于强化学习与安全约束的自动驾驶决策方法.交通运输研究,9(1),31-39.
MLA 王宇霄,et al."基于强化学习与安全约束的自动驾驶决策方法".交通运输研究 9.1(2023):31-39.
Files in This Item:
File Name/Size DocType Version Access License
基于强化学习与安全约束的自动驾驶决策方法(2613KB)期刊论文作者接受稿开放获取CC BY-NC-SAView
Related Services
Recommend this item
Bookmark
Usage statistics
Export to Endnote
Google Scholar
Similar articles in Google Scholar
[王宇霄]'s Articles
[刘敬玉]'s Articles
[李忠飞]'s Articles
Baidu academic
Similar articles in Baidu academic
[王宇霄]'s Articles
[刘敬玉]'s Articles
[李忠飞]'s Articles
Bing Scholar
Similar articles in Bing Scholar
[王宇霄]'s Articles
[刘敬玉]'s Articles
[李忠飞]'s Articles
Terms of Use
No data!
Social Bookmark/Share
File name: 基于强化学习与安全约束的自动驾驶决策方法.pdf
Format: Adobe PDF
All comments (0)
No comment.
 

Items in the repository are protected by copyright, with all rights reserved, unless otherwise indicated.