【文献】2020-Stanford:LUCIDGames
标题:LUCIDGames: Online unscented inverse dynamic games for adaptive trajectory prediction and planning
摘要:
1、当前的game-theoretic planner假定环境车辆动态已知;2、本文采用逆最优控制(inverse optimal control)估计环境车的代价方程;3、采用UKF在线迭代更新Bayes estimate的参数;4、planner利用Bayes估计的不确定结果进行规划;5、MPC planner实现40Hz的实时计算。
主要观点:perserving the coupling between planning and prediction is key to producing richer interactive behaviour among robots。
LUCIDGames:
1、动态游戏的nash均衡问题:找到一个均衡点,使所有agent的代价函数最小:

2、目标方程的参数化:(1)由状态x和控制序列u构成,

(2)利用UKF估计权重向量:
3、UKF的作用:(1)利用估计的权重θ生成预测轨迹,并进一步进行规划决策。UKF可以利用新的观测更新估计参数θ,从而优化预测和决策结果;
(2)关键部分为measurement model, mapping θ to system state x
4、估计和规划结合:(1)前向传播得到x(t+1),再估计出θ的均值和方差,如图:

5、预测结果对比评价:3s长度的预测轨迹;L2距离ADE;三种scenario
(1)LUCIDGames;(2)Line Prediction(kinematic);(3)No Estim; (4)Oracle(Truth)
结论:
(1)利用expert信息设计了车辆的目标函数;(2)通过object func参数估计的(10)量级的参数,计算得到了(100-1000)量级参数的车辆轨迹;(3)dynamically feasible traj; (4)tend to act optimally; (5) capture the interactive nature of agents
个人观点:
作者主要关注有限时域内(receding horizon)的规划问题,通过inverse optimal control的方法,建立了各个agent的目标函数,并且利用UKF思想实时估计object Func的权重参数,从而生成了此时域内的各个agent的预测轨迹。这个框架得益于optimal control和game-theoretic方法,一方面实现了agent之间的交互作用,一方面各个agent的轨迹符合环境约束和局部最优。

浙公网安备 33010602011771号