“那颗星星的纸片有点软,时间久了容易折坏,还是装框子保险。”
“你看着弄就行。”
她没再说话,手在他背上按了十来分钟,力道慢慢变轻了,最后收了手,在他旁边躺下来。
他翻了个身,侧躺着,她也侧过来对着他,两个人中间隔了一拳的距离。
她伸手把他额前搭下来的一缕头发拨开,什么都没说。
第三天早上的会上,陈峰站在主控台前,屏幕上显示着车辆在不同场景下的行为决策树和路径规划算法的流程图。
“决策规划模块的核心是让车辆在复杂的交通环境中做出正确的判断——
什么时候变道、什么时候超车、什么时候让行。”
他指着屏幕上的流程图,手指从最上面的感知输入一直划到底部的规划输出,
“规则逻辑处理常规工况,强化学习模型覆盖边界场景,两者协同工作。
今天的任务是规划算法的框架跑通。”
何晋看着屏幕上的流程图,手指在键盘上敲了几下调出了规则逻辑的细节。
“规则树现在覆盖了一百六十多个场景分支,剩下的那些边界情况交给强化学习模型去泛化。
但是奖励函数的设计怎么定?如果奖励函数偏重通行效率,模型可能倾向于激进的变道策略;
如果偏重舒适性,又可能在需要快速响应的时候动作太慢。”
陈峰调出奖励函数的设计文档,翻到中间那一页。
“奖励函数分了三个维度——安全性权重最高,占零点六;通行效率零点三;舒适性零点一。
安全性维度以碰撞时间的倒数为惩罚项,通行效率以平均速度为奖励项,舒适性以加加速度的绝对值作为惩罚项。
三个维度加权求和,权重比暂时不动,后面仿真跑起来之后再根据结果调。”
他说完在流程图旁边补充了几行注释,把奖励函数的计算公式写清楚,然后交给何晋去搭建模型框架。