LLM应用于MPC

news2024/11/20 13:41:09

现有的基于学习的自动驾驶系统(AD)在理解高级信息和提供可解释性方面存在挑战。为了解决这些问题,这项工作采用LLM作为复杂AD场景的决策组件。作者设计了认知途径(cognitive pathway)来实现LLM的综合推理,并开发了将LLM决策转化为可操作的驾驶命令的算法。通过这种方法,LLM决策通过引导参数矩阵自适应与底层控制器无缝集成。大量的实验表明,由于LLM的常识推理能力,提出的方法不仅在单车辆任务中始终优于基线方法,而且还有助于处理复杂的驾驶行为,甚至多车辆协调。

来自:LANGUAGEMPC: LARGE LANGUAGE MODELS AS DECISION MAKERS FOR AUTONOMOUS DRIVING
工程地址:https://sites.google.com/view/llm-ad

目录

  • 引言
  • 方法
    • 背景
    • 思维链
    • 关注定位
    • 状态感知和动作指导
  • 实验

引言

想象一下,我们正在开车,驶近一个没有信号的十字路口,正准备左转,迎面有一辆车驶来。人类司机本能地知道,根据交通规则,他们应该减速和让行。然而,现有的先进的基于学习的自动驾驶系统通常需要复杂的规则或奖励功能设计来有效地处理这些场景。

现有基于学习的AD系统面临的另一个挑战是长尾问题。有限的数据集和采样效率都会给现有的基于学习的自动驾驶系统在罕见的真实驾驶场景中做出决策带来挑战。Chauffeurnet 证明了这样的限制,即使是3000万个状态动作样本也不足以学习将鸟瞰图像(状态states)映射到控制(动作action)的最佳策略。

此外,缺乏可解释性是现有基于学习的AD系统面临的一个紧迫问题。成熟的AD系统必须具有可解释性,以获得社会的认可,使其能够进行有针对性的优化和迭代改进。然而,现有的基于学习的AD系统几乎都是黑盒。

考虑到上述挑战,一个基本问题出现了:我们能否为自动驾驶系统配备像人类一样思考和驾驶的能力?作者提出的解决方案包括使用LLM作为AD系统的“大脑”。最近的ChatGPT等模型将LLM定位为通用智能的早期版本,该特性使LLM成为上述AD系统所面临问题的强大解决方案。

在该研究中,作者利用LLM来分析和推理各种场景,使其能够提供高级决策,并通过调整参数矩阵,将高级决策转换为数学表示来指导底层控制器,MPC。图1展示了该系统对罕见和复杂场景的强大推理能力,展示了其在理解高级信息、常识推理和可解释性方面的优势。通过定量实验,发现该系统明显优于现有的基于学习和基于优化的单车辆决策任务方法。

fig1

  • 图1:面对在环形交叉路口罕见的故障车辆停在路中间的情况,LLM通过常识推理和对高层信息的理解,做出符合交通规则的决策。

方法

作者开发了一个以LLM为高层决策核心的AD系统,如图2a所示。LLM根据提供的prompt启动对话,不断从环境中收集信息,进行推理并做出判断。如图2a中间所示,从左到右,LLM依次进行:1识别需要注意的车辆,2评估情况,3提供行动指导。然后,系统将这三个高级文本决策转换为数学表示,即观察矩阵、权重矩阵和action偏差。这些元素作为底层控制器MPC的指令,指示其要采取的具体驾驶动作。

以十字路口左转为例,在图2b中,展示了如何将上述三个高级文本决策转换为MPC所需的数学表示。LLM选择“vehicle_26”,我们使用MPC的观测算子创建相应的向量,并将观测矩阵中的其他元素归零,仅关注“vehicle_26”。根据LLM发出信号的交叉口等待情况,调整权值矩阵,使减速指令优先于轨迹跟随,从而促使MPC按照LLM的指令及时减速。通过预定义的规则将LLM的action指导直接转化为action偏差。在上述三个方面的数学形式的指导下,MPC完成了停止的action。
fig2

  • 图2a:以LLM为核心的决策管道。
  • 图2b:将LLM文本高级决策转换为指导MPC给出具体驾驶动作的数学表示,以十字路口左转为例。

背景

MPC基于获得的当前测量信息,在每一时刻在线求解一个有限时间开环优化问题,并将得到的控制序列中代价最低的第一个元素应用于被控车辆。在这项工作中,作者在马尔可夫决策过程(MDP)的背景下定义MPC的代价函数,MDP通常用于形式化车辆控制问题: ( S , A , C , P , p 0 ) (S,A,C,P,p_{0}) (S,A,C,P,p0),其中 S S S是状态空间, A A A是action空间, C : S × A → R C:S\times A→\mathbb{R} C:S×AR是代价函数, P : S × A → S P:S\times A→S P:S×AS是动态方程, p 0 p_{0} p0是初始状态分布。给定一个代价函数 C C C,MPC找到action序列 a 1 : H = a 1 , . . . , a H a_{1:H}=a_{1},...,a_{H} a1:H=a1,...,aH以最小化预期的累积代价 J ( a 1 : H ) = ∑ t = 1 H C ( s t , a t ) J(a_{1:H})=\sum_{t=1}^{H}C(s_{t},a_{t}) J(a1:H)=t=1HC(st,at)。代价函数形式如下: C ( s , a ) = ∑ i = 0 M w i ⋅ n i ( r i ( s , a , ψ i ) ) C(s,a)=\sum_{i=0}^{M}w_{i}\cdot n_{i}(r_{i}(s,a,\psi_{i})) C(s,a)=i=0Mwini(ri(s,a,ψi))其中 w ∈ R + w\in\mathbb{R}+ wR+为非负权重, n ( ⋅ ) : R → R + n(\cdot):\mathbb{R}→\mathbb{R}+ n():RR+为二次可微范数,其最小值为0, r ∈ R r\in\mathbb{R} rR是当 r = 0 r=0 r=0时达到最优性能的残差项, ψ i \psi_{i} ψi为残差项的参数。例如,如果我们希望车辆采用所需的加速度,我们可以设计一个残差项 r a c c ( a c c , ψ ) = a c c − ψ r_{acc}(acc,\psi)=acc-\psi racc(acc,ψ)=accψ,其中 ψ \psi ψ表示所需的加速度,并用 l 2 l_{2} l2范数构造最终的奖励: C a c c = w ∣ r a c c ∣ 2 C_{acc}=w\vert r_{acc}\vert_{2} Cacc=wracc2。由于驾驶场景的复杂性,设计一组适用于所有驾驶场景的权重和残差项几乎是不可能的。在这项工作中,作者使用一组通用的简单残差项来调整控制行为,其中包括action偏差,并基于MPC应该执行动作偏差的确定性设计了多组权重矩阵。使用LLM来给出动作偏差,并选择权重矩阵来驱动不复杂场景。

思维链

我们采用LangChain作为管理LLM的框架,并为LLM建立一个结构和流程。首先,我们在对话开始时立即介绍这些指定的工具。随后,在对话过程中,LLM积极调用这些工具,为其正在进行的决策过程获取相关信息和指导。LLM遵循这些指导方针来确定其下一步行动,直到成功解决整个问题。

作为一个示例,考虑图3中所示的三个核心工具。这些工具中的每一个都有双重目的,即为LLM提供相关信息和完成推理所需的指导。
fig3

  • 图3:定义的三个用于提示的核心工具。每个工具的提示都包含信息和指导原则,以帮助LLM完成推理和判断并开始下一步。

此外,这些工具使我们能够改进提供场景信息的方式。关键在于只提供LLM思维过程中每个决策步骤所需的相关信息,如图3所示。这种方法代表了一种解决方案的转变,解决了LLM在处理复杂而广泛的数据时面临的重大挑战。它确保了信息的组织简洁性和必要性,从而大大提高了LLM推理和判断的能力。

关注定位

开车时有效分散注意力的能力反映了一种类似人类的思维过程。在这种情况下,我们要求LLM系统地评估与周围车辆有关的信息。目标是辨别这些车辆的意图,并最终确定它们是否与AD车辆的运动产生冲突。特别的,在时刻 t t t,对于周围车辆的每个元素 V t = { V 1 t , V 2 t , . . . } V^{t}=\left\{V_{1}^{t},V_{2}^{t},...\right\} Vt={V1t,V2t,...},我们有: I i t = L L M ( S i t , S i t − 1 , . . . , S i t − 10 , e n v t ) M i t = L L M ( S i t , I i t , e n v t ) I_{i}^{t}=LLM(S_{i}^{t},S_{i}^{t-1},...,S_{i}^{t-10},env^{t})\\M_{i}^{t}=LLM(S_{i}^{t},I_{i}^{t},env^{t}) Iit=LLM(Sit,Sit1,...,Sit10,envt)Mit=LLM(Sit,Iit,envt)其中, e n v t env^{t} envt为场景道路信息, S i t S_{i}^{t} Sit为环境中 V i t V_{i}^{t} Vit的状态, I i t I_{i}^{t} Iit V i t V_{i}^{t} Vit的意图, M i t M_{i}^{t} Mit为0或1,表示 V i t V_{i}^{t} Vit被LLM认为是否需要关注,随后,根据LLM识别的车辆为MPC创建了一个观察矩阵: o b s i t = M P C o b s ( S i t , I i t , e n v t ) ∗ M i t obs_{i}^{t}=MPC_{obs}(S_{i}^{t},I_{i}^{t},env^{t})*M_{i}^{t} obsit=MPCobs(Sit,Iit,envt)Mit其中, o b s i t obs_{i}^{t} obsit为MPC观测矩阵的第 i i i行, M P C o b s MPC_{obs} MPCobs是MPC计算观测矩阵的算子。这确保了MPC只关注这些选定的车辆。

状态感知和动作指导

在驾驶过程中,状态感知是一个关键的高层决策过程,包括对当前场景的深刻理解,以及常识推理。在这个框架内,作者让LLM负责从几个选项中选择一个特定的情况,利用在关注定位section中概述的关注分配过程中收集的信息,以及LLM判断的结果。定义特征 F i t = { S i t , I i t , M i t } F_{i}^{t}=\left\{S_{i}^{t},I_{i}^{t},M_{i}^{t}\right\} Fit={Sit,Iit,Mit}描述 V i t V_{i}^{t} Vit相关的信息,此时有: X t = L L M ( F 1 t , . . . , F k t , e n v t ) X^{t}=LLM(F_{1}^{t},...,F_{k}^{t},env^{t}) Xt=LLM(F1t,...,Fkt,envt)其中, k k k为LLM选择的周围车辆数量, X t X^{t} Xt为选择的情况。对 X t X^{t} Xt的判断作为MPC权重矩阵的调整机制。对于每个预定义的情况,都建立了相应的权重矩阵 W t W^t Wt。随后,LLM根据其选择的情况提供关于加速和转向的指导: A t = L L M ( F 1 t , . . . , F k t , e n v t , X t ) A^{t}=LLM(F_{1}^{t},...,F_{k}^{t},env^{t},X^{t}) At=LLM(F1t,...,Fkt,envt,Xt)其中, A t A^{t} At为动作指导。 A t A^{t} At会影响MPC动作偏差的调整,随着车辆的动作与提供的指导相互接近,代价会降低: r b i a s ( b i a s , ψ ) = b i a s − ψ C b i a s = w b i a s ∣ r b i a s ∣ 2 r_{bias}(bias,\psi)=bias-\psi\\C_{bias}=w_{bias}\vert r_{bias}\vert_{2} rbias(bias,ψ)=biasψCbias=wbiasrbias2其中, b i a s bias bias表示加速或者转向,值得注意的是,预定义场景集虽然数量有限,但足够抽象和广泛,可以涵盖广泛的驾驶场景,因为它们不代表特定的场景,但具备MPC应该执行动作偏差的确定性。

实验

实验使用IdSim生成场景地图和交通流。在单车辆决策的背景下,对三种不同的方法进行了评估:基于强化学习的规划,模型预测控制,以及该研究提出的系统LLM+MPC。其中,RL在大范围复杂交通场景中进行了训练和验证,MPC在实车实验中进行了微调和验证。每一种方法都在不同的场景下进行了测试,包括有信号的十字路口、无信号的十字路口、车道、紧急规避和环形交叉路口。作者为每个场景类型选择了25个复杂且具有挑战性的案例,以全面评估系统性能。

单车辆决策的定量结果如表1所示。LLM+MPC在四种场景类型中实现了总体代价的降低。在非紧急情况下,观察到最小的故障发生概率。在紧急情况下,LLM+MPC显著降低了事故率,表明了它在避障方面的有效性。
tab1

  • 表1:单车辆决策的评估。SI指有信号交叉口,USI指无信号交叉口,EOA指紧急避障。对于所有的参数,越低越好。

具体来说,在十字路口,主要关注的是左转弯的情况,在这种情况下,AD车辆固有地拥有较低的路权地位,需要根据既定的交通规则选择减速和让步。在十字路口和环形交叉路口的左转弯情况下,虽然LLM+MPC可能会导致运行时间的轻微增加,但它在提高交通流量效率和减少安全处罚方面产生了实质性的好处。在车道上(Lane),LLM+MPC在所有指标上都表现出色,表明了超车和变道的效率。最后,在紧急情况下,LLM+MPC通过降低事故率和提高整体性能来证明其有效性。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.coloradmin.cn/o/1337729.html

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈,一经查实,立即删除!

相关文章

python作业题百度网盘,python作业答案怎么查

大家好,小编来为大家解答以下问题,python作业题百度网盘,python作业答案怎么查,今天让我们一起来看看吧! 1 以下代码的输出结果为: alist [1, 2, 3, 4] print(alist.reverse()) print(alist) A.[4, 3, 2, …

Python爬虫中的代理IP设置与实战策略

在Python爬虫中,使用代理IP设置是一种常见的策略,主要用于以下几个目的: 1. 避免被目标网站封禁:频繁的请求可能会引起目标网站的注意,导致你的IP被封锁。通过使用代理IP,你可以模拟来自不同地点和设备的请…

【WPF】使用Behavior以及ValidationRule实现表单校验

文章目录 使用ValidationRule实现检测用户输入EmptyValidationRule 非空校验TextBox设置非空校验TextBox设置非空校验并显示校验提示 结语 使用ValidationRule实现检测用户输入 EmptyValidationRule是TextBox内容是否为空校验,TextBox的Binding属性设置ValidationRu…

AR智慧校园三维主电子沙盘系统研究及应用

一 、概述 易图讯科技(www.3dgis.top)自主研发的智慧校园三维主电子沙盘系统,采用B/S架构模式,采用自主可控高性能WebGIS可视化引擎,支持多用户客户端通过网络请求访问服务器地图和专题数据,提供地理信息数据、专题数据的并发访问…

爬虫工作量由小到大的思维转变---<第二十八章 Scrapy中间件说明书>

爬虫工作量由小到大的思维转变---<第二十六章 Scrapy通一通中间件的问题>-CSDN博客 前言: (书接上面链接)自定义中间件玩不明白? 好吧,写个翻译的文档点笔记,让中间件更通俗一点!!! 正文: 全局图: 爬虫中间件--->翻译笔记: from scrapy import s…

ES慢查询分析——性能提升6 倍

问题 生产环境频繁报警。查询跨度91天的数据,请求耗时已经来到了30s。报警的阈值为5s。 背景 查询关键词简单,为‘北京’ 单次仅检索两个字段 查询时间跨度为91天,覆盖数据为450亿数据 问题分析 使用profle分析,复现监控报警的…

Go在Win10上接收UDP组播数据

第一步、绑定本机某张网卡的IP和端口,本代码选择IP为0.0.0.0,端口为8000;第二步、加入组播,组播地址为“224.0.0.1”;第三步、循环接收UDP组播数据; 代码 package mainimport ("fmt""golang…

从 Linux Crontab 到 K8s CronJob,定时任务正在经历怎样的变革

作者:黄晓萌(学仁) 背景 Job 表示短周期的作业,定时 Job 表示按照预定的时间运行Job,或者按照某一频率周期性的运行 Job。比如: 许多传统企业使用 Linux 自带的 crontab 来做定时任务的方案,该方案非常简单&#xff…

“巴渝工匠杯”2022年重庆市职业院校技能大赛(高职组)云计算样题

“巴渝工匠杯”2022年重庆市职业院校技能大赛(高职组)云计算样题 需要软件包环境可私信博主 【赛程名称】云计算赛项第一场次-私有云 某企业拟使用OpenStack搭建一个企业云平台,以实现资源池化弹性管理、企业应用集中管理、统一安全认证和授…

PostGIS学习教程十五:几何图形的有效性

PostGIS学习教程十五:几何图形的有效性 在90%的情况下,“为什么我的查询给了我一个’TopologyException’错误"的问题的答案是"一个或多个输入的几何图形是无效的”,这就引出了这样一个问题:几何图形"无效"是什么意思&a…

从计算机内存结构到iOS

一、冯.诺伊曼结构 当前计算机都是冯.诺伊曼结构(Von Neumann architecture),是指存储器存放程序的指令以及数据,在程序运行时根据需要提供给CPU使用。 冯.诺伊曼瓶颈 在目前的科技水平之下,CPU与存储器之间的读写速…

【C Primer Plus第六版 学习笔记】第十四章 结构和其他数据形式

有基础,进阶用,个人查漏补缺 建立结构声明:描述该对象由什么组成,即结构布局 格式: 关键字 标记(可选){结构 }; 举例: struct book{char title[2];char author[4];float …

Xcode 编译速度慢是什么原因?如何提高编译速度?

作为一个开发者,我们都希望能够高效地开发应用程序,而编译速度是影响开发效率的重要因素之一。然而,有时候我们会发现在使用 Xcode 进行开发时,译速度非常慢,这给我们带来了不少困扰。那么,为什么 Xcode 的…

分页合理化是什么?

一、前言 大家好!我是sum墨,一个一线的底层码农,平时喜欢研究和思考一些技术相关的问题并整理成文,限于本人水平,如果文章和代码有表述不当之处,还请不吝赐教。 只要是干过后台系统的同学应该都做过分页查…

神经网络介绍

目录 知识点介绍 知识点介绍 前馈神经网络:(前馈网络的数据只向一个方向传播) RNN循环神经网络,下图中多个 RNN 层都是“同一个层”,这一点与之前的神经网络是不一样的。

怎么下载landsat 8影像并在ArcGIS Pro中进行波段组合

Landsat 8(前身为Landsat数据连续性任务,或 LDCM)于2013年2月11日由 Atlas-V火箭从加利福尼亚州范登堡空军基地发射升空,这里为大家介绍一下该数据的下载的方法,希望能对你有所帮助。 注册账号 如果之前已经注册过的…

5、IDEA集成Git

IDEA集成Git 1. 配置Git忽略文件2. 定位Git程序3. 初始化本地库、添加暂存区、提交到本地库4. 切换版本5. 创建分支和切换分支6. 合并分支7. 解决冲突 1. 配置Git忽略文件 问题1:为什么要忽略他们? 与项目的实际功能无关,不参与服务器上部署…

学习笔记12——Spring的注解配置

学习笔记系列开头惯例发布一些寻亲消息 链接:https://baobeihuijia.com/bbhj/contents/3/192486.html SSM框架——注解配置(Component Autowired 加载SpringConfig) 注解开发(Component注解、config扫描 加载SpringConfig&a…

https密钥认证、上传镜像实验

一、第一台主机通过https密钥对认证 1、安装docker服务 (1)安装环境依赖包 yum -y install yum-utils device-mapper-persistent-data lvm2 (2)设置阿里云镜像源 yum-config-manager --add-repo http://mirrors.aliyun.com/do…

EB tresos 配置I2c - 实现与PF8200的读写操作

文章目录 前言一、EB工具链配置1、I2c模块1)新建模块2)配置General3)配置I2cChannel 2、Port模块1)配置SDA2)配置SCL 二、代码分析1、申明一个I2c配置结构体数组,用于I2c所有读操作。2、搭建读操作函数 三、…