HiP框架:多AI模型联手,助力机器人驾驭复杂规划大局

news2024/12/29 10:20:09

原创 | 文 BFT机器人 

图片

你的日常待办清单或许只是些稀松平常的小事:清洗堆积如山的碗盘、采购琳琅满目的食品杂货等。在执行这些任务时,你无需逐一写下“捧起那只满是油污的盘子”或“用湿润的海绵仔细擦洗这个盘子”这样的琐碎步骤,因为在你的脑海中,这些步骤早已如同呼吸般自然而流畅。然而,对于机器人而言,要完成这些看似简单的动作,却需要一份详尽无遗、错综复杂的行动计划。

在麻省理工学院的Improbable AI实验室里,隶属于CSAIL(计算机科学与人工智能实验室)的一个精英团队,正致力于为这些机器赋予更为智能的多模态框架。他们的最新研究成果——Hierarchical Planning(HiP)组合基础模型,正是这一努力的结晶。HiP模型巧妙地融合了三种不同基础模型的专业知识,从而制定出既详细又切实可行的行动计划。与OpenAI引以为傲的GPT-4相似,ChatGPT和Bing Chat等先进应用也都是基于这一强大的基础模型构建而成的。这些基础模型经过精心训练,已广泛应用于图像生成、文本翻译、机器人技术等多个领域。

图片

与RT2等多模态模型相比,HiP展现出了独特的优势。传统的多模态模型通常依赖于配对的视觉、语言和动作数据进行训练,而HiP则采用了三个独立的基础模型,每个模型都专注于处理特定类型的数据模态。这种分工明确的架构使得每个基础模型都能够更好地捕捉决策过程中的不同环节,并在需要时协同工作以做出明智的决策。更为重要的是,HiP彻底消除了对配对数据的需求,此外,HiP还让推理过程变得更加透明和可解释,为人工智能领域的发展注入了新的活力。

对于人类而言,那些日常琐事——比如整理书架上的书籍或将碗盘放入洗碗机——可能只是随手可做的简单动作。然而,对于机器人来说,这些任务却如同“长期目标”一般,需要它们先理解并规划出许多细小的步骤,才能最终完成。因此,机器人需要海量的数据来辅助它们理解、规划和执行这些目标。

过去,计算机视觉领域的研究人员曾试图构建一个单一的基础模型来解决这个问题,但这种做法需要将语言、视觉和动作数据一一配对,不仅成本高昂,而且效果并不理想。然而,麻省理工学院的研究团队提出的HiP模型,却为这个问题提供了一种全新的多模态解决方案。HiP模型将语言、物理和环境智能以经济高效的方式整合到机器人中,形成了一种三重组合。这种组合不仅让机器人能够更好地理解和执行任务,还大大降低了数据配对的成本。

图片

“我们不必再局限于单一的基础模型,”并未参与该研究的NVIDIA AI研究员Jim Fan评论道,“这项创新性的工作将复杂任务的规划问题分解为三个相互协作的模型:语言推理器、视觉世界模型和动作规划器。这样的分解使得原本棘手的决策问题变得更加简单和透明。”

研究团队坚信,他们的人工智能系统将成为家务劳动的有力助手,帮助机器人完成诸如整理书籍、清洗碗盘等日常任务。不仅如此,HiP模型在多步骤的建筑和制造任务中也大有可为,比如按照特定顺序堆叠和放置不同材料。这一研究成果无疑为机器人技术的进一步发展奠定了坚实基础。

对HiP模型的评估

CSAIL团队在三项复杂的操作任务上对HiP模型的准确性进行了严格测试,结果显示其表现优于其他可比较的先进框架。这套系统展现出了出色的智能规划能力,能够灵活适应新信息并进行精准推理。

在第一项测试中,研究人员设置了一个颇具挑战性的任务:要求机器人将不同颜色的积木堆叠起来,并将其他积木放置在附近。但任务的关键难点在于,并非所有所需颜色的积木都现成的,这意味着机器人需要发挥创意,将白色积木放入彩色碗中上色,以获取所需的颜色。面对这样的变化,HiP模型展现出了令人印象深刻的适应能力,它不仅能够准确地识别出哪些积木需要上色,还能通过精心调整计划,确保每个积木都能按照要求被精准地堆叠和放置。

图片

第二项测试则更加考验HiP模型的物品识别和计划调整能力。研究人员要求机器人在一个棕色箱子中摆放糖果和锤子等物品,同时忽略其他无关物品。在这项任务中,有些需要移动的物品是脏的,这就要求机器人在摆放前先进行清洁处理。HiP模型再次展现出了其卓越的智能性,它不仅能够准确地识别出哪些物品需要清洁,还能灵活地调整计划,先将这些物品放入清洁箱进行处理,然后再放入棕色箱子中。

在第三项演示中,研究人员为机器人设置了一系列厨房相关的子目标,如打开微波炉、把水壶放到一边并打开灯等。这些任务中有些步骤已经提前完成,因此机器人需要根据实际情况进行调整。HiP模型再次发挥出了其强大的推理能力,它能够准确地识别出哪些步骤已经完成,哪些还需要执行,并通过智能地跳过已完成的步骤来高效地完成任务。

三叉层级体系

HiP的三层计划过程呈现出一个精巧的层次结构,这种结构赋予了它在不同数据集上预训练各个组件的独特能力,甚至包括那些与机器人技术毫不相关的信息。在这个层次结构的底层,一个强大的大型语言模型(LLM)开始发挥其作用,它通过捕捉所有必要的符号信息并制定抽象的任务计划,为整个过程奠定了坚实的基础。

图片

Anurag Ajay,这位来自麻省理工学院电气工程和计算机科学系(EECS)的博士生,同时也是CSAIL的重要成员,深入阐述了HiP的设计理念:“我们的目标是充分利用现有的预训练模型,使它们能够无缝地相互协作。”他强调说,“我们并没有期望一个模型能够包揽所有任务,而是将多个利用互联网数据不同模态的模型结合在一起。当它们协同工作时,它们能够为机器人决策提供有力支持,并有望在家庭、工厂、建筑工地等多种场景中发挥实用价值。”

然而,这些人工智能模型要想在现实世界中发挥作用,还需要一双“慧眼”来帮助它们理解操作环境并准确执行每个子目标。为此,研究团队引入了一个大型视频扩散模型,以增强LLM的初始规划能力。这个视频模型从互联网上的海量视频中汲取有关世界的几何和物理信息,然后生成一个精确的观察轨迹计划,进一步细化LLM的纲要,以整合新的物理知识。

这个过程被称为迭代细化,它允许HiP在不断反思和完善其想法。每个阶段都会接收反馈以生成更加实用的纲要,这种反馈流程类似于撰写文章时的修订过程:作者将草稿发送给编辑进行审查,根据反馈进行修订,然后再提交给出版社进行最终的审查和完善。

在HiP的层次结构中,顶部是一种本体动作模型,它根据机器人周围的环境推断出应该执行的动作序列。在这一阶段,从视频模型获得的观察计划被映射到机器人可见的空间中,为机器人提供决策支持,帮助它确定如何在长期目标中逐步完成每个任务。以沏茶为例,如果机器人使用HiP来执行这个任务,它将能够精确映射出壶、水槽和其他关键视觉元素的位置,并有条不紊地完成每个子目标。

尽管HiP已经展示出了令人瞩目的能力,但多模态人工智能工作仍然受到高质量视频基础模型缺乏的限制。一旦这些模型变得可用,它们将与HiP的小规模视频模型进行无缝对接,从而进一步提高视觉序列预测和机器人动作生成的能力。更高质量的视频模型还将降低当前模型对数据的需求,使其更加高效和实用。

值得一提的是,CSAIL团队在开发HiP时采用了高效的数据利用策略,整体上只使用了少量数据。此外,HiP的训练成本相对较低,这展示了使用现成基础模型来完成长期任务的巨大潜力。

总结

对于HiP的未来发展方向,麻省理工学院电气工程和计算机科学系(EECS)助理教授、Improbable AI实验室主任Pulkit Agrawal充满期待地表示:“Anurag所展示的成果是一个概念验证,它证明了我们可以将在不同任务和数据模态上训练的模型组合起来,用于机器人规划。未来,HiP有望通过引入更多预训练模型进行扩展,这些模型可以处理触觉、声音等多种感官信息,以制定更加全面和精细的计划。”该团队还在积极探索将HiP应用于解决机器人领域的真实长期任务的可能性,以期为机器人技术的未来发展开辟新的道路。

若您对该文章内容有任何疑问,请与我们联系,我们将及时回应。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.coloradmin.cn/o/1406223.html

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈,一经查实,立即删除!

相关文章

linux环境开发工具---yum与vim

1.Linux软件包管理器yum 1.1什么是软件包 在学习linux过程中,我们常常会遇到某些指令用不了的时候,原因除了权限问题外,还有可能是你当前的linux环境并没有安装相应的软件包。而在Linux下载安装软件的办法有两个,一个是先下载所需…

Unity之Timeline教程

前言 Unity Timeline是Unity的一种时间轴编辑器工具,用于制作和管理游戏中的动画、剧情以及事件触发。它提供了直观的界面,使得开发者可以通过拖放操作轻松创建和编辑时间轴。 Timeline的使用 创建新的Timeline 在Unity中,选择菜单栏的 Wi…

CACTER邮件安全网关独家安全解决方案——保障企业邮件系统安全

随着科技的不断发展,网络攻击技术也在不断演变,尤其是在电子邮件领域,各种高级变种威胁层出不穷,比如定制化的钓鱼邮件和带有高级恶意软件的邮件等。这些威胁邮件往往能够绕过传统的安全防护措施,包括反垃圾邮件、反钓…

【论文阅读 CIDR17】Self-Driving Database Management Systems

Self-Driving Database Management Systems MySummary ABSTRACT 之前的advisory tools来帮助DBA处理系统调优和物理设计的各个方面,都仍然需要人类对数据库的任何更改做出最终决定,并且是在问题发生后修复问题的反动措施reactionary measures 。 An …

MySQL 的delete、truncate、drop 有什么区别

目录 一、从执行速度上来说 二、从使用场景和原理上讲 1、DELETE 2、truncate 3、drop 希望能够帮助到大家!!! 一、从执行速度上来说 drop > truncate >delete 二、从使用场景和原理上讲 1、DELETE DELETE from TABLE_NAME wh…

玩客云Armbian 23.8.1 Bullseye安装PrometheusGrafana

Welcome to Armbian 23.8.1 Bullseye with bleeding edge Linux 6.4.13-edge-meson prometheus 参考Monitoring – How to install Prometheus/Grafana on arm – Raspberry PI/Rock64 | Blogs (mytinydc.com) cd /usr/local/srcwget https://github.com/prometheus/prometh…

小程序技术实践:快速开发适配鸿蒙的App

今年,在中国,被各大媒体和开发者称为“鸿蒙元年”。 在2023年底就有业内人士透露,华为明年将推出不兼容安卓的鸿蒙版本,未来IOS、鸿蒙、安卓将成为三个各自独立的系统。 果不其然,执行力超强的华为,与202…

k8s---包管理器helm

内容预知 目录 内容预知 helm相关知识 Helm的简介与了解 helm的三个重要概念 helm的安装和使用 将软件包拖入master01上 使用 helm 安装 Chart 对chart的基本使用 查看chart信息 安装chart 对chart的基本管理 helm自定义模板 在镜像仓库中拉取chart,查…

使用Python合并PPT文件

在日常工作和学习中,我们经常需要处理和管理大量的PPT文件。如果需要将多个PPT文件合并成一个文件,手动操作可能会非常繁琐和耗时。今天,我们将介绍如何使用Python编程语言和wxPython模块创建一个简单的GUI应用程序,来自动合并指定…

web 应用常见的安全问题

一xss攻击 人们经常将跨站脚本攻击(Cross Site Scripting)缩写为CSS,但这会与层叠样式表(Cascading Style Sheets,CSS)的缩写混淆。因此,有人将跨站脚本攻击缩写为XSS。 跨站脚本攻击&#xff…

如何修改flutter的minSdkVersion版本?

在使用第三方插件的时候,插件对最低的 minSdkVersion版本是有要求的,你比如flutter 插件 webview_flutter 就会报一下错: minSdkVersion 16 cannot be smaller than version 19 declared in library 解决方法①: 这个时候我们需…

OpenCV第 1 课 计算机视觉和 OpenCV 介绍

文章目录 第 1 课 计算机视觉和 OpenCV 介绍1.机器是如何“看”的2.机器视觉技术的常见应用3.图像识别介绍4. 图像识别技术的常见应用5.OpenCV 介绍6.图像在计算机中的存储形式 第 1 课 计算机视觉和 OpenCV 介绍 1.机器是如何“看”的 我们人类可以通过眼睛看到五颜六色的世界…

Java 应用部署包优化经验分享

背景 最近接手了一个 2018 年的老项目,因为太久远了,功能上的代码不敢乱动,虽然是老项目,但最近一年也在持续加功能,功能不稳定,于是我就进入了救火式改 Bug 的状态。 功能不能妄动,但是这个项…

说说 typescript 的数据类型有哪些?

文章目录 一、是什么二、有哪些# boolean# number# string# array# tuple# enum# any# null 和 和 undefined# void# never# object 三、总结参考文献 一、是什么 typescript 和 javascript几乎一样,拥有相同的数据类型,另外在javascript基础上提供了更…

在字节5年被优化,太难了。。。

🍅 视频学习:文末有免费的配套视频可观看 🍅 点击文末小卡片,免费获取软件测试全套资料,资料在手,涨薪更快 先简单说下,涵哥是某不知名 985 的本硕,17 年毕业加入字节,以…

[docker] Docker 基本管理

一、Docker 相关知识 1.1 Docker概述 Docker是一个开源的应用容器引擎,基于go语言开发并遵循了apache2.0协议开源。 Docker是在Linux容器里运行应用的开源工具,是一种轻量级的“虚拟机”。 Docker 的容器技术可以在一台主机上轻松为任何应用创建一个轻…

在Spring Boot中使用ZXing开源库生成带有Logo的二维码

在上一篇文章的基础上,我们将进一步扩展功能,实现在生成的二维码中嵌入Logo图片。这样的二维码更具个性化和识别度。让我们逐步完成这个功能。 第一步:引入Logo图片 首先,准备一张用作Logo的图片,并确保它的大小适中…

硬件基础:数字电路概述与基础门电路

什么是数字逻辑电路 数字电路是一种利用离散信号进行信息处理的电子电路系统。 它的核心特点是使用数字信号来执行算术运算和逻辑运算。数字电路的工作信号是离散的,通常只取两个值:高电平和低电平,分别代表数值“1”和“0”。 这种电路的基础…

解决element-ui中的el-select选择器无法显示选中内容的问题

问题描述: 排查方法: 检查数据控制台是否报错,无报错 检查change是否触发,会触发 最后开始百度,查看文档 官方文档有这么一段话,就是属性一定要挂载到data上,不然无法检测。 最后解决&#…

视频监控怎么管理更有效率?用这个技术就够了!

视频监控系统在现代社会中扮演着重要的角色,随着技术的不断发展,视频监控系统不仅提高了安全性,还为企业提供了更多的数据和智能分析功能。 客户案例 工业制造 常州某制造企业希望提高生产线的效率和安全性。通过部署泛地缘科技推出的视频监…