0

0

北航团队提出具身智能新架构,实现大型无人机的操控

WBOY

WBOY

发布时间:2023-12-15 10:49:10

|

1633人浏览过

|

来源于51CTO.COM

转载

进入多模态时代,大模型也会操纵无人机了!

当视觉模块捕捉到启动条件时,大模型这个“大脑”会生成动作指令,然后无人机可以迅速准确地执行

北航团队提出具身智能新架构,实现大型无人机的操控

周尧明教授领导的北京航空航天大学智能无人机团队的研究人员,提出了一种基于多模态大模型的具身智能体架构

目前,这种结构已经用于控制无人机

北航团队提出具身智能新架构,实现大型无人机的操控

这种新的智能体表现如何,又有哪些技术细节呢?

“智能体即大脑”

研究团队利用大模型对多模态数据进行理解,将真实物理世界的照片、声音、传感器数据等多源信息融合,以使智能体能够感知周围环境,并作出相应的行为操作

同时,团队提出了一套“Agent as Cerebrum,Controller as Cerebellum”(智能体即大脑,控制器即小脑)的控制架构:

智能体作为大脑这一决策生成器,专注于生成高层级的行为。 重写后的句子:作为大脑的决策生成器,智能体专注于生成高层次的行为

作为小脑的运动控制器,控制器的主要职责是将高层行为(如预期目标点)转化为低层系统命令(如旋翼转速)

具体来说,研究团队认为这一成果主要有三项贡献。

应用于实际的新型系统架构

研究团队提出了一种新的系统架构,可以应用于实际的机器人。该架构将基于多模态大模型的智能体具象化为大脑

而机器人运动规划器与控制器则被具象化为小脑,机器人的感知系统类比为人的眼、耳等信息收集器,机器人的执行机构类比为人的手等执行器。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

北航团队提出具身智能新架构,实现大型无人机的操控

△图1 硬件系统架构

这些节点通过ROS相连,通过ROS中消息的订阅与发布或服务的请求与响应实现通信,区别于传统的端到端的机器人大模型控制。

这一架构使得Agent可以专注于高层级命令的产生,对于高层级任务具备更强的智能性,对于实际的执行具备更好的鲁棒性和可靠性。

北航团队提出具身智能新架构,实现大型无人机的操控

需要重写的内容是:△图2 软件系统架构 重写后的内容:软件系统架构如图2所示

新型智能体

在这一架构下,作者构建了作为大脑的一种智能体AeroAgent。

该智能体主要包括三个部分:

  • 一个自动计划生成模块,具有多模态感知监测能力,同时擅长进行待机模式下的应急突发事件处理。
  • 一个多模态数据记忆模块,可以用于多模态记忆检索和反思,为智能体赋予少样本学习能力。
  • 一个具身智能动作模块,可以建立具身智能体与ROS上其他模块进行稳定控制的桥梁,这一模块提供了对于ROS上其他节点以操作为桥梁进行访问的能力。

同时,为了完成一个动作,可能需要多次交互操作以从传感器获取执行该动作所必需的参数,以确保智能体能够根据综合态势感知和所具备的执行器来稳定输出具体的行动

北航团队提出具身智能新架构,实现大型无人机的操控

需要重写的内容是:△图3 AeroAgent模块架构 重写后的内容:△图3 AeroAgent 模块架构设计

连接大模型和ROS的桥梁

为了给具身智能体和ROS机器人系统建立桥梁,让Agent产生的操作能够正确地、稳定地发送给ROS并被其他节点成功执行,同时让其他节点所提供的信息让LMM能够读取与理解,团队设计了了ROSchain——

一个将LLMs/LMMs与ROS连接起来的桥梁

ROSchain通过一套模块和应用程序接口(APIs)简化了大型模型与机器人传感装置、执行单元和控制机制的集成,为智能体接入ROS系统提供了一个稳定的中间件。

LongShot
LongShot

LongShot 是一款 AI 写作助手,可帮助您生成针对搜索引擎优化的内容博客。

下载

为什么选择无人机

研究团队给出了三个原因,解释了为什么他们选择了无人机来进行该系统架构的测试和模拟

首先,如今LMMs中所蕴含的web-scale的世界知识,多为第三人称视角,人型机器人等领域的具身智能是类似于以人类为主体出发的第一人称视角。

无人机上的相机,尤其是下视相机,更像是第三人称视角(上帝视角)的有机体智能

另一方面,现阶段的LMMs无论是模型部署还是API服务,通常受限于计算资源导致响应有一定的延迟。

无人机的任务规划由于其可以悬停,具备应对延迟的能力,这对于自动驾驶等领域是一个应用的障碍

这两点都导致目前技术发展水平下无人机适合作为先驱进行相关理论与应用的验证。

第二,目前工业无人机领域,如山火救援、农林植保、无人放牧、电力巡检等,多由飞手与专家配合实际操作,智能化任务执行具有工业需求。

第三,从未来发展看,多智能体协同合作在物流、建筑、工厂等领域具备较为明显的需求。

而在这种领域中,无人机作为“上帝视角”的具身智能体,适合作为中央节点的领导者进行任务的分配,其他机器人可看作无人机的执行器的一环,所以这一研究也具有未来的发展前景。

团队使用airgen的仿真器进行了模拟实验,并同时选择了DRL等方式作为对照组。以下是实验结果:

北航团队提出具身智能新架构,实现大型无人机的操控

在野外火灾搜救的情景中,AeroAgent在标准化分数下获得了100分的优异成绩,平均每步为2.04分

而单纯调用LLM或基于DRL的智能体都只获得了29.4分,平均每步0.2,不足AeroAgent的十分之一。

北航团队提出具身智能新架构,实现大型无人机的操控

需要重写的内容是:△4-1号图,山火救援现场

在着陆任务中,AeroAgent也以97.4的总分和48.7的每步平均分超过了其他模型。

北航团队提出具身智能新架构,实现大型无人机的操控

需要被改写的内容是:△图4-2 海上机坪着陆场景

而在风机巡检的测试中,AeroAgent直接成为了唯一能完成该任务的模型。

北航团队提出具身智能新架构,实现大型无人机的操控

△图4-3 风力电机巡检场景

在导航任务上,AeroAgent 4.44每个步骤的分数分别为DRL和纯LLM的40倍和近10倍

北航团队提出具身智能新架构,实现大型无人机的操控

需要重新写的内容是:△图4-4 Airgen仿真实验

团队还在真实场景中进行了无人机系统的测试,以一个简单的受困群众引导实验为例进行了案例研究。

北航团队提出具身智能新架构,实现大型无人机的操控

需要进行改写的内容是:△ 图5 引导受困群众案例实验

团队目前正以这一工作为基础,在某高原牦牛牧场进行无人放牧智能无人机的实验,探索其实际应用的可能性,并将以“予智能以具身”为目标,进行其他机器人/多机器人合作的智能体落地应用探索。

论文地址:https://arxiv.org/abs/2311.15033

相关专题

更多
什么是中间件
什么是中间件

中间件是一种软件组件,充当不兼容组件之间的桥梁,提供额外服务,例如集成异构系统、提供常用服务、提高应用程序性能,以及简化应用程序开发。想了解更多中间件的相关内容,可以阅读本专题下面的文章。

175

2024.05.11

Golang 中间件开发与微服务架构
Golang 中间件开发与微服务架构

本专题系统讲解 Golang 在微服务架构中的中间件开发,包括日志处理、限流与熔断、认证与授权、服务监控、API 网关设计等常见中间件功能的实现。通过实战项目,帮助开发者理解如何使用 Go 编写高效、可扩展的中间件组件,并在微服务环境中进行灵活部署与管理。

212

2025.12.18

硬盘接口类型介绍
硬盘接口类型介绍

硬盘接口类型有IDE、SATA、SCSI、Fibre Channel、USB、eSATA、mSATA、PCIe等等。详细介绍:1、IDE接口是一种并行接口,主要用于连接硬盘和光驱等设备,它主要有两种类型:ATA和ATAPI,IDE接口已经逐渐被SATA接口;2、SATA接口是一种串行接口,相较于IDE接口,它具有更高的传输速度、更低的功耗和更小的体积;3、SCSI接口等等。

991

2023.10.19

PHP接口编写教程
PHP接口编写教程

本专题整合了PHP接口编写教程,阅读专题下面的文章了解更多详细内容。

51

2025.10.17

php8.4实现接口限流的教程
php8.4实现接口限流的教程

PHP8.4本身不内置限流功能,需借助Redis(令牌桶)或Swoole(漏桶)实现;文件锁因I/O瓶颈、无跨机共享、秒级精度等缺陷不适用高并发场景。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

232

2025.12.29

http与https有哪些区别
http与https有哪些区别

http与https的区别:1、协议安全性;2、连接方式;3、证书管理;4、连接状态;5、端口号;6、资源消耗;7、兼容性。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

1725

2024.08.16

传感器故障解决方法
传感器故障解决方法

传感器故障排除指南:识别故障症状(如误读或错误代码)。检查电源和连接(确保连接牢固,无损坏)。校准传感器(遵循制造商说明)。诊断内部故障(目视检查、信号测试、环境影响评估)。更换传感器(选择相同规格,遵循安装说明)。验证修复(检查信号准确性,监测异常行为)。

456

2024.06.04

系统架构有哪些种类
系统架构有哪些种类

系统架构种类有单库单应用架构、内容分发架构、读写分离架构、微服务架构、多级缓存架构、分库分表架构等。想了解更多系统架构的相关内容,可以阅读本专题下面的文章。

188

2023.11.14

php源码安装教程大全
php源码安装教程大全

本专题整合了php源码安装教程,阅读专题下面的文章了解更多详细内容。

74

2025.12.31

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Django 教程
Django 教程

共28课时 | 2.6万人学习

Go 教程
Go 教程

共32课时 | 3.2万人学习

TypeScript 教程
TypeScript 教程

共19课时 | 1.9万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号