AR界安卓在中国,Rokid引爆空间计算狂潮

news2024/11/24 17:26:08

击关注

 文丨刘雨琦

你可能很难想象,在一个没有显示屏也没有鼠标的空间,仅凭一副AR眼镜和一台口袋主机,就能完成一篇5000字的文章。

没错,8月26日,在2023 Rokid Jungle 新品发布会现场,这样的场景正在真实发生着。会上,Rokid 发布了消费级OST(光学透视)个人空间计算平台 Rokid AR Studio,包括Rokid Max Pro(售价4999元)和Rokid Station Pro(售价3999元)两大硬件产品

Rokid创始人、CEO祝铭明在发布会上表示:“让空间计算能更自然地融入日常生活和工作,让Rokid AR Studio成为你的第一台空间计算机。”

这和以往人们对AR眼镜的认知有很大不同。在此之前,AR眼镜一直被“锁死”在娱乐场景中,靠影视和游戏两大支柱产业生存,而Rokid AR Studio 真正成为了个人生产力工具,IM软件、写文章、写代码,搜索信息等等工作场景,都能通过最新的硬件完成。

使用场景的扩展,让AR设备从边缘化的场景中,转向更为实际的使用价值。消费者愿意买单,整个AR产业链才会进入消费级市场正循环。

说自己是个“社恐”的老板祝铭明,是个十足的产品和技术控,他在内部曾毙掉两版产品设计初稿,差点把产品部“逼疯”。可当最后产品部偷偷拿出设计好的产品时,祝铭明立刻下令资源都倾斜到这个产品上。“我只关心一个数据,就是用户使用时长。目前,我们的真实用户使用时长已经接近一个半小时,周留存率超过20%。做到这个,用户会自然增长。”

用户数积累达到百万级别,也意味着,AR行业进入了软件系统和生态建设的第二阶段。近年来,已经有越来越多的系统厂商、应用软件厂商、内容厂商加入到AR生态建设中来。

“一群疯子,一个梦想,十年光阴。”

正如祝铭明所言,从娱乐场景到生产力工具,Rokid用了10年,这背后不只是思考的跃进,更是从硬件技术到软件技术,乃至整个产业链向前迈的一大步。苹果和Rokid开启了AR竞赛第二阶段,行业比拼也正在加速。

01 单目SLAM,怎么重新定义交互?

在整场发布会中,最令人意外的,不是Rokid Max Pro 76g的机身,而是只有一颗摄像头,竟然能完成SLAM(空间定位技术)、微手势交互、第一视角分享、视觉定位VPS能力等多种融合型的交互方式。

AR/VR设备在经历了物理交互(手柄)、语音交互、手势交互后,正在往眼球追踪和现在的多感知融合交互方案发展。

但多感知融合的交互,对于硬件的要求更高,除了要满足基本的需求,更要全方位、多角度的捕捉到用户动作、手势,才能精准地完成交互。

而用单颗摄像头完成SLAM交互有多难呢?

视觉SLAM方法包含两个模块,一个是Tracking,已知3D点位置,基础定位;一个是Mapping,更新3D点的位置。而无论是哪个环节哪种方法,单目意味着只能选择一种摄像头,以及固定位置和固定角度,对于识别的范围、追踪速度和精度都存在极大的挑战。

“业界都认为单目SLAM不可置信、很难做到”,祝铭明戏称,“这可能也是对Rokid的一种肯定吧”。

目前,市场上为数不多的具备空间交互的AR眼镜至少会搭载三颗摄像头,来承担算法功能。视觉路线的不同,也形成了以苹果为代表的VST(视频透视)和以Rokid为代表的OST(光学透视)两大阵营。

仍以苹果Vision Pro为例,其用12颗摄像头“堆”出了快速定位捕捉、高精度的全景感知以及精密追踪,并通过VST的方式,将外部的世界通过摄像头显示在终端屏幕上,通过摄像头的实时拍摄来看到外部世界。

但为了交互而堆硬件的方法,成本提高的同时价格也在翻番上涨,同时导致了机体重以及难量产两大落地难题。这也就是为什么,苹果Vision Pro定价3499美元,并要在2024年才能实现量产的根本原因。

而Rokid坚持的OST方案本身便存在着一定的技术壁垒,由于管路设计复杂,且显示画面视角有限,光学零部件成本造价较高,在价格不进行较大涨幅的情况下,Rokid只能通过技术突破的方式,来降低叠加成本。

而让行业认为“不可置信”的单目SLAM是如何做到的?会后,光锥智能与祝铭明进行了深度的交流,发现Rokid的“绝招”在于,用AI算法来突破硬件的壁垒。

祝铭明介绍到,单目SLAM技术虽然早就存在,但还从没有被应用在AR眼镜中,手机的前置摄像头也同样应用了此类技术,唯一不同的是:算法。

从AI到AR,这是一条看似跨越但实际上本质融通的道路,但也正是因为Rokid此前数年在AI领域的积累,通过多维度视觉算法模型,包括视觉定位与增强、数字人技术、2D/3D手势识别、OCR识别等技术,让AI在具体的场景中落地。

比如AR视觉定位与增强功能,就是在解决和突破单目的限制,通过构建厘米级的视觉地图,将虚拟信息在真实物体世界进行精准叠加融合,实现物体和场景的高精度三维重建。

Rokid副总裁、XR中心负责人王俊杰介绍道:“空间定位基于SLAM技术,然后才能在空间中进行稳定的自然交互。1~2秒的时间通过算法快速初始化,建立映射空间。”

而市场上,大多数设备还是采用双目的方案来解决,但双目融合也存在很多问题,除了成本多增加了一个摄像头之外,还需要不断用算法来实时拟合两个摄像头的数据,从而带来更多的复杂问题。

由此看来,如果单目方案能够顺利进行,Rokid就又率先踩准了一个技术趋势。此前,Rokid也是行业首创Station 主机的厂商,眼镜和主机分离的方案已经被证明是行业体验的最优解。

另外,在手势识别中,Rokid采用了微手势的交互方式,手指一捏,即可进行点击和选中;手势左右拨动,还可对正在浏览的界面或内容进行切换。简单的捏合和滑动手势等逻辑定义比较自然,上手较快。

通过我们的现场测试结果来看,目前Rokid可以实现双手的裸手空间交互,目前,Rokid手势识别的算法支持水平/空间轴转、明/暗光等复杂场景识别,同时可识别的手势类型丰富、算法精准,整体识别率约90%以上,并拥有毫秒级识别的响应能力及99%的可靠性保障。

Rokid表示,基于深度学习算法和大量实验数据,单目3D手势算法能在移动端实时重建手部姿态参数,包括手部6DoF、手部关节点6DoF,以及Hand Mesh信息,为AR的手势交互提供良好的算法基础。

目前,Rokid的手势识别在3D空间中可实现多种操作,包括点、捏、抓、握、拖、拉等等,完全可以满足AR交互应用需求。例如,戴上Rokid Max Pro,伸出手,在眼前张开手掌即可呼出菜单。

毕竟想要支持如此复杂的算法结构,背后的功臣不只摄像头,更与“大脑”也就是Rokid Station Pro的算力和性能息息相关。

02 口袋里的空间计算机

一直以来,整个VR/AR行业都存在着“算力、舒适度、价格”的不可能三角。算力更高的设备往往更重,价格也更贵,舒适度高的轻量级设备又无法满足使用需求。

从现实的情况来看,目前并没有一种“完美”的解决方案,主流厂商们试图在二者中找平衡,当下市场上存在着两类主流的解决方案:一种是以苹果为代表的显示计算一体,电池外接的方案;另一种,则是以Rokid为代表的显示计算分体设计。

苹果一体化的设计,将两块micro-OLED屏幕、多个摄像头和传感器、扬声器等元件集成在一起,在显示效果、计算等方面效率更高,但同时也会增加机体本身重量,导致只能将电池外接。

而Rokid坚持的分体式设计,将佩戴性拉到了极致,对比Vision Pro 454g重量,76g的眼镜重量,几乎和普通眼镜没有差别;同时主机算力也可以不那么受空间资源限制,同时一定程度上避免散热带来的不适问题。

总的来说,分体式的路线可以做到眼镜的轻便和主机算力的双向极致发展,同时也更加灵活,算力的迭代和眼镜的技术路线可以异步进行。

Rokid Station Pro就是在分体式设计的基础上,进行了更高的算力升级,打造集计算、成像、通信等功能为一体的All in One终端,也是真正可以被称之为“生产力工具”的超级终端。

据光锥智能了解到,Rokid Station Pro 搭载了高通骁龙XR2+、12G RAM + 128G ROM, 支持WIFI6/6E和BT5.1,Station Pro续航能力将是手机方案的2倍以上,同时具有更佳的散热和更高性能,可以达到厘米级6DoF跟踪精度和极低MTP(Motion to Photon)渲染延迟。

公开信息显示,骁龙XR2+是高通推出最新旗舰的XR平台,能够实现50%的续航能力和30%的散热性能提升,从而支持更小更轻薄的设备外形中赋能更丰富和沉浸式的体验。同时骁龙 XR2 + 平台引入全新图像处理管线,能够实现低于 10 毫秒的时延,开启全彩视频透视 MR 体验。

从光锥智能在现场的体验来看,无论是观影、游戏过程中还是调用键盘进行工作生产流程,尤其是在游戏的高频交互和打斗下,画面的流畅度和反应速度,都十分丝滑。

值得一提的是,目前市场上核心算法还是3DoF(三自由度追踪),是指该设备能够检测到向上、前、下三个方向的转动,但不能检测到头部的前后左右的空间位移。

而升级后的Station Pro采用的6DoF算法,除了能检测到头部的转动带来的视野角度变化外,还能够检测到由于身体移动带来的“上下前后左右”6种位移的变化。

这个算法的升级,更重要的在于玩家的自由度。举个例子,3DoF算法下的打僵尸,射程范围在前方的一定角度,而升级后僵尸从360度出现,一回头身后僵尸扑面的体感,是前者无法达到的。

也就是说,不只算力更高、体验更丝滑、算力空间的拓展也带来了体感上的巨大不同。

高通技术公司XR产品管理高级总监Said Bakadir表示:“第一代骁龙XR2+平台是赋能下一代XR体验的不二之选。高通技术公司为Rokid Station Pro提供业界领先的平台,支持其打造了自身独特的AR应用生态系统。”

03 做AR行业中的iOS

当然,苹果手机之所以能在手机市场上常年称王称霸,成功的原因并不只于它的硬件,更在于它的系统和生态。通过软件系统来培养用户使用习惯所筑下的壁垒,往往要比硬件本身更牢固。

这是Rokid自研AR空间操作系统——YodaOS-Master的部分原因,但却不是全部的原因。

今年三月Rokid Open Day上,Rokid正式推出了YodaOS-Master,并发布了“AR空间创作平台灵境”,让每个人都能在3D空间内创作AR内容,人人可参与,彻底打破AR创作的门槛,让生态势能爆发。

如果说单目SLAM、3D手势识别、骁龙XR+、灵境平台都是一把把利刃,那YodaOS-Master,通过一套自研的系统,才能将这些绝招释放。

简单来说,Rokid 是在走一条没有人走过的路,而Rokid的理念是“软件定义一切”,所有的软件都需要系统进行承载和提供,才能发挥出价值。

围绕感知、理解、交互、展现、协同和数字创作五个方面,YodaOS-Master从芯片优化、硬件设计、软件架构、AR算法还有创作工具等诸多方面都做了巨大升级,或是目前最为完整的一套面向AR时代的空间操作系统。

发布会现场,Rokid也展示了自研系统带来的开放性和便捷性。举几个明显的例子,基于自研系统和骁龙XR+平台,Rokid开发了多任务并行模式,打破了之前只能单任务的掣肘,实现一边聊钉钉、一边写代码、一边看文档的场景,能够同时实现并充分的发挥了空间大屏的优势,让生产效率提升到最大。

另一个极为创新的案例是,Rokid基于自研系统,重新定义了空间搜索。祝铭明介绍道,这打破了此前搜索信息的陈列方式,搜索结果的呈现不再是二维的平面的效果,而是存在在三维空间中。“与问题最相关的结果会离你最近,有点相关的结果在二级页面,离的越远越不相关,当然,你也可以划掉前面的结果,动态挑选你想要的结果”。

如此,未来感瞬间拉满,也展示出了与第一阶段AR设备的本质不同。

可以看到, AR行业开放生态已经开始进入第二阶段,苹果和Rokid不仅在硬件方向上一个向左,一个向右,在行业系统软件、生态发展上也是如此。通过硬件、算法、软件生态、开发者和用户与平台共创,AR在一个彻底开放的生态下,会更快速的迈向高速发展的第二阶段。

Rokid系统研发总工程师石文峰表示,“YodaOS-Master操作系统通过服务化的方式,将 Rokid语音识别、手势识别、SLAM等在内的多项核心技术集成为系统服务,并提供多种client SDK供开发者高效开发,比如SDK for Unity,可以让Unity开发者(开发者申请通道:开放平台网址(ar.rokid.com))能够快速使用Rokid核心技术进行开发”。

从硬件到软件,从系统到生态,Rokid的发展路径,颇有点当年乔布斯时代苹果的意味。

“AR 行业就在黎明前”,祝铭明说道。

#rokid##AR#

欢迎关注光锥智能,获取更多科技前沿知识!

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.coloradmin.cn/o/937632.html

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈,一经查实,立即删除!

相关文章

前端如何走通后端接口

0 写在前面 现在基本都是前后端分离的项目了,那么前端小伙伴如何获取后端小伙伴接口呢? 1 条件 同一WiFi下,让后端小伙伴分享出自己的ip地址: 步骤1:winr调出运行界面 步骤2:cmd调出命令行窗口 步骤3:…

6. 激活层

6.1 非线性激活 ① inplace为原地替换,若为True,则变量的值被替换。若为False,则会创建一个新变量,将函数处理后的值赋值给新变量,原始变量的值没有修改。 import torch from torch import nn from torch.nn import …

第一次实验:Protocol Layers

第一次实验:Protocol Layers 捕获跟踪*Pick a URL and fetch it with* wget *or* curl*.* 检查跟踪数据包结构协议开销复用密钥*Which Ethernet header field is the demultiplexing key that tells it the next higher layer is IP?**Which IP header field is th…

关于亚马逊云科技云技能孵化营学习心得

1、活动介绍 本活动主要是面向想要全面了解亚马逊云科技 (Amazon Web Services) 云的个人,而不受特定技术角色的限制。内容包括亚马逊云科技云概念、亚马逊云科技服务、安全性、架构、定价和支持等等,此外还可以参加亚马逊的认证考试。 2、学习过程 该…

httpd协议与apache

1.http 相关概念 HTTP是处于应用层的协议,使用TCP传输层协议进行可靠的传送。因此,需要特别提醒的是,万维网是基于因特网的一种广泛因特网应用系统,且万维网采用的是HTTP(80/TCP)和 HTTPS(443/…

计算机毕设 基于深度学习的人脸专注度检测计算系统 - opencv python cnn

文章目录 1 前言2 相关技术2.1CNN简介2.2 人脸识别算法2.3专注检测原理2.4 OpenCV 3 功能介绍3.1人脸录入功能3.2 人脸识别3.3 人脸专注度检测3.4 识别记录 4 最后 1 前言 🔥 这两年开始毕业设计和毕业答辩的要求和难度不断提升,传统的毕设题目缺少创新…

Autoware.universe部署02:高精Lanelet2地图的绘制

文章目录 引言Lanelet基础元素Lanelet2项目各个模块 一、安装Lanelet2项目1.1 安装依赖1.2 编译1.3 在ROS中使用lanelet2地图完成routing 二、Autoware Vector Map Builder绘制高精地图2.1 创建地图2.2 绘制车道线2.3 绘制路沿2.4 绘制停止线和交通灯2.5 绘制人行道2.6 绘制停车…

IntelliJ 中如何配置 Tomcat 调试

Tomcat 在 IntelliJ 中的配置要求首先你要下载 Tomcat。 设置服务器 在 IntelliJ 下面先选择 Run,然后选择配置运行配置。 在弹出的界面中,有一个编辑配置的选项。 然后在弹出的页面中选择添加。 选择 Tomcat 在弹出的添加页面中选择添加 Tomcat&…

数据分析基础-数据可视化学习笔记03-可视化的符号与表示-图形符号学

概念 图型符号学(Cartographic Symbolization)是地图学领域中的一个重要概念,涉及到如何使用不同的符号、颜色、图案和标记来在地图上表示地理信息和数据。图型符号学旨在传达地理信息,使得地图能够清晰、有效地传达各种空间数据…

四、前端监控之接入Sentry到项目

前言 一、前端监控之异常监控 二、前端监控之方案调研 三、前端监控之Sentry的介绍 以上是这个专题之前的几篇文章,欢迎观摩 Sentry的接入 1、新建项目 在sentry后台登陆后,进入监控项目的界面,如: 点击右上角的 add new p…

用Go编写ChatGPT插件

ChatGPT插件平台有望成为影响深远的"下一件大事",因此对于开发者来说,有必要对ChatGPT插件的开发有一定的了解。原文: Writing a ChatGPT Plugin With Go[1] 我工作的附带福利之一是偶尔可以接触试用一些很酷的新技术,最近的一项技…

详细介绍如何基于ESP32实现低功耗的电子纸天气显示器--附完整源码

实现界面展示 这是一款天气显示器,由支持 wifi 的 ESP32 微控制器和 7.5 英寸电子纸(又名电子墨水)显示器供电。当前和预测的天气数据是从 OpenWeatherMap API 获取的。传感器为显示屏提供准确的室内温度和湿度。 该项目在睡眠时消耗约 14μA,在约 10 秒的清醒期…

Tomcat 部署时 war 和 war exploded区别

在 Tomcat 调试部署的时候,我们通常会看到有下面 2 个选项。 是选择war还是war exploded 这里首先看一下他们两个的区别: war 模式:将WEB工程以包的形式上传到服务器 ;war exploded 模式:将WEB工程以当前文件夹的位置…

Qt 查找文件夹下指定类型的文件及删除特定文件

一 查找文件 bool MyXML::findFolderFileNames() {//指定文件夹名QDir dir("xml");if(!dir.exists()){qDebug()<<"folder does not exist!";return false;}//指定文件后缀名&#xff0c;可指定多种类型QStringList filter("*.xml");//指定…

js中迭代器和可迭代对象

一、迭代器 在JavaScript中&#xff0c;迭代器也是一个具体的对象&#xff0c;这个对象需要符合迭代器协议&#xff08;iterator protocol&#xff09; 迭代器协议定义了产生一系列值&#xff08;无论是有限还是无限个&#xff09;的标准方式&#xff1b; 在JavaScript中这个…

Linux安装FRP(内网穿透)

项目简介需求背景 1.FileBrowser访问地址&#xff1a;http://X.X.X.X:8181&#xff0c;该地址只能在局域网内部访问而无法通过互联网访问&#xff0c;想要通过互联网 访问到该地址需要通过公网IP来进行端口转发&#xff0c;通常家里的路由器IP都不是公网IP&#xff0c;通常公司…

2023年6月GESP C++ 一级试卷解析

2023年6月GESP C 一级试卷解析 一、单选题&#xff08;每题2分&#xff0c;共30分&#xff09; 1.以下不属于计算机输出设备的有&#xff08; &#xff09;。 A.麦克风 B.音箱 C.打印机 D.显示器 【答案】A【考纲知识点】计算机基础&#xff08;一级&#xff09; 【解析…

科大讯飞永久免费GPT入口来了!!!

讯飞GPT永久免费使用入口注册链接&#xff1a;讯飞星火认知大模型-AI大语言模型-星火大模型-科大讯飞。 登录讯飞账号后&#xff0c;点击进入体验。 进入体验页面后&#xff0c;选择景点推荐。 笔者让其写一篇关于讯飞GPT介绍的文案。 讯飞GPT是一款由讯飞公司推出的人工智能语…

14. 完整模型验证套路

14.1 GPU训练30轮次 import torchvision import torch from torch import nn from torch.utils.data import DataLoader from torch.utils.tensorboard import SummaryWriter import time# 定义训练的设备 #device torch.device("cpu") device torch.device("…

第七周第六天学习总结 | MySQL入门及练习学习第一天

实操练习&#xff1a; 1.查看数据库 2.查询当前数据库 3.创建一个名为 lianxi 的数据库 4.删除一个名为 shanchu 的数据库&#xff08;如果存在就删除&#xff0c;不存在不删除&#xff09; 5.切换至 lianxi 数据库下&#xff0c;并验证 6.查询 lainxi 数据库下的所有数据…