Arm微架构分析系列3——Arm的X计划

news2024/11/15 20:36:59

1. 引言

前文介绍了Arm公司近几年在移动处理器市场推出的Cortex-A系列处理器。Cortex-A系列处理器每年迭代,性能和能效不断提升,是一款非常成功的产品。但是,Arm并不满足于Cortex-A系列每年的架构小幅度升级,又推出了X计划,也就是Cortex-X产品线。Cortex-X系列处理器采用了激进的架构设计,大幅度提升移动处理器的性能(俗称超级大核),本文将重点介绍Arm的Cortex-X系列产品。

2. X计划起源

Cortex-X计划起源可以追溯到2016年,当时Arm推出了一个新的客户Licence叫做“Build on Cortex”,允许用户请Arm基于Cortex核心做一些定制优化,如可以增加或者减少Cache数量等,客户如高通公司一直是该计划的使用方,用于开发和迭代每年的Kyro系列处理器。到了2020年,Arm公司正式宣布推出Cortex-X这一全新的高性能处理器设计计划。Cortex-X计划的目标是为高端移动平台、云服务场景、边缘计算和高性能计算设备提供更快、更强大的处理器核心。

Cortex-X系列定制处理器计划,相比2016年的定制方案要更加深入,Cortex-X系列处理器的目标是给用户提供足够强大性能的核心,在此计划下芯片厂商可以早期参与Arm的Cortex处理器架构设计,并基于 Cortex-X 核心进行定制优化,以适应自己的产品需求。但是从产品的表现看,由于Arm每年都在迭代Cortex-X系列处理器(2023,第四年,预计会更新Cortex-X4),迭代速度和周期都非常快,芯片厂商并没有针对X系列处理器特殊定制微架构,而是通过搭配不同尺寸的缓存,设计出面向不同价位段的产品。

Cortex-X系列的出现,和市场竞争日益激烈,芯片厂商有较强需求相关。市场上,苹果公司坚持自己研发A系列处理器, 苹果的A系列处理器是专为iPhone和iPad设备设计的自研处理器,基于Arm指令集,苹果自己设计并优化了微架构。从2010年推出的A4处理器开始推出第一款量产产品,当前苹果A系列处理器已发展到A16(2022年)。A系列处理器一直采用较为激进的微架构设计,通过强大的计算能力领先行业。最新A16还是保持Armv8指令集,没有升级到Armv9指令集,最后我们会简单对比下Cortex-X系列和苹果的A系列处理器的差异。

99eb80e6abeb61104399ac086e15ff93.png

2017年至2022年的Arm系列处理器

3. Cortex-X1:第一代Cortex-X处理器

2020年5月,Arm发布了基于Armv8.2架构的最后一款处理器Cortex-A78,同时还发布了一颗性能更强大的Cortex-X1处理器。Cortex-X1 处理器比之前的 Cortex-A77 提升了 30% 的性能,由于采用大缓存的设计架构,还提升了 23% 的芯片能效。简单总结下,X1提供了更强的性能,整体更优秀的能效,但是极限功耗高于Cortex-A78。

daa0547a909c217850f78b7c13a12a14.png

Cortex-X1性能强大,能效有明显改善,但是由于增大了缓存和处理单元,使得芯片的整体面积增大不少,厂商往往出于成本考虑,一般在处理器中只会放置一颗Cortex-X系列处理器来提升单线程的峰值性能。从Cortex-X1出现后,市场上的旗舰处理器架构发生了变化,逐步从4+4架构,演变成有一个超级大核心的1+3+4架构。

下图是一个典型示意图,在5nm工艺下如果仅升级到A78,性能提升20%,面积可以减少15%;在5nm工艺下升级到1个X1+3个A78,L3增大,峰值性能可以提升30%,但是面积要增加15%,一来一回差异30%芯片面积,这样看来,旗舰芯片要涨价也情有可原了。

cd6f10cff9bd34817366db43ff8ebc5b.png

ed7f54cc051e6d89f8117dbc75cc88b6.png

4df77d964aee4c709567a716d4ba2782.png

我们看一下Cortex-X1的微架构细节,相比A78,Cortex-X1具体有以下提升:

1、BPU分枝预测单元的L0 BTB从64提升到96,增加50%;

2、前端Decode从4路提升到5路;

3、MOP通路从6路提升到8路;

4、MOP Cache从1.5K提升到3K,增大一倍;

5、ROB缓冲从160(推测)提升到224(参考,AMD的Zen2处理器的ROB是224);

6、L1\L2\L3都较大,分别是64KB起、256KB起、最多8MB;

7、执行单元整数和存储部分变化不大,浮点单元相比A78提供了2倍的NEON单元,可以同时提供4个128bit运算能力;

8、存储单元通路虽然没有变化,但是其Load\Store的缓冲数量增加了33%。

下面用一张表格列举了一些微架构的核心变化:

c302c710eb1dcdbdb0eb71e88903170a.png

第一代的Cortex-X1还是使用的Armv8.2的指令集,并没有升级到Armv9,似乎Arm觉得要在2021年同时发布Armv9和全新的Cortex-A、Cortex-X系列压力有点大,所以提前将Cortex-X1的发布放在了2020年。

可惜,Cortex-X1的命运可谓生不逢时,2020年采用Cortex-X1的典型旗舰处理器有三星的Exynos 2100和高通的Snapdragon 888,这两款处理器都搭载了三星的5nm工艺(5LPE),这一次三星工艺翻车了,架构的提升得不到工艺的补偿,导致这两款处理器的性能和功耗的表现都不是很好。目前(2023年)市面上还活跃着不少采用A78处理器架构的芯片,如MTK的天玑8100、8200等处理器,但是已经鲜少看到搭载Cortex-X1处理器的芯片了。

4. Cortex-X2:第二代Cortex-X处理器

2021年5月,Arm的Cortex-X2系列处理器如期而至。这一次,Cortex-X2正式升级到了Armv9新架构,搭载了SVE2指令集,并且只支持运行64bit软件。还记得A710的产品代号叫做Matterhorn么?这一代Arm为了更好的记忆产品代号,将Cortex-X2处理器的产品代号命名为Matterhorn-ELP,后续Cortex-X系列应该也是基于同期Cortex-A系列的产品代号,增加ELP后缀,ELP的全称是Enhanced Lead Partner的意思。

第一代的Cortex-X1由于搭配工艺的原因导致整体不佳的表现并没有掩埋Cortex-X系列微架构的成功,Arm计划将Cortex-X系列发扬光大,后续我们看到的也是每年一更新的快速迭代节奏。如此快速的更新节奏,芯片厂商也很难深度定制,后续各大厂商发布的几款采用Cortex-X系列处理器的产品,还是采用了Arm的公版架构,基于产品的价位段,在Cache容量上做一些差异化的配置。

c49935c4cb3b9ae6a6004252615c0f66.png

从上图中可见,Arm对于两个系列的策略有所不同,Cortex-A系列主打均衡能效并小幅度改善性能 ,Cortex-X2相比Cortex-X1在性能上有更明显的提升,进一步拉开了A系列和X系列的性能差距,由此可见Cortex-X系列的目标是推进Arm核心架构的算力提升和突破。

a9d5be2536ed1fdd0adc0c53afc6c0c6.png

bff3125868c20a9edbe2dfa68db2181e.png

从互联网上可以找到Cortex-X2的微架构框图,我们可以此对比Cortex-X2和Cortex-X1的微架构差异,并分析影响性能提升的因素。Cortex-X2相比Cortex-X1,在微架构上有以下变化:

1、将分支预测和Fetch解耦,提升并行度;

2、指令流水线从11级减少到10级,dispatch从2个时钟周期减少到1个时钟周期;

3、ROB缓冲从224提升到288,提升了30%;

4、支持SVE2 SIMD指令集;

5、ML能力支持Bfloat16;

6、取消了Aarch32支持;

7、Load\Store结构体缓冲提升33%;

8、d-TLB从40提升到48,提升了20%;

004c0d678b045071b8812a9d5b1224cd.png

6d0a61352328ee4595623ef856857105.png

再来看看具体性能数据,Arm宣称Cortex-X2相比Cortex-X1在整数性能上提升了16%,在ML能力上提升了2倍。回顾一下A710,Arm宣称的数据是相比A78提升了10%的整数性能。从能效曲线上看,Cortex-X2的最大性能和功耗都有增加,能效在低频率区间和Cortex-X1差异不大,在中高频率区间相比Cortex-X1有改善。由于极限功耗持续增加,对于散热能力和发热策略改善提出了更大的诉求和压力。

2021年,第一代搭载了Cortex-X2的处理器高通8Gen1,由于采用了三星4nm LPX工艺,性能功耗的表现不是很理想,后续高通将工艺切换到台积电4nm工艺,在2022年推出了同样设计的8+Gen1处理器,宣称CPU功耗降低了30%,这才发挥出了Cortex-X2的实力,目前有多部热门手机搭载,当前也是Cortex-X系列产品中卖的最好一代。

5. Cortex-X3:第三代Cortex-X处理器

2022年6月,市场上还在关注升级新工艺的Cortex-X2系列处理器产品时,Arm发布了当年的新品Cortex-X3,Cortex-X3的代号是Makalu-ELP,和同期Coretex-A715的代号Makalu保持一致。2021年的Cortex-X2肩负着升级Armv9指令集的任务,在微架构上的修改上相比第一代并不是很多。新一代的Cortex-X3在微架构上的升级和变化要更多一些,后续我们会详细分析。性能上,Arm宣称Cortex-X3在性能相比上一代IPC提升11%,综合性能有22%的提升(包含工艺的提升)。

fe2ca51f676a285fd0cea4f7a21f7a00.png

ecad59be37ad2b8d3032a8a20ebc2bec.png

c004824fe1224fce4713bd03bca6654f.png

从Cortex-X2开始,X系列处理器就不再支持32bit应用,这一代Arm继续针对64bit进行微架构的优化,通过剔除和优化一些陈旧的32bit兼容设计,进一步提升64bit应用程序的执行效率。

下面我们具体看一下Cortex-X3微架构相比上一代的变化:

1、MOP Cache尺寸变化。随着半导体工艺的持续演进,接下来的3nm新工艺将继续缩小半导体器件的尺寸,但是,在半导体中SRAM的尺寸并没有随器件尺寸缩小而同步缩小。如何减少SRAM的占用,是对先进工艺设计提出的一个考验。在Cortex-X3的前端设计中,Arm将L0的MOP Cacha的SRAM从上一代的3K减少到1.5K,推测也是为了减少未来在先进工艺中SRAM的占比。同时,Arm提出通过优化Cache的填充算法,来做到尽量不影响性能。记得MOP Cache在A77引入时就有讨论过,1.5K的容量就可以达到85%的命中率,增加容量带来的边际效益也增加,所以增大Cache带来的效果提升会越来越小,所以这次Arm将Cortex-X3的MOP Cache降低到1.5K(同期的A715则是取消了MOP Cache)。

2、Fetch-decode通路从5路提升到6路,Fetch能力提升了20%;

3、在ROB重排序缓冲区上,上一代Cortex-X2是228个,Cortex-X3继续提升11%,达到了320 entries;

50a19f5fed1d74bc22c16d3e54183916.png

4、Arm继续提升Cortex-X3的分支预测能力,L1 BTB从64提升到96,L2 BTB从16384提升到24576。分支预测单元通过解耦合设计,和Fetch形成两条核心指令通路,大幅提升同步执行效率,一旦发生了分支错误,可以快速从BTB缓冲中拿到需要的指令,进行快速切换。通过这些优化,Arm宣称平均分支预测延迟周期数减少了12.2%,整体执行流程中Stall占比降低了3%;

de915cff7d599712483533fbf5b4b13e.png

5、在分支预测模块上持续优化,Cortex-x3中为indirect branches新增了一个独立预测单元,并提升了conditional branches的准确率,Arm宣称平均的分支预测错误率可以降低6.1%;

4f1b8f0e03927c0c400f02514ef9e862.png

6、流水线的优化,Cortex-X3继续优化了流水线,从10级优化到9级,主要是优化了MOP Cache的读取周期;

c3888c3ee790683cd627f18f8042525e.png

7、执行单元上,这次Cortex-X3大幅度提升了整型ALU的数量,从4个提升到6个,是一个比较大的变化,整体从2个branch+2个ALU变化为2个branch+4个ALU,主要是提升了整型性能;

9bbfbf4664e2c2a63181349246badc67.png

8、访存单元上,因为提升了ALU的数量,相应的整型读取带宽也从24提升到了32,并且增加了两个额外的数据预取模块。

d63d5335cc48cd4b0940e8953c106e30.png

上面是Cortex-X3的微架构框图,我们把X1至X3放在同一张表中对比:

6cf6eeeedbe946cd91df506e2acdf54c.png

6、Cortex-X3和苹果处理器的对比

b04c0b3b20b0f1fc849c81dc1bbe570a.png

Cortex-X系列处理器通过三代的迭代,不断升级微架构提升性能,其单核心有明显提升,已经在拉近苹果A系列处理器和Intel台式机处理器的差距。图中对比了不同处理器的单核心的性能,可以看到Cortex-X3相比Cortex-X2有进一步的提升,距苹果的A15处理器还有一些差距。目前我还没有找到苹果A15处理器的微架构,但是有找到2020年A14处理器大核心(Firestorm)的微架构,下面通过表格做了一个对比。

cf717f77d3113858ee4047642b12f2d6.png

b731acba1572a18c8fea7d6d31fb8ca3.png

从Cortex-X系列和苹果A14的对比可以看出,苹果在设计A系列处理器时对于微架构的调整更加激进,采用了更大的L1、L2缓存,Decoder数量更多,而ROB缓冲的尺寸几乎是Cortex-X系列的一倍,这也对于指令重排序的效率和算法优化能力提出了更高的要求。

虽然Cortex-X系列每年迭代,相比苹果的A系列激进的设计,目前还存在一定的差距。但是随着Cortex-X系列处理器的每年迭代更新,我们也希望看到在微架构能力上打平甚至超过竞品的那一天。

由于苹果在A系列处理器采用大缓存大尺寸设计,在智能手机产品中一般是放置两颗大核心,采用2+4的架构。采用Cortex-X系列处理器的安卓手机,一般采用八核心的架构,例如最新的高通8Gen2处理器,采用1个Cortex-X3+2个A715+2个A710+3个A510的组合架构,提供了5个大核心的算力,在多核心算力上相比6核心有多2个核心的优势,一定程度上弥补了多核心的差距。

7、总结和对Cortex-X4处理器的期望

距2023年中Arm发布Cortex-X4处理器的时间不远了,下一代的Cortex-X4处理器的代号叫做Hunter-ELP,期望这一代的“猎人”能给我们带来更多的惊喜,新的架构改了什么地方,有多少性能提升,我也会第一时间关注和分享。

Arm公司通过三年时间迭代Cortex-X系列处理器,每年的性能上都有两位数的提升,切实让消费者使用上了更快更强的处理器和产品,这半年来,采用Cortex-X2和Cortex-X3系列架构的高通8+Gen1、8Gen2、MTK的天玑9200等处理器的市场口碑都很不错。

此外,高通的8Gen2处理器还第一次打破了传统4颗大核心的架构,提供了1+4+3的5颗大核心配置组合。期望未来的产品不但可以看到Arm的最新架构,而且可以看到更多有意思的CPU核心架构组合,如果可以在一个处理器中放置多颗Cortex-X核心,相信基于Cortex-X系列的Arm处理器也可以挑战苹果 A系列处理器综合性能。

参考链接

1、https://www.anandtech.com/show/15813/arm-cortex-a78-cortex-x1-cpu-ip-diverging

2、https://fuse.wikichip.org/news/3543/arm-cortex-x1-the-first-from-the-cortex-x-custom-program/

3、https://en.wikipedia.org/wiki/ARM_Cortex-X1

4、https://en.wikipedia.org/wiki/ARM_Cortex-X2

5、https://fuse.wikichip.org/news/6855/arm-unveils-next-gen-flagship-core-cortex-x3/

6、https://www.techinsights.com/blog/cortex-x3-powers

7、https://www.hwcooling.net/en/cortex-x3-the-new-fastest-arm-core-architecture-analysis/

8、https://twitter.com/Cardyak

点击链接可查看往期系列文章:
从A76到A78——在变化中学习ARM微架构

Arm微架构学习系列2——开启Armv9时代

524604bd86a69f60b9fa28f10109c514.gif

长按关注内核工匠微信

Linux内核黑科技| 技术文章 | 精选教程

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.coloradmin.cn/o/547375.html

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈,一经查实,立即删除!

相关文章

esp32CAM环境安装教程---串口驱动安装

前言 (1)本人安装好arduino 的ESP32环境之后, 发现一直下载不进去程序。一直说Cannot configure port, something went wrong. Original message: PermissionError。 (2)查阅了很多资料,用了各种办法&#…

怎么消除文法的左递归性

除文法的左递归性可以采用以下方法: 直接左递归转换为间接左递归消除间接左递归 举例说明: 直接左递归转换为间接左递归 原文法:A → Aα | β 转换后的文法:A → βA A → αA | ε 例如:S → Sabc | ε 转换后…

4. QT中的事件函数 --- 鼠标事件、键盘事件、定时器事件、绘图事件

1. 说明 在QT的控件或者窗口当中,如果对于当前鼠标或者键盘的功能需要自己定义,可以重写父类当中对应虚函数,主要包括以下几个: //键盘按键按下 virtual void keyPressEvent(QKeyEvent *event); //键盘按键抬起 virtual void ke…

11.1网络编程

多线程 一、基础知识概念相关API二、任务创建一个简单的本地客户端迭代服务器select系统调用并发服务器数据报三、总结四、问题一、基础知识 概念 网络编程中客户端和服务器指的是进程,而不是常提到的机器或者主机。注意三个概念:请求、响应、事务。 网络编程中客户端-服务器…

面向对象的三大特性之继承(C++)

文章目录 继承的概念和定义概念定义定义格式继承关系和访问限定符继承基类成员访问方式的变化 基类和派生类对象赋值转换继承中的作用域派生类的默认成员函数继承与友元继承与静态成员菱形继承与虚拟继承菱形继承虚拟继承 继承的总结与反思继承和组合 继承的概念和定义 概念 继…

微信小程序 nodejs+vue+uniapp付费自习室图书馆教室座位系统-

系统分为用户和管理员角色 管理员的主要功能有: 1.管理员输入账户登陆后台 2.个人中心:管理员修改密码和账户信息 3.用户管理:对注册的用户信息进行添加,删除,修改,查询 4.自习室管理:对系统的自…

由浅入深Netty协议设计与解析

目录 1 为什么需要协议?2 redis 协议举例3 http 协议举例4 自定义协议要素4.1 编解码器4.2 什么时候可以加 Sharable 1 为什么需要协议? TCP/IP 中消息传输基于流的方式,没有边界。 协议的目的就是划定消息的边界,制定通信双方要…

每日学术速递5.18

CV - 计算机视觉 | ML - 机器学习 | RL - 强化学习 | NLP 自然语言处理 Subjects: cs.CV 1.Make-A-Protagonist: Generic Video Editing with An Ensemble of Experts 标题:Make-A-Protagonist:与专家合奏的通用视频编辑 作者:Yuyang Z…

云端一体助力体验升级和业务创新

随着音视频和AI技术的发展,在满足用户基础体验和需求情况下,更极致的用户体验和更丰富的互动玩法,成为各个平台打造核心竞争力的关键。LiveVideoStackCon 2022 北京站邀请到火山引擎视频云华南区业务负责人——张培垒,基于节跳动音…

虚幻引擎4利用粒子系统实现物体轨迹描绘

虚幻引擎4利用粒子系统实现物体轨迹描绘 目录 虚幻引擎4利用粒子系统实现物体轨迹描绘前言粒子系统利用粒子系统实现物体轨迹描绘创建粒子系统将粒子系统的产生位置绑定到运动物体上 小结 前言 由于在物体运动时,想要观察其总的运动轨迹,以便对其控制做…

Java实现天气预报功能

如果要实现类似百度天气、手机App这样的天气预报功能该如何实现?首先想到的是百度... 背景: 最近公司做了一个项目,天气预报的功能也做上去了,不仅有实时天气、未来7天预报的功能、还有气象预警的功能。 天气包括基本天气、白天夜…

【K8s】什么是helm?helm的常用指令

文章目录 一、Helm介绍1、背景2、介绍3、核心概念4、chart的基本结构5、helm官网 二、部署Helm1、安装helm客户端2、安装Tiller 三、常用指令1、仓库相关 helm repo2、chart相关3、release相关 四、入门案例1、构建第一个chart2、将chart包发布到Repository3、在 Kubernetes 中…

Nacos之服务注册中心

1.Nacos之服务提供者注册 官方文档 1.1.前期工作 1.1.1.新建Module - api-commons POM <?xml version"1.0" encoding"UTF-8"?> <project xmlns"http://maven.apache.org/POM/4.0.0"xmlns:xsi"http://www.w3.org/2001/XMLSc…

区块链商业模式

1. 引言 web2 vs web3&#xff1a; 基于区块链的商业模式有&#xff1a; 1&#xff09;Token Economy-Utility Token商业模式2&#xff09;Blockchain As A Service&#xff08;Baas&#xff09;商业模式3&#xff09;Blockchain-Based Software Products商业模式4&#xf…

【C++修炼之路】30.可变参数模板包装器

每一个不曾起舞的日子都是对生命的辜负 C11之可变参数模板&&包装器 前言一.可变参数模板的首次登场二.参数包展开2.1 递归函数方式展开参数包2.2 逗号表达式展开参数包 三.容器的emplace方法四.包装器4.1 什么是function4.2 function包装器的作用4.3 function的实际用途…

使用Redis实现短信验证码登录功能

一、概述 目前微信小程序或网站的登录方式大部分采取了微信扫码或短信验证码等方式&#xff0c;为什么短信验证码登录方式会受到互联网公司的青睐&#xff0c;因为其确实有许多好处&#xff1a; 方便快捷&#xff1a;用户无需记忆复杂的用户名和密码&#xff0c;只需通过短信…

Python共享文件 - Python快速搭建HTTP web服务实现文件共享并公网远程访问

文章目录 1. 前言2. 视频教程3. 本地文件服务器搭建3.1 python的安装和设置3.2 cpolar的安装和注册 4. 本地文件服务器的发布4.1 Cpolar云端设置4.2 Cpolar本地设置 5. 公网访问测试6. 结语 转载自内网穿透工具的文章&#xff1a;Python一行代码实现文件共享【内网穿透公网访问…

全域兴趣电商:国货品牌的新策略、新玩法

【潮汐商业评论/原创】 消费的方向标已经变了。 在消费市场的滚滚浪潮里&#xff0c;国人的“衣食住行”在全面的“国货化”&#xff0c;一个个有颜值有实力的国货品牌如雨后春笋般出现在寻常百姓家&#xff0c;如今在这片肥沃的土壤上正结出适合国人使用的果实。 01 国货二…

Openai+Coursera: ChatGPT Prompt Engineering(二)

这是我写的ChatGPT Prompt Engineerin的第二篇博客&#xff0c;如何还没看过第一篇的请先看我写的第一篇博客&#xff1a; ChatGPT Prompt Engineerin(一) Summarizing(总结/摘要&#xff09; 今天我们的重点关注按特定主题来总结文本。 设置参数 import openai openai.api_…

【备战秋招】每日一题:3月18日美团春招第二题:题面+题目思路 + C++/python/js/Go/java 带注释

2023大厂笔试模拟练习网站&#xff08;含题解&#xff09; www.codefun2000.com 最近我们一直在将收集到的各种大厂笔试的解题思路还原成题目并制作数据&#xff0c;挂载到我们的OJ上&#xff0c;供大家学习交流&#xff0c;体会笔试难度。现已录入200道互联网大厂模拟练习题&…