Vitis HLS 学习笔记--接口存储器布局模型

news2024/12/25 2:27:08

目录

1. 简介

2. 详解

2.1 数据对齐

2.2 数据结构填充

3. 总结


1. 简介

软件开发者写的程序会在 CPU 处理器上运行,而硬件开发者设计的“内核”则会在 FPGA 上运行。这两部分需要通过一个精心设计的接口来沟通,就像两个人用对讲机来交流一样。为了确保这种沟通顺畅,数据必须以一种特定的方式来存储和组织,这就是所谓的存储器模型。这个模型就像是一个书架,告诉你如何摆放你的书籍,以便你能快速找到它们。

在这个过程中,有两个重要的概念:数据对齐和数据结构填充

数据对齐就像是确保所有的书都准确地靠在书架的边缘,这样你就能更快地找到它们。

数据结构填充则是在书与书之间留出空间,以防它们挤在一起时难以取出。

Vitis HLS 编译器允许开发者调整这些规则,就像你可以调整书架的层板一样,以适应不同大小和形状的书籍。这样,软件和硬件就能更高效地一起工作,就像一个精心组织的图书馆一样。

2. 详解

2.1 数据对齐

打个比方,CPU 内存就像一个巨大的书架,而每本书代表了一块数据。程序员通常会认为这个书架是由一排排紧挨着的书组成的,每本书都可以单独拿出来看。

但实际上,现代的计算机处理器(就像是拿书的人)并不是每次只拿一本书,而是一次拿一整组书,比如一次拿2本、4本、8本,甚至更多。这样做的原因是,一次拿多本书可以更快地找到需要的信息,就像你可以一眼看到一组书的标题一样。

为了让处理器能够高效地拿书,书架上的书需要按照一定的规则摆放。比如,如果处理器一次拿4本书,那么每组书的第一本书的位置就需要是4的倍数。这就是所谓的“对齐”。如果书没有按照这个规则摆放,处理器在拿书时就会遇到麻烦,可能会拿得很慢,或者甚至拿不到想要的书。

如果程序员在编写软件时没有考虑到这些对齐的规则,就可能会导致软件运行缓慢,或者程序卡住不动,有时候甚至会导致整个操作系统崩溃。最糟糕的情况是,软件可能会在没有任何提示的情况下出错,给出错误的结果。所以,理解并正确处理内存对齐是非常重要的,它可以确保软件运行得既快速又稳定。

下表显示了 C/C++ 中对应 32 位和 64 位 x86-64 GNU/Linux 机器的基本原生数据类型的大小和对齐(以字节数为单位):

类型

32 位 x86 GNU/Linux

64 位 x86 GNU/Linux

大小

对齐

大小

对齐

float

4

4

4

4

double

8

4

8

8

long double

12

4

16

16

void*

4

4

8

8

为了在存储器要求和性能之间取得平衡,程序员可能需要更改数据的默认对齐方式。因为在主机与加速器(FPGA)之间往返发送数据时,发射的每个字节都有成本。

GCC C/C++ 编译器提供了一个语言扩展 __attribute__((aligned(X))),允许程序员为变量、结构体或类指定一个特定的对齐字节数。例如,声明 int x __attribute__ ((aligned (16))) = 0; 会使编译器在16字节边界上分配变量 x。

使用 __attribute__((aligned(X))) 不会改变变量的大小,但会通过在结构体元素之间添加填充来改变内存布局,从而可能增加结构体的总大小。aligned 属性只能用来增加对齐的字节数,不能减少。C++ 中的 offsetof 函数可以用来确定结构体中每个成员的对齐情况。

如果在使用 __attribute__((aligned)) 时没有明确指定一个对齐因子(即 X 的值),编译器会自动选择一个对齐值。这个值是目标机器上所有数据类型中最大的对齐要求。例如,如果目标机器上最大的数据类型对齐要求是8字节,那么编译器会将变量或字段对齐到8字节边界。

这样做的好处是可以提高内存访问的效率。因为大多数现代处理器在访问对齐的数据时更加高效,特别是当数据的对齐边界与处理器的内存访问粒度相匹配时。这意味着,如果处理器一次可以高效地读取8字节,那么在8字节边界上对齐的数据可以一次性被读取,而不需要多次内存访问。这就是为什么默认情况下,编译器会选择最大的对齐要求,以期望在不同的内存访问操作中获得最佳性能。

2.2 数据结构填充

在C++中,内置的数据类型(如 int, float 等)有预定义的对齐要求,这些要求确保了数据在内存中的有效访问。对于用户定义的数据类型,如结构体或类,编译器也会自动确保其中的成员变量是正确对齐的。

为了做到这一点,编译器可能会在结构体或类的成员变量之间插入填充字节(也称为“padding”)。这是因为每个成员变量可能有不同的对齐要求,而编译器需要确保每个成员都按照其类型的对齐要求放置在内存中。

此外,如果有一个用户定义类型的数组,编译器还会在数组的每个元素之间添加填充,以确保数组中的每个元素都能满足对齐要求。这样做的目的是为了提高数组元素访问的效率。在某些情况下,编译器甚至会在结构体或类的最后一个成员之后添加额外的填充,以确保当这个结构体或类被用作数组元素时,数组中的下一个元素也能正确对齐。

比如以下这个示例:

struct One
{
    short s;
    int   i;
    char  c;
}

struct Two
{
    int   i;
    char  c;
    short s;
}

在 struct One 的例子中,short 类型的 s 成员要求在2字节边界上对齐,int 类型的 i 成员要求在4字节边界上对齐,而 char 类型的 c 成员对齐要求最小,通常是1字节。因为 int 类型的对齐要求是最严格的,所以整个结构体会在4字节边界上对齐。

为了满足这些对齐要求,编译器会在 s 和 i 之间插入2个填充字节,以确保 i 在4字节边界上对齐。同样地,为了在 c 之后开始新的对齐块,编译器会在 c 之后插入3个填充字节。因此,struct One 的总大小变为12字节。

然而,在 struct Two 中,成员的顺序被重新排列,以减少填充的需要。int 类型的 i 成员首先出现,后面紧跟着 char 类型的 c 和 short 类型的 s。c 只需充填一个字节,s 则不需要额外的填充。因此,struct Two 的总大小只有8字节。

3. 总结

在现代计算机系统中,数据对齐和结构填充是确保数据存储和访问效率的关键因素。数据对齐涉及将数据按照处理器优化的边界排列,以加快访问速度。结构填充则是在数据结构中插入额外空间,以保持成员变量的正确对齐。这些概念在硬件设计中尤为重要,因为 FPGA 和其他硬件加速器对数据布局的要求更为严格。Vitis HLS 等工具允许开发者自定义对齐和填充规则,以优化软件与硬件之间的数据交互,从而提升整体性能。理解并应用这些原则,可以帮助开发者在存储器要求和性能之间找到最佳平衡点。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.coloradmin.cn/o/1804271.html

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈,一经查实,立即删除!

相关文章

Java | Leetcode Java题解之第140题单词拆分II

题目&#xff1a; 题解&#xff1a; class Solution {public List<String> wordBreak(String s, List<String> wordDict) {Map<Integer, List<List<String>>> map new HashMap<Integer, List<List<String>>>();List<List…

16_ Vue.js高级指南:条件渲染、列表渲染与数据双向绑定

文章目录 1. 条件渲染v-if2. 列表渲染v-for3. 数据双项绑定v-model4. 计算属性Appendix 1. 条件渲染v-if v-if标签直接接收函数或boolean类型变量 v-if 为true&#xff0c;则当前元素会进入到dom树v-else会自动执行 前方v-if的取反操作 v-show v-show值为true则值展示值不展示…

Qt基于SQLite数据库的增删查改demo

一、效果展示 在Qt创建如图UI界面&#xff0c;主要包括“查询”、“添加”、“删除”、“更新”&#xff0c;四个功能模块。 查询&#xff1a;从数据库中查找所有数据的所有内容&#xff0c;并显示在左边的QListWidget控件上。 添加&#xff1a;在右边的QLineEdit标签上输入需…

C++ | Leetcode C++题解之第139题单词拆分

题目&#xff1a; 题解&#xff1a; class Solution { public:bool wordBreak(string s, vector<string>& wordDict) {auto wordDictSet unordered_set <string> ();for (auto word: wordDict) {wordDictSet.insert(word);}auto dp vector <bool> (s.…

HC-05蓝牙模块配置连接和使用

文章目录 1. 前期准备 2. 进入AT模式 3. 电脑串口配置 4. 配置过程 5. 主从机蓝牙连接 6. 蓝牙模块HC-05和电脑连接 1. 前期准备 首先需要准备一个USB转TTL连接器&#xff0c;电脑安装一个串口助手&#xff0c;然后按照下面的连接方式将其相连。 VCCVCCGNDGNDRXDTXDTXD…

jquery.datetimepicker控件不弹出的问题

项目场景&#xff1a; CRM项目&#xff0c;在项目中涉及日期类输入框&#xff0c;打算采用平常见到的点击选择日期的方式。在浏览了网页后&#xff0c;目前比较好的解决方案是jquery.datetimepicker和flatpicker两种&#xff0c;flatpicker的缺点是官网是英文版的&#xff0c;…

计算机系统基础笔记(12)——控制

前言 在持续输出ing 一、条件码 1.处理器状态&#xff08;x86-64&#xff0c;部分的&#xff09; 当前程序的执行信息 ◼ 临时数据 ◼ 运行时栈的位置&#xff08;栈顶&#xff09; ◼ 当前代码控制点的位置&#xff08;即将要执行的指令地址&#xff09; ◼ 最近一次指令执…

SpringCloudAlibaba基础二 Nacos注册中心

一 什么是 Nacos 官方&#xff1a;一个更易于构建云原生应用的动态服务发现(Nacos Discovery )、服务配置(Nacos Config)和服务管理平台。 集 注册中心配置中心服务管理 平台。 Nacos 的关键特性包括: 服务发现和服务健康监测动态配置服务动态 DNS 服务服务及其元数据管理 …

进军rust:从0开始学习rust语法

一.变量类型 Rust语言中的基础数据类型有以下几种&#xff1a; 1.整数型 整数型简称整型&#xff0c;按照比特位的长度和有无符号位可以分为以下几种 isize和usize两种整数类型是用来衡量数据大小的&#xff0c;它们的位长度取决于所运行的目标平台&#xff0c;如果是32位架…

openpose标定中棋盘格检测错误的解决方案

文章目录 1、openpose 棋盘格检测流程2、解决过程3、实测结果1、openpose 棋盘格检测流程 在opencv中通过调用cv::findChessboardCorners()函数,同时指定棋盘格内角点尺寸来检测画面中的棋盘格,结果将以一定顺序来保存结果。通常指定尺寸的两个纬度的值不能相同,例如当指定…

学习笔记——路由网络基础——等开销负载均衡

3、等开销负载均衡 等开销负载均衡&#xff1a;到达同一目标网段&#xff0c;存在多条路由条目&#xff0c;存在两条或两条以上的路由优先级值和开销值都是最优的(优先级值和开销值一致)&#xff0c;则这几条路径执行负载均衡(在ping中就是这条路由发个包再下一条路由再发个包…

计算机网络 —— 网络层(子网掩码和子网划分)

计算机网络 —— 网络层&#xff08;子网掩码和子网划分&#xff09; 网络地址转换NAT子网掩码和子网划分举个例子第一步&#xff1a;看类型第二步&#xff1a;从主机号开始比对第三步&#xff1a;去头去尾 我们今天来看子网掩码和子网划分&#xff1a; 网络地址转换NAT 网络…

[FSCTF 2023]Tea_apk

得到密文和密钥 import base64 from ctypes import c_uint32import libnumDELTA 0x9E3779B9def decrypt(v, n, k):rounds 6 int(52 / n)sum c_uint32(rounds * DELTA)y v[0].valuewhile rounds > 0:e (sum.value >> 2) & 3p n - 1while p > 0:z v[p …

使用缓存降低数据库并发读写方案探索

文章目录 前言缓存设计思想缓存划分缓存应用时机 客户端缓存浏览器缓存网关或代理服务器缓存CDNPCDN 服务端缓存本地缓存本地缓存实现Java堆缓存memcached/ecachecaffeineORM框架一级/二级缓存 分布式缓存分布式缓存优缺点分布式缓存实现分布式缓存实施过程可能遇到问题分布式缓…

【冲刺秋招,许愿offer】第 一 天

【冲刺秋招&#xff0c;许愿offer】第 一 天 知识点emo环节 知识点 Java Leetcode&#xff1a;可以用LinkedListMap模拟实现LRUCache&#xff0c;用hash表查找&#xff0c;双向链表记录顺序。集合&#xff1a;集合的遍历方式&#xff0c;可以使用迭代器(万能)、增强for只能用…

Mysql使用中的性能优化——批量插入的规模对比

在《Mysql使用中的性能优化——单次插入和批量插入的性能差异》中&#xff0c;我们观察到单次批量插入的数量和耗时呈指数型关系。 这个说明&#xff0c;不是单次批量插入的数量越多越好。本文我们将通过实验测试出本测试案例中最佳的单次批量插入数量。 结论 本案例中约每次…

【模拟-BM100 设计LRU缓存结构】

题目 BM100 设计LRU缓存结构 描述 设计LRU(最近最少使用)缓存结构&#xff0c;该结构在构造时确定大小&#xff0c;假设大小为 capacity &#xff0c;操作次数是 n &#xff0c;并有如下功能: Solution(int capacity) 以正整数作为容量 capacity 初始化 LRU 缓存get(key)&am…

[大模型]CharacterGLM-6B Transformers部署调用

环境准备 在autodl平台中租一个3090等24G显存的显卡机器&#xff0c;如下图所示镜像选择PyTorch–>2.0.0–>3.8(ubuntu20.04)–>11.8 接下来打开刚刚租用服务器的JupyterLab&#xff0c;并且打开其中的终端开始环境配置、模型下载和运行demo。 pip换源和安装依赖包 …

python爬虫入门教程(一)

上一篇文章讲了爬虫的工作原理&#xff0c;这篇文章以后就要重点开始讲编程序了。 简单爬虫的的两个步骤&#xff1a; 使用HTTPRequest工具模拟HTTP请求&#xff0c;接收到返回的文本。用于请求的包有: requests、urllib等。 对接收的文本进行筛选,获取想要的内容。用户筛选文…

Nvidia/算能 +FPGA+AI大算力边缘计算盒子:隧道和矿井绘图设备

RockMass 正在努力打入采矿业和隧道工程利基市场。 这家位于多伦多的初创公司正在利用 NVIDIA AI 开发一款绘图平台&#xff0c;帮助工程师评估矿井和施工中的隧道稳定性。 目前&#xff0c;作为安全预防措施&#xff0c;地质学家和工程师会站在离岩石五米远的地方&#xff0…