存储器能直接做计算?

wen IT资讯 2

存储器能直接做计算?揭秘“存算一体”如何颠覆冯·诺依曼架构

目录导读

  • 为什么传统存储器不能直接计算?——冯·诺依曼瓶颈的根源
  • “存算一体”是什么?——打破数据搬运魔咒的核心原理
  • 三大主流技术路径:阻变存储器、闪存计算、近存计算
  • 真实案例:从实验室到芯片,谁在落地?
  • 应用场景:AI推理、边缘计算、物联网的降维打击
  • 常见问题解答:延迟、能耗、成本,你关心的问题都在这里

为什么传统存储器不能直接计算?

如果你打开一台计算机,会看到清晰的“功能分区”:CPU负责计算,内存和硬盘负责存储,数据先被“搬”到CPU,算完再“搬”回去,这就是冯·诺依曼架构的经典模式。

存储器能直接做计算?

问题就出在“搬运”上:数据搬运的速度远低于CPU的计算速度,这个差距被称为“内存墙”,执行一次加法,CPU只需1纳秒,但去DRAM(动态随机存取存储器)取数据可能花100纳秒,更糟的是,AI大模型需要反复搬运海量参数,90%的时间和能耗都浪费在数据移动上,真正计算的时间不到10%。

传统的存储器(DRAM、NAND闪存、HDD)被设计为纯粹的存储工具,它们只能读或写,无法在数据存放的位置完成逻辑运算,就像一座图书馆只允许借书,但禁止在书架上做笔记——你必须把书搬到书桌上才能阅读和批注。

如果能让存储器“边存边算”,岂不是能消灭搬运开销?这正是“存算一体”的核心理念。


“存算一体”是什么?

存算一体(Computational Storage 或 In-Memory Computing) 是一种新型计算范式,它允许数据在存储器内部就被处理,无需频繁移动到CPU,这相当于在图书馆的书架旁直接放了一张书桌,你可以在书架位置直接翻阅、批注、甚至整理书籍。

技术本质:利用存储介质的物理特性(如电阻变化、电流响应)来完成布尔逻辑或矩阵乘法,在RRAM(阻变存储器)中,存储单元的电阻值可以表示“0”和“1”,而通过控制电压,这些电阻单元天生就能实现“乘法”或“累加”运算。

关键突破:将计算单元(如加法器、乘法器)嵌入到存储阵列中,使得每个存储单元都具备“存储+计算”双重能力。


三大主流技术路径

技术路径 代表器件 工作原理 成熟度
存内计算 RRAM、PCM 利用电阻开关效应执行逻辑运算 实验室—早期量产
闪存计算 NAND Flash 通过电荷泵和模拟电路在闪存内完成矩阵向量乘法 已有商用原型
近存计算 HBM(高带宽存储器) 在逻辑芯片上堆叠存储芯片,缩短搬运距离 大规模商用(如HBM2E)

阻变存储器:在单个RRAM单元中,通过施加不同电压改变其电阻状态,从而执行“与非(NAND)”或“异或(XOR)”等逻辑,2019年,三星展示了基于RRAM的“存算一体芯片”,可在存储器内直接运行神经网络推理。

闪存计算:基于成熟的NAND Flash工艺,通过修改存储阵列的外围电路,让每个存储单元的电流代表权重,实现“模拟计算”,初创公司Mythic的AI芯片,将神经网络权重存放在闪存中,数据在闪存内完成乘积累加(MAC),功耗降低至传统方案的1/10。

近存计算:这是最务实的过渡方案,将计算逻辑(如矩阵乘法器)紧贴高带宽存储器(HBM)或HMC(混合存储立方体)放置,NVIDIA的Grace Hopper超级芯片就采用了这种架构,GPU与HBM之间的带宽高达900GB/s,减少了数据搬运延迟。


真实案例:谁在落地存算一体?

  • SK海力士:2022年展示了首个基于GDDR6的“近存计算”芯片,内置AI推理加速器,可用于边缘设备。
  • 三星:在ISSCC 2023上展示了基于MRAM的存算一体芯片,能效比达到0.5TOPS/W,适合可穿戴设备。
  • Semidynamics:推出了一款“计算内存”IP核,允许客户将自定义逻辑集成到DRAM中,用于数据库加速。
  • 国内团队:中科院微电子所开发了基于RRAM的“忆阻器阵列”,在图像识别任务中能效提升1000倍。

应用场景:哪些领域最先受益?

  1. AI推理:语音识别、图像分类等任务需要大量矩阵乘法,存算一体芯片将权重存储在本地,避免I/O瓶颈,推理延迟从毫秒级降至微秒级。
  2. 边缘计算:智能门锁、穿戴设备对能耗敏感,存算一体芯片无需单独的内存芯片,体积更小、功耗更低。
  3. 数据库与大数据:在数据库索引、哈希表查找场景中,将搜索逻辑嵌入内存,省去CPU轮询时间,查询速度提升10-100倍。
  4. 自动驾驶:需要实时处理雷达、摄像头数据,存算一体可减少数据搬运,提升系统响应速度。

常见问题解答

Q1:存算一体是否意味着不需要CPU了? A:短期内不可能,存算一体更适合特定计算模式(如向量运算、神经网络),而复杂控制流、分支判断仍需CPU,未来可能是“CPU+存算一体加速器”的异构架构。

Q2:存储器的物理限制会不会导致计算错误? A:会,RRAM的电阻状态受温度、老化影响,可能导致计算结果漂移,目前通过纠错码和冗余校准来解决,但成本仍需平衡。

Q3:与GPU相比,存算一体优势在哪里? A:对于AI推理,存算一体功耗可降低10-100倍,但绝对计算速度仍低于GPU,它适合电池供电的边缘设备,而非训练大规模模型的数据中心。

Q4:何时能普及到普通电脑? A:预计3-5年内,高端手机和边缘AI终端将率先采用,PC端受制于兼容性和成本,可能需要更长时间。


存储器直接做计算不再是科幻,以RRAM、闪存计算、近存计算为代表的存算一体技术,正逐步击穿“内存墙”,为AI、物联网带来能效革命,虽然仍需解决可靠性、成本问题,但它已经上路,并在特定场景中展示了“降维打击”式的优势。

下一次打开电脑时,不妨想想: 如果存储器不仅能存,还能在它所在的位置直接“想”,计算世界会怎样?

抱歉,评论功能暂时关闭!