YouTube2Text

AI内存的技术混战 | 伯恩斯坦研究报告 | AI内存 | HBM | CXL | DRAM | NAND | KV缓存 | 存储器产业 | AI算力底层硬件 | 存储级内存 | 人工智能推理 — Transcript

by 最佳拍档 · 510 words · 489 segments · language en · Watch on YouTube

Full transcript

  1. 0:00大家好,这里是最佳拍档,我是大飞
  2. 0:03大多数人聊AI内存,第一反应就是HBM
  3. 0:06好像HBM就是AI内存的全部
  4. 0:09只要堆够了HBM,什么问题都能解决
  5. 0:11但你可能不知道的是
  6. 0:13真正把AI内存卡到死的
  7. 0:15其实不在于训练阶段
  8. 0:17而是推理里的解码阶段
  9. 0:19KV缓存的膨胀速度
  10. 0:21远超大多数人的预期
  11. 0:22每天行业都有新名词冒出来
  12. 0:25比如说HBF、Z-NAND、CXL、CMX、ZAM、HBC
  13. 0:30等等等等
  14. 0:31产业链一边造技术一边造缩写
  15. 0:34速度快到很多从业者都跟不上
  16. 0:36最近
  17. 0:37伯恩斯坦(Bernstein)的四位分析师联合撰写了一份最新的AI内存入门报告
  18. 0:42把所有这些新技术归到两个框架里给讲透了
  19. 0:45一个是从系统架构出发的层级
  20. 0:47一个是从硬件介质出发的层级
  21. 0:50今天这期内容,我们就顺着这个框架
  22. 0:52把AI内存的全貌梳理清楚
  23. 0:55先从最基础的说起
  24. 0:57不同阶段的AI任务
  25. 0:58对内存的要求完全不是一回事
  26. 1:00不能一概而论
  27. 1:02很多人一上来就只聊HBM
  28. 1:04这其实是把问题想简单了
  29. 1:06训练虽然是整个AI流程里计算密度最高的阶段
  30. 1:10但是内存带宽同样关键
  31. 1:12带宽直接决定了你能跑的模型上限和训练速度
  32. 1:16HBM如今在训练里的核心地位不用多说
  33. 1:19但是训练绝不是只靠HBM就能跑起来的
  34. 1:22你想想
  35. 1:23海量的训练数据集要提前准备好
  36. 1:26存在更慢也更便宜的存储介质里
  37. 1:29训练过程中数据要经过多层缓存逐步调度
  38. 1:32最后才进HBM
  39. 1:34而且训练动辄跑几个月
  40. 1:36中间还要频繁存检查点
  41. 1:38防止软硬件故障导致从头再来
  42. 1:41说白了
  43. 1:41训练要把从HBM到系统DRAM、本地SSD、网络存储的全层级内存都跑通
  44. 1:48缺了哪一环都不行
  45. 1:50推理就更有意思了
  46. 1:52它分成两个完全不同的阶段
  47. 1:53预填充和解码
  48. 1:55两者的瓶颈完全不一样
  49. 1:57预填充阶段处理用户输入的提示词
  50. 1:59生成第一个token
  51. 2:01这个阶段以矩阵运算为主
  52. 2:03GPU利用率很高
  53. 2:04是典型的计算绑定场景
  54. 2:06数据搬运的时间远低于计算时间
  55. 2:08内存压力相对小,HBM的作用更突出
  56. 2:12这个阶段的核心指标叫首token时间
  57. 2:14也就是TTFT
  58. 2:16普通聊天场景0.5秒以内是理想状态
  59. 2:191秒基本可以接受
  60. 2:21超过2秒用户很容易就失去耐心了
  61. 2:23如果是处理上百页文档这类重任务
  62. 2:26容忍度会高一些
  63. 2:27配合一个思考中的提示
  64. 2:29用户还能接受
  65. 2:30但是解码阶段的逻辑就完全不同了
  66. 2:33token是逐个生成的
  67. 2:34学术上叫自回归生成
  68. 2:36每生成一个新token
  69. 2:38都要用到之前所有token的信息
  70. 2:40为了避免重复计算
  71. 2:41现在的大模型都会把之前token的键值对存下来
  72. 2:45也就是KV缓存
  73. 2:46KV缓存的大小和token数量是线性增长的
  74. 2:50这里有一个很关键的区别
  75. 2:52模型权重是只读的
  76. 2:53可以给所有用户共享
  77. 2:55但是KV缓存却是每个用户一份
  78. 2:58并发用户数越多,总占用量就越高
  79. 3:01两者叠加之后
  80. 3:02解码阶段就变成了典型的内存绑定场景
  81. 3:05很多人可能没意识到的是
  82. 3:07在大规模部署里
  83. 3:08KV缓存吃掉的内存可能比模型权重本身还多
  84. 3:12它直接决定了一台服务器能同时服务多少用户、能支持多大的上下文窗口
  85. 3:18换句话说,KV缓存的处理效率
  86. 3:20直接影响一个AI模型的部署规模和收入天花板
  87. 3:23解码阶段的核心指标是每个输出token的耗时
  88. 3:26也就是TPOT
  89. 3:28文字聊天大概50毫秒以内就能接受
  90. 3:31如果是实时语音、编程、智能体这类高要求场景
  91. 3:35要压到10毫秒以内
  92. 3:36除了训练和推理
  93. 3:38检索增强生成(RAG)的内存需求又是另一套逻辑
  94. 3:41RAG就是给模型接外部数据库
  95. 3:44用私有数据或者最新信息补充模型的知识
  96. 3:47同时也能减少幻觉
  97. 3:49整个流程分数据库生成和搜索两部分
  98. 3:52生成阶段要把海量的PDF、代码、网页这类非结构化数据
  99. 3:57处理成可检索的向量数据库
  100. 3:59首先要有大容量存原始数据
  101. 4:01固态硬盘(SSD)比机械硬盘(HDD)更能降低访问延迟
  102. 4:06生成向量和索引主要靠系统DRAM
  103. 4:08HBM用得不多
  104. 4:10这部分工作是离线完成的
  105. 4:12和用户数、token数都没关系
  106. 4:14属于一次性投入
  107. 4:16搜索阶段先把用户查询转成向量
  108. 4:18这步用HBM处理很快
  109. 4:20大部分时间都花在向量数据库里找最匹配的结果
  110. 4:24这步主要靠系统DRAM
  111. 4:26检索到结果之后,合并到用户提示里
  112. 4:28还是走推理的预填充和解码流程
  113. 4:31内存需求和前面说的一致
  114. 4:33再往上走
  115. 4:34智能体工作流的内存压力会再上一个台阶
  116. 4:37它不是单次的提示到输出
  117. 4:39而是自主的多步迭代
  118. 4:41自己拆解目标、调用工具、评估结果
  119. 4:43出错了还要回退修正
  120. 4:45整个流程需要额外的计算和内存来管控状态、存储中间结果
  121. 4:50和外部工具交互
  122. 4:51会产生大量传统CPU和常规内存的需求
  123. 4:55更关键的是
  124. 4:55一个智能体的输出会变成下一个智能体的输入
  125. 4:59多智能体并发的时候
  126. 5:00预填充、解码、KV缓存的需求会层层叠加
  127. 5:04内存压力比单轮推理大得多
  128. 5:06讲完了不同工作负载的需求差异
  129. 5:08我们再从系统架构的视角
  130. 5:10看看内存是怎么分层的
  131. 5:12伯恩斯坦把AI系统里的内存按架构位置和作用
  132. 5:15分成了从G0到G4的完整层级
  133. 5:18这个划分没有官方标准
  134. 5:20是结合了英伟达、Solidigm的定义
  135. 5:23再把HBF、CXL、Storage Next这些新技术都插进去
  136. 5:27形成的一个完整框架
  137. 5:29看完你就能明白每个新技术到底在系统里的哪个位置
  138. 5:32解决什么问题
  139. 5:34G0是处理器内部的内存
  140. 5:36一般是静态随机存取存储器(SRAM)
  141. 5:39延迟极低,容量非常小
  142. 5:41用来做即时计算的缓存
  143. 5:42和加速器的逻辑芯片在同一块晶圆上生产
  144. 5:46G1是HBM,也就是高带宽内存
  145. 5:48用CoWoS先进封装把堆叠的动态随机存取存储器(DRAM)芯片和加速器封装在一起
  146. 5:55带宽高延迟低
  147. 5:56模型权重、KV缓存这些最热、访问最频繁的关键数据
  148. 6:00都存在这一层
  149. 6:01G2是系统内存,就是常见的DDR DRAM
  150. 6:05容量比HBM大
  151. 6:06延迟也更高,通常布置在CPU旁边
  152. 6:09英伟达和AMD的GPU都可以绕过CPU
  153. 6:12直接访问这部分内存
  154. 6:13G2.5是计算快速链接(CXL)内存
  155. 6:17这项技术最初由英特尔推动
  156. 6:18现在已经得到全行业的支持
  157. 6:21它的核心是把物理上分开的内存
  158. 6:23整合成一个逻辑共享池
  159. 6:25避免资源浪费
  160. 6:26通过CXL,CPU可以访问加速器的HBM
  161. 6:29加速器也可以访问CPU管理的系统内存
  162. 6:32连PCIe接口的内存扩展器也能纳入共享池
  163. 6:36后来CXL也扩展支持NAND
  164. 6:38前提是NAND产品要优化得更接近DRAM的特性
  165. 6:42通常是搭配DRAM或SRAM做缓存来掩盖NAND的高延迟
  166. 6:47三星的CMM-H就是DRAM和NAND混合的CXL模块
  167. 6:52再往下是G2.6,叫Storage Next内存
  168. 6:55这是英伟达主导的生态项目
  169. 6:57几乎所有主流存储厂商都参与了
  170. 7:00它有两个核心方向
  171. 7:01一是把内存管理从CPU中心转向GPU中心
  172. 7:05二是让NAND变得更像DRAM
  173. 7:07既能享受NAND的低成本和大容量
  174. 7:10又能做到接近DRAM的延迟和小粒度数据访问
  175. 7:13它的位置就在DDR DRAM和本地SSD之间
  176. 7:16产品大多是DRAM和NAND的混合体
  177. 7:19很多会采用单层单元(SLC)NAND颗粒
  178. 7:23铠侠的GP系列SSD就是这类产品的代表
  179. 7:26主打超高IOPS
  180. 7:27也就是每秒输入输出操作数
  181. 7:30G3是本地SSD
  182. 7:32基于PCIe硬件标准和NVMe协议标准
  183. 7:35位于主板边缘
  184. 7:36属于单个计算节点内部,也叫计算SSD
  185. 7:39这一层把容量扩展到DRAM之外
  186. 7:41但不能跨节点共享,通常由CPU管理
  187. 7:44部分加速器可以直接访问
  188. 7:46G3.5是CMX内存和STX架构
  189. 7:50CMX全称是内容存储内存,之前叫ICMS
  190. 7:54也就是推理上下文内存存储
  191. 7:57是英伟达专门为KV缓存新增的层级
  192. 8:00符合CMX标准的SSD部署在数据节点里
  193. 8:03可以被整个集群的多个计算节点访问
  194. 8:05适合多智能体场景下共享的动态内容
  195. 8:08计算节点和数据节点之间用以太网连接
  196. 8:11中间通过Spectrum-X交换芯片转发
  197. 8:14两边都搭配BlueField-4 DPU
  198. 8:17GPU可以直接访问存储
  199. 8:19不需要CPU参与
  200. 8:20STX是英伟达推出的参考架构
  201. 8:22用来整合各家存储和ODM厂商的方案
  202. 8:25保证产品之间的兼容性
  203. 8:27最下面一层是G4,共享存储
  204. 8:30可以是SSD也可以是HDD
  205. 8:32通过PCIe或者网络连接
  206. 8:34用来存长期的、非关键路径的数据
  207. 8:37只要网络和软件支持
  208. 8:38GPU也可以直接访问这一层存储
  209. 8:41讲完了架构层级
  210. 8:42我们再从硬件介质的角度来看技术创新
  211. 8:45这是另一个维度的划分
  212. 8:47按存储单元的结构和工作原理来分
  213. 8:50再叠加各种封装和模块技术
  214. 8:52两个维度交叉组合
  215. 8:54产业链就能搭配出满足不同需求的解决方案
  216. 8:57SRAM是整个硬件层级里速度最快的
  217. 9:00它的单元结构是6晶体管
  218. 9:02比DRAM的1T1C结构
  219. 9:04也就是一个晶体管加一个电容
  220. 9:06占更多硅面积
  221. 9:08两者都是易失性存储
  222. 9:10断电数据就没了
  223. 9:11DRAM需要不断刷新电容
  224. 9:13SRAM不需要刷新电路
  225. 9:15现在绝大多数SRAM都是嵌入在逻辑芯片内部
  226. 9:18单独封装的只在小众场景存在
  227. 9:20对应架构里的G0层级
  228. 9:22用来做各级缓存
  229. 9:23L1缓存最靠近计算单元,容量最小
  230. 9:26L2、L3缓存容量更大
  231. 9:28延迟也稍高一点
  232. 9:30AI也催生了SRAM的新用法
  233. 9:32比如LPU也就是语言处理单元
  234. 9:35Groq的LPU现在的版本叫LP30
  235. 9:38英伟达也有授权
  236. 9:39它用片上SRAM来满足推理中对延迟最敏感的部分
  237. 9:43下一代LP40据说会用混合键合技术
  238. 9:46把SRAM芯片堆叠在逻辑处理器芯片上面
  239. 9:49延迟只有小幅增加
  240. 9:50容量能做得更大,成本也更可控
  241. 9:53这种用法大概对应架构里的G2层级
  242. 9:56还有嵌入式DRAM
  243. 9:57也是做在逻辑芯片里
  244. 9:59和嵌入式SRAM竞争大容量缓存场景
  245. 10:02比如L4缓存
  246. 10:03比如IBM的POWER处理器和索尼的PlayStation里就在用
  247. 10:06不过目前整体市场份额很小
  248. 10:09DRAM是整个存储行业收入和利润的绝对主力
  249. 10:12比NAND的体量要大
  250. 10:14HBM本质上也是DRAM
  251. 10:15和传统DRAM用一样的晶圆产能
  252. 10:18对应架构里的G1和G2层级
  253. 10:20CXL内存扩展里也会用到
  254. 10:22很多NAND产品会用DRAM做缓存来预取数据
  255. 10:26掩盖NAND的高延迟
  256. 10:27不过用量不大
  257. 10:29DRAM的技术演进到现在还是主要靠摩尔定律
  258. 10:32这意味着极紫外(EUV)光刻是必须的
  259. 10:34没有EUV的厂商
  260. 10:36长期来看在DRAM领域会逐步失去竞争力
  261. 10:39具体到中国来说
  262. 10:40长鑫存储作为国内主要的DRAM厂商
  263. 10:42正在研发4F² DRAM来应对
  264. 10:45传统的1T1C DRAM单元面积是6F²
  265. 10:494F²通过把外围电路从电容旁边移到电容下方
  266. 10:52甚至移到另一块晶圆上
  267. 10:54来缩小单元面积
  268. 10:55不过4F²带来的提升是一次性的
  269. 10:58就像逻辑芯片里的FinFET
  270. 11:00之后再往前发展还是要靠横向微缩
  271. 11:03国内也在研发3D DRAM
  272. 11:05类似3D NAND的思路
  273. 11:06把存储单元垂直堆叠起来
  274. 11:08平均单元面积能做到比4F²还小
  275. 11:11而且有持续微缩的潜力
  276. 11:13只是3D DRAM的技术难度大得多
  277. 11:15离商业化还有很长的路要走
  278. 11:18围绕HBM
  279. 11:18各家厂商也在做不同方向的创新
  280. 11:21这里面的技术路线非常多
  281. 11:22我们一个个说
  282. 11:24三星的zHBM想把封装从2.5D推进到3D
  283. 11:27现在的HBM堆叠在XPU旁边
  284. 11:30通过中介层连接
  285. 11:31zHBM要把HBM堆叠直接放在XPU的上面
  286. 11:35进一步缩短通信距离,提升带宽
  287. 11:37问题也很明显,下面的XPU发热量很大
  288. 11:41上面的DRAM芯片能不能在高温下稳定工作
  289. 11:43是个很大的疑问
  290. 11:45三星打算用晶圆对晶圆的混合键合
  291. 11:48芯片之间没有缝隙
  292. 11:49散热会好一些
  293. 11:50但混合键合的良率和成本能不能支撑大规模量产
  294. 11:54现在还不好说
  295. 11:56NVHBM是英伟达主导的定制化HBM
  296. 11:59它的基底芯片由英伟达设计
  297. 12:01台积电生产
  298. 12:02把内存控制器从XPU移到HBM的基底芯片上
  299. 12:05可以减小XPU的芯片面积
  300. 12:07降低成本
  301. 12:08或者省出面积放更多计算单元
  302. 12:11同时还能提升带宽、降低功耗
  303. 12:13英伟达在推动NVHBM走向开放
  304. 12:16一方面标准化实现方式
  305. 12:17让多家存储厂商都能供货
  306. 12:20另一方面通过NVLink Fusion让其他厂商的加速器也能使用
  307. 12:24亚马逊的安纳普尔纳实验室(Annapurna Labs)已经宣布合作
  308. 12:27和标准HBM相比
  309. 12:28NVHBM会压缩存储厂商的价值空间
  310. 12:31原来由存储厂商设计的基底芯片
  311. 12:33现在变成英伟达设计、晶圆厂代工
  312. 12:36存储厂商的差异化空间会被收窄
  313. 12:38英特尔也有两个DRAM相关的技术路线
  314. 12:41XBM和ZAM
  315. 12:43XBM全称是交叉批次内存(cross-batch memory)
  316. 12:45根据专利披露
  317. 12:46它用后端工艺
  318. 12:48也就是后道光刻和薄膜晶体管来做DRAM单元
  319. 12:51传统DRAM的单元在前道工艺制作
  320. 12:54后道只做金属连线
  321. 12:56XBM把存储单元做在后道的金属层之间
  322. 12:59这样DRAM单元和逻辑电路可以集成在同一块硅片上
  323. 13:03也让它成为内存内计算的潜在候选
  324. 13:05目前公开的细节还不多
  325. 13:07还很难判断这项技术的量产前景
  326. 13:09以及谁更适合生产
  327. 13:11ZAM全称是Z角内存(Z-angle memory)
  328. 13:13是封装层面的创新
  329. 13:14把堆叠里的DRAM芯片旋转90度横向排列
  330. 13:17芯片之间的垂直缝隙可以提升散热效率
  331. 13:20英特尔的合作伙伴、软银的全资子公司SAIMEMORY表示
  332. 13:24DRAM芯片还是向存储厂商采购
  333. 13:27他们主要做独特的封装和基底设计
  334. 13:29旋转之后芯片和基底的物理连接难度很高
  335. 13:32如何实现数据传输是核心挑战
  336. 13:35预计2029财年实现实用化
  337. 13:37高通的高带宽计算(HBC)走的是性价比路线
  338. 13:40它不用CoWoS先进封装,改用传统封装
  339. 13:43性能上做一些妥协
  340. 13:45但是省去了中介层和2.5D有机基板的高昂成本
  341. 13:48同时采用LPDDR来降低功耗
  342. 13:51第一代产品预计2027财年出货
  343. 13:53第二代2028年推出
  344. 13:55除了芯片和封装
  345. 13:56DRAM的模块形态也在创新
  346. 13:58MRDIMM、SOCAMM2、LPCAMM2都是这方面的代表
  347. 14:02MRDIMM和传统服务器用的RDIMM物理尺寸一致
  348. 14:05只是在模块上增加了更多接口芯片
  349. 14:08来提升带宽
  350. 14:09SOCAMM2的改动更大
  351. 14:11模块的外形和尺寸都和传统DIMM不同
  352. 14:13它支持LPDDR颗粒
  353. 14:15数据总线宽度从64位翻倍到128位
  354. 14:18高度更低
  355. 14:19既能降低功耗、提升单模块带宽
  356. 14:22还能改善服务器内部的风道和散热
  357. 14:25这里补充一下
  358. 14:26第一代SOCAMM是英伟达的专有试验版本
  359. 14:29SOCAMM2已经由JEDEC正式发布为行业标准
  360. 14:32它最先由英伟达的Vera CPU采用
  361. 14:35AMD的Verano CPU也会跟进支持
  362. 14:38LPCAMM2是面向AI笔记本的对应版本
  363. 14:41同样由JEDEC标准化
  364. 14:42早期的LPCAMM原型是三星主导的
  365. 14:45这三类模块都对应架构里的G2层级
  366. 14:48还有内存内计算(PIM)
  367. 14:49有时候也叫内存计算(CIM)
  368. 14:52它的思路是把逻辑电路和内存电路做在同一块芯片里
  369. 14:55直接在内存内部完成计算
  370. 14:57从根源上解决数据搬运的瓶颈
  371. 15:00这个思路和经典的冯诺依曼(John von Neumann)架构完全相反
  372. 15:03冯诺依曼体系是计算和存储分离
  373. 15:05PIM是把两者融合在一起
  374. 15:08存储厂商已经研究了很多年
  375. 15:10也提出了不少实现方式
  376. 15:11比如三星就在HBM里加入可编程计算单元
  377. 15:15但实际落地非常有限
  378. 15:16因为它需要处理器、软件、网络整个系统全部重新设计
  379. 15:20才能发挥出全部潜力
  380. 15:22而且现在的产业链已经形成了逻辑和存储分开制造的格局
  381. 15:27各自都有极大的规模和极高的效率
  382. 15:29全链条改造的成本太高
  383. 15:31接下来是存储级内存(SCM)
  384. 15:34它不是特指某一种技术
  385. 15:35而是所有性能介于DRAM和NAND之间的技术的统称
  386. 15:39大概对应架构里G2层级低端到G3层级高端的范围
  387. 15:44一类是原理完全不同的新兴存储
  388. 15:46比如磁阻存储器(MRAM)、相变存储器(PCM)、阻变存储器(RRAM)
  389. 15:52英特尔之前推出的3D XPoint就属于PCM技术
  390. 15:55这类技术的存储原理和DRAM、NAND有本质区别
  391. 15:59不过目前量产规模都不大
  392. 16:01另一类是增强型NAND
  393. 16:02比如Z-NAND、XL-FLASH
  394. 16:05通过搭配DRAM或者SRAM缓存
  395. 16:07或者采用SLC、MLC颗粒
  396. 16:09让NAND的延迟、IOPS更接近DRAM的水平
  397. 16:13这里稍微解释一下NAND颗粒的区别
  398. 16:15SLC也就是单层单元
  399. 16:17每个单元存1比特
  400. 16:19速度最快、寿命最长
  401. 16:20但容量最小、成本最高
  402. 16:22MLC也就是多层单元
  403. 16:24每个单元存2比特
  404. 16:25各方面比较均衡
  405. 16:27TLC也就是三层单元
  406. 16:29每个单元存3比特,是目前的主流
  407. 16:31容量和成本平衡得最好
  408. 16:33QLC也就是四层单元
  409. 16:35每个单元存4比特,容量最大成本最低
  410. 16:38但速度和寿命差一些
  411. 16:40铠侠的XL-FLASH采用SLC和MLC颗粒
  412. 16:44其GP系列SSD目前能做到千万级IOPS
  413. 16:47明年目标是上亿级
  414. 16:49三星的Z-NAND做成Z-SSD产品
  415. 16:52主打超低延迟
  416. 16:53还有厂商用伪SLC,也就是pSLC模式
  417. 16:57就是把TLC颗粒当SLC用
  418. 17:00牺牲容量换取更高的性能和寿命
  419. 17:02因为TLC是目前量产规模最大、经济性最好的工艺
  420. 17:06用pSLC模式可以享受规模效应的同时获得接近SLC的性能
  421. 17:11美光的XTR SSD就是这种方案
  422. 17:14铠侠自己有一个很清晰的产品划分
  423. 17:16不同的NAND技术对应AI推理的不同场景
  424. 17:19XL-FLASH对应Storage Next的G2.6层级
  425. 17:22TLC颗粒对应CMX的G3.5层级
  426. 17:26QLC颗粒对应G4层级的大容量存储
  427. 17:29NAND领域还有两个值得注意的方向
  428. 17:31一个是高带宽闪存(HBF)
  429. 17:33由闪迪和SK海力士主导
  430. 17:36目标是用NAND做到接近HBM的带宽
  431. 17:39同时拥有更低的成本和更大的容量
  432. 17:41如果放到架构层级里
  433. 17:42大概可以算作G1.5层级
  434. 17:45NAND本来比DRAM低一到两个层级
  435. 17:47要直接放到HBM旁边作为补充
  436. 17:50技术跨度非常大,门槛很高
  437. 17:52另一个是zNAND-O
  438. 17:53这是三星面向端侧AI推出的技术
  439. 17:56它采用TLC颗粒来保证大容量
  440. 17:58封装方式类似HBM
  441. 18:00先把NAND芯片堆叠起来
  442. 18:02再用先进封装技术和处理器紧密连接
  443. 18:05硬件层级的最下面两层是HDD和磁带
  444. 18:08HDD适合存储冷数据
  445. 18:09也就是大容量、低成本、访问频率低的数据
  446. 18:12对应架构里的G4层级
  447. 18:14现在KV缓存的规模越来越大
  448. 18:16非关键数据逐步在向下沉淀
  449. 18:18HDD的需求也在增长
  450. 18:20磁带本来只用于数据归档
  451. 18:22处在硬件层级的最底端
  452. 18:24但是现在全球数据存储需求暴涨
  453. 18:26NAND和HDD的产能都跟不上
  454. 18:28所以连磁带的需求都出现了增长
  455. 18:31最后
  456. 18:32伯恩斯坦在这份报告里对全球主要存储公司给出了评级和目标价
  457. 18:36这里说明一下
  458. 18:37伯恩斯坦的评级体系里
  459. 18:38跑赢大盘也就是Outperform的定义
  460. 18:41是未来12个月预期超越对应市场指数15个百分点以上
  461. 18:45跑输大盘也就是Underperform
  462. 18:47则是落后指数15个百分点以上
  463. 18:50具体来看,三星电子评级为跑赢大盘
  464. 18:53目标价44万韩元
  465. 18:54SK海力士也是跑赢大盘
  466. 18:56目标价330万韩元
  467. 18:58美光跑赢大盘,目标价1300美元
  468. 19:01铠侠评级为跑输大盘,目标价4万日元
  469. 19:05闪迪跑赢大盘,目标价3000美元
  470. 19:07希捷跑赢大盘,目标价1350美元
  471. 19:10西部数据跑赢大盘,目标价770美元
  472. 19:13这里提醒一下
  473. 19:14以上均为伯恩斯坦的预测数据
  474. 19:16仅作产业研究参考
  475. 19:17不构成任何投资建议
  476. 19:19总的来说呢
  477. 19:20AI内存的技术混战还在继续
  478. 19:22新的技术路线还在不断冒出来
  479. 19:24从架构层级看
  480. 19:25整个存储体系正在从以CPU为中心转向以GPU为中心
  481. 19:30每一层都在被重新定义
  482. 19:32从硬件介质看
  483. 19:33DRAM、NAND、SRAM各自的边界也在变得模糊
  484. 19:36大家都在往中间地带渗透
  485. 19:38对从业者来说
  486. 19:39这可能是存储行业过去二十年最热闹的时期
  487. 19:42至于哪条路线最终能跑出来
  488. 19:44现在下结论还为时过早
  489. 19:46感谢收看,我们下期再见

About this transcript

This page contains the full transcript of AI内存的技术混战 | 伯恩斯坦研究报告 | AI内存 | HBM | CXL | DRAM | NAND | KV缓存 | 存储器产业 | AI算力底层硬件 | 存储级内存 | 人工智能推理 by 最佳拍档, generated from the public captions YouTube serves with the video. The transcript has 510 words across 489 segments, with the original timestamps preserved so you can click any line to jump to that moment in the embedded player.

What you can do with it

Use the transcript to take notes, quote the speaker, build a study guide, generate a summary with ChatGPT or Claude via the YouTube Summary tool, or export it as a timed subtitle file with YouTube to SRT. You can also re-open it in the transcriber to translate the transcript into 100+ languages.

Free YouTube transcript tool

YouTube2Text is a free YouTube transcript generator — no signup, no daily limit. Paste any YouTube link and get the full transcript instantly, with timestamps, click-to-jump, translation to 100+ languages, AI prompts for ChatGPT, Claude, and Gemini, and exports to TXT, SRT, VTT, or Markdown.