AI内存的技术混战 | 伯恩斯坦研究报告 | AI内存 | HBM | CXL | DRAM | NAND | KV缓存 | 存储器产业 | AI算力底层硬件 | 存储级内存 | 人工智能推理 — Transcript
Full transcript
- 0:00大家好,这里是最佳拍档,我是大飞
- 0:03大多数人聊AI内存,第一反应就是HBM
- 0:06好像HBM就是AI内存的全部
- 0:09只要堆够了HBM,什么问题都能解决
- 0:11但你可能不知道的是
- 0:13真正把AI内存卡到死的
- 0:15其实不在于训练阶段
- 0:17而是推理里的解码阶段
- 0:19KV缓存的膨胀速度
- 0:21远超大多数人的预期
- 0:22每天行业都有新名词冒出来
- 0:25比如说HBF、Z-NAND、CXL、CMX、ZAM、HBC
- 0:30等等等等
- 0:31产业链一边造技术一边造缩写
- 0:34速度快到很多从业者都跟不上
- 0:36最近
- 0:37伯恩斯坦(Bernstein)的四位分析师联合撰写了一份最新的AI内存入门报告
- 0:42把所有这些新技术归到两个框架里给讲透了
- 0:45一个是从系统架构出发的层级
- 0:47一个是从硬件介质出发的层级
- 0:50今天这期内容,我们就顺着这个框架
- 0:52把AI内存的全貌梳理清楚
- 0:55先从最基础的说起
- 0:57不同阶段的AI任务
- 0:58对内存的要求完全不是一回事
- 1:00不能一概而论
- 1:02很多人一上来就只聊HBM
- 1:04这其实是把问题想简单了
- 1:06训练虽然是整个AI流程里计算密度最高的阶段
- 1:10但是内存带宽同样关键
- 1:12带宽直接决定了你能跑的模型上限和训练速度
- 1:16HBM如今在训练里的核心地位不用多说
- 1:19但是训练绝不是只靠HBM就能跑起来的
- 1:22你想想
- 1:23海量的训练数据集要提前准备好
- 1:26存在更慢也更便宜的存储介质里
- 1:29训练过程中数据要经过多层缓存逐步调度
- 1:32最后才进HBM
- 1:34而且训练动辄跑几个月
- 1:36中间还要频繁存检查点
- 1:38防止软硬件故障导致从头再来
- 1:41说白了
- 1:41训练要把从HBM到系统DRAM、本地SSD、网络存储的全层级内存都跑通
- 1:48缺了哪一环都不行
- 1:50推理就更有意思了
- 1:52它分成两个完全不同的阶段
- 1:53预填充和解码
- 1:55两者的瓶颈完全不一样
- 1:57预填充阶段处理用户输入的提示词
- 1:59生成第一个token
- 2:01这个阶段以矩阵运算为主
- 2:03GPU利用率很高
- 2:04是典型的计算绑定场景
- 2:06数据搬运的时间远低于计算时间
- 2:08内存压力相对小,HBM的作用更突出
- 2:12这个阶段的核心指标叫首token时间
- 2:14也就是TTFT
- 2:16普通聊天场景0.5秒以内是理想状态
- 2:191秒基本可以接受
- 2:21超过2秒用户很容易就失去耐心了
- 2:23如果是处理上百页文档这类重任务
- 2:26容忍度会高一些
- 2:27配合一个思考中的提示
- 2:29用户还能接受
- 2:30但是解码阶段的逻辑就完全不同了
- 2:33token是逐个生成的
- 2:34学术上叫自回归生成
- 2:36每生成一个新token
- 2:38都要用到之前所有token的信息
- 2:40为了避免重复计算
- 2:41现在的大模型都会把之前token的键值对存下来
- 2:45也就是KV缓存
- 2:46KV缓存的大小和token数量是线性增长的
- 2:50这里有一个很关键的区别
- 2:52模型权重是只读的
- 2:53可以给所有用户共享
- 2:55但是KV缓存却是每个用户一份
- 2:58并发用户数越多,总占用量就越高
- 3:01两者叠加之后
- 3:02解码阶段就变成了典型的内存绑定场景
- 3:05很多人可能没意识到的是
- 3:07在大规模部署里
- 3:08KV缓存吃掉的内存可能比模型权重本身还多
- 3:12它直接决定了一台服务器能同时服务多少用户、能支持多大的上下文窗口
- 3:18换句话说,KV缓存的处理效率
- 3:20直接影响一个AI模型的部署规模和收入天花板
- 3:23解码阶段的核心指标是每个输出token的耗时
- 3:26也就是TPOT
- 3:28文字聊天大概50毫秒以内就能接受
- 3:31如果是实时语音、编程、智能体这类高要求场景
- 3:35要压到10毫秒以内
- 3:36除了训练和推理
- 3:38检索增强生成(RAG)的内存需求又是另一套逻辑
- 3:41RAG就是给模型接外部数据库
- 3:44用私有数据或者最新信息补充模型的知识
- 3:47同时也能减少幻觉
- 3:49整个流程分数据库生成和搜索两部分
- 3:52生成阶段要把海量的PDF、代码、网页这类非结构化数据
- 3:57处理成可检索的向量数据库
- 3:59首先要有大容量存原始数据
- 4:01固态硬盘(SSD)比机械硬盘(HDD)更能降低访问延迟
- 4:06生成向量和索引主要靠系统DRAM
- 4:08HBM用得不多
- 4:10这部分工作是离线完成的
- 4:12和用户数、token数都没关系
- 4:14属于一次性投入
- 4:16搜索阶段先把用户查询转成向量
- 4:18这步用HBM处理很快
- 4:20大部分时间都花在向量数据库里找最匹配的结果
- 4:24这步主要靠系统DRAM
- 4:26检索到结果之后,合并到用户提示里
- 4:28还是走推理的预填充和解码流程
- 4:31内存需求和前面说的一致
- 4:33再往上走
- 4:34智能体工作流的内存压力会再上一个台阶
- 4:37它不是单次的提示到输出
- 4:39而是自主的多步迭代
- 4:41自己拆解目标、调用工具、评估结果
- 4:43出错了还要回退修正
- 4:45整个流程需要额外的计算和内存来管控状态、存储中间结果
- 4:50和外部工具交互
- 4:51会产生大量传统CPU和常规内存的需求
- 4:55更关键的是
- 4:55一个智能体的输出会变成下一个智能体的输入
- 4:59多智能体并发的时候
- 5:00预填充、解码、KV缓存的需求会层层叠加
- 5:04内存压力比单轮推理大得多
- 5:06讲完了不同工作负载的需求差异
- 5:08我们再从系统架构的视角
- 5:10看看内存是怎么分层的
- 5:12伯恩斯坦把AI系统里的内存按架构位置和作用
- 5:15分成了从G0到G4的完整层级
- 5:18这个划分没有官方标准
- 5:20是结合了英伟达、Solidigm的定义
- 5:23再把HBF、CXL、Storage Next这些新技术都插进去
- 5:27形成的一个完整框架
- 5:29看完你就能明白每个新技术到底在系统里的哪个位置
- 5:32解决什么问题
- 5:34G0是处理器内部的内存
- 5:36一般是静态随机存取存储器(SRAM)
- 5:39延迟极低,容量非常小
- 5:41用来做即时计算的缓存
- 5:42和加速器的逻辑芯片在同一块晶圆上生产
- 5:46G1是HBM,也就是高带宽内存
- 5:48用CoWoS先进封装把堆叠的动态随机存取存储器(DRAM)芯片和加速器封装在一起
- 5:55带宽高延迟低
- 5:56模型权重、KV缓存这些最热、访问最频繁的关键数据
- 6:00都存在这一层
- 6:01G2是系统内存,就是常见的DDR DRAM
- 6:05容量比HBM大
- 6:06延迟也更高,通常布置在CPU旁边
- 6:09英伟达和AMD的GPU都可以绕过CPU
- 6:12直接访问这部分内存
- 6:13G2.5是计算快速链接(CXL)内存
- 6:17这项技术最初由英特尔推动
- 6:18现在已经得到全行业的支持
- 6:21它的核心是把物理上分开的内存
- 6:23整合成一个逻辑共享池
- 6:25避免资源浪费
- 6:26通过CXL,CPU可以访问加速器的HBM
- 6:29加速器也可以访问CPU管理的系统内存
- 6:32连PCIe接口的内存扩展器也能纳入共享池
- 6:36后来CXL也扩展支持NAND
- 6:38前提是NAND产品要优化得更接近DRAM的特性
- 6:42通常是搭配DRAM或SRAM做缓存来掩盖NAND的高延迟
- 6:47三星的CMM-H就是DRAM和NAND混合的CXL模块
- 6:52再往下是G2.6,叫Storage Next内存
- 6:55这是英伟达主导的生态项目
- 6:57几乎所有主流存储厂商都参与了
- 7:00它有两个核心方向
- 7:01一是把内存管理从CPU中心转向GPU中心
- 7:05二是让NAND变得更像DRAM
- 7:07既能享受NAND的低成本和大容量
- 7:10又能做到接近DRAM的延迟和小粒度数据访问
- 7:13它的位置就在DDR DRAM和本地SSD之间
- 7:16产品大多是DRAM和NAND的混合体
- 7:19很多会采用单层单元(SLC)NAND颗粒
- 7:23铠侠的GP系列SSD就是这类产品的代表
- 7:26主打超高IOPS
- 7:27也就是每秒输入输出操作数
- 7:30G3是本地SSD
- 7:32基于PCIe硬件标准和NVMe协议标准
- 7:35位于主板边缘
- 7:36属于单个计算节点内部,也叫计算SSD
- 7:39这一层把容量扩展到DRAM之外
- 7:41但不能跨节点共享,通常由CPU管理
- 7:44部分加速器可以直接访问
- 7:46G3.5是CMX内存和STX架构
- 7:50CMX全称是内容存储内存,之前叫ICMS
- 7:54也就是推理上下文内存存储
- 7:57是英伟达专门为KV缓存新增的层级
- 8:00符合CMX标准的SSD部署在数据节点里
- 8:03可以被整个集群的多个计算节点访问
- 8:05适合多智能体场景下共享的动态内容
- 8:08计算节点和数据节点之间用以太网连接
- 8:11中间通过Spectrum-X交换芯片转发
- 8:14两边都搭配BlueField-4 DPU
- 8:17GPU可以直接访问存储
- 8:19不需要CPU参与
- 8:20STX是英伟达推出的参考架构
- 8:22用来整合各家存储和ODM厂商的方案
- 8:25保证产品之间的兼容性
- 8:27最下面一层是G4,共享存储
- 8:30可以是SSD也可以是HDD
- 8:32通过PCIe或者网络连接
- 8:34用来存长期的、非关键路径的数据
- 8:37只要网络和软件支持
- 8:38GPU也可以直接访问这一层存储
- 8:41讲完了架构层级
- 8:42我们再从硬件介质的角度来看技术创新
- 8:45这是另一个维度的划分
- 8:47按存储单元的结构和工作原理来分
- 8:50再叠加各种封装和模块技术
- 8:52两个维度交叉组合
- 8:54产业链就能搭配出满足不同需求的解决方案
- 8:57SRAM是整个硬件层级里速度最快的
- 9:00它的单元结构是6晶体管
- 9:02比DRAM的1T1C结构
- 9:04也就是一个晶体管加一个电容
- 9:06占更多硅面积
- 9:08两者都是易失性存储
- 9:10断电数据就没了
- 9:11DRAM需要不断刷新电容
- 9:13SRAM不需要刷新电路
- 9:15现在绝大多数SRAM都是嵌入在逻辑芯片内部
- 9:18单独封装的只在小众场景存在
- 9:20对应架构里的G0层级
- 9:22用来做各级缓存
- 9:23L1缓存最靠近计算单元,容量最小
- 9:26L2、L3缓存容量更大
- 9:28延迟也稍高一点
- 9:30AI也催生了SRAM的新用法
- 9:32比如LPU也就是语言处理单元
- 9:35Groq的LPU现在的版本叫LP30
- 9:38英伟达也有授权
- 9:39它用片上SRAM来满足推理中对延迟最敏感的部分
- 9:43下一代LP40据说会用混合键合技术
- 9:46把SRAM芯片堆叠在逻辑处理器芯片上面
- 9:49延迟只有小幅增加
- 9:50容量能做得更大,成本也更可控
- 9:53这种用法大概对应架构里的G2层级
- 9:56还有嵌入式DRAM
- 9:57也是做在逻辑芯片里
- 9:59和嵌入式SRAM竞争大容量缓存场景
- 10:02比如L4缓存
- 10:03比如IBM的POWER处理器和索尼的PlayStation里就在用
- 10:06不过目前整体市场份额很小
- 10:09DRAM是整个存储行业收入和利润的绝对主力
- 10:12比NAND的体量要大
- 10:14HBM本质上也是DRAM
- 10:15和传统DRAM用一样的晶圆产能
- 10:18对应架构里的G1和G2层级
- 10:20CXL内存扩展里也会用到
- 10:22很多NAND产品会用DRAM做缓存来预取数据
- 10:26掩盖NAND的高延迟
- 10:27不过用量不大
- 10:29DRAM的技术演进到现在还是主要靠摩尔定律
- 10:32这意味着极紫外(EUV)光刻是必须的
- 10:34没有EUV的厂商
- 10:36长期来看在DRAM领域会逐步失去竞争力
- 10:39具体到中国来说
- 10:40长鑫存储作为国内主要的DRAM厂商
- 10:42正在研发4F² DRAM来应对
- 10:45传统的1T1C DRAM单元面积是6F²
- 10:494F²通过把外围电路从电容旁边移到电容下方
- 10:52甚至移到另一块晶圆上
- 10:54来缩小单元面积
- 10:55不过4F²带来的提升是一次性的
- 10:58就像逻辑芯片里的FinFET
- 11:00之后再往前发展还是要靠横向微缩
- 11:03国内也在研发3D DRAM
- 11:05类似3D NAND的思路
- 11:06把存储单元垂直堆叠起来
- 11:08平均单元面积能做到比4F²还小
- 11:11而且有持续微缩的潜力
- 11:13只是3D DRAM的技术难度大得多
- 11:15离商业化还有很长的路要走
- 11:18围绕HBM
- 11:18各家厂商也在做不同方向的创新
- 11:21这里面的技术路线非常多
- 11:22我们一个个说
- 11:24三星的zHBM想把封装从2.5D推进到3D
- 11:27现在的HBM堆叠在XPU旁边
- 11:30通过中介层连接
- 11:31zHBM要把HBM堆叠直接放在XPU的上面
- 11:35进一步缩短通信距离,提升带宽
- 11:37问题也很明显,下面的XPU发热量很大
- 11:41上面的DRAM芯片能不能在高温下稳定工作
- 11:43是个很大的疑问
- 11:45三星打算用晶圆对晶圆的混合键合
- 11:48芯片之间没有缝隙
- 11:49散热会好一些
- 11:50但混合键合的良率和成本能不能支撑大规模量产
- 11:54现在还不好说
- 11:56NVHBM是英伟达主导的定制化HBM
- 11:59它的基底芯片由英伟达设计
- 12:01台积电生产
- 12:02把内存控制器从XPU移到HBM的基底芯片上
- 12:05可以减小XPU的芯片面积
- 12:07降低成本
- 12:08或者省出面积放更多计算单元
- 12:11同时还能提升带宽、降低功耗
- 12:13英伟达在推动NVHBM走向开放
- 12:16一方面标准化实现方式
- 12:17让多家存储厂商都能供货
- 12:20另一方面通过NVLink Fusion让其他厂商的加速器也能使用
- 12:24亚马逊的安纳普尔纳实验室(Annapurna Labs)已经宣布合作
- 12:27和标准HBM相比
- 12:28NVHBM会压缩存储厂商的价值空间
- 12:31原来由存储厂商设计的基底芯片
- 12:33现在变成英伟达设计、晶圆厂代工
- 12:36存储厂商的差异化空间会被收窄
- 12:38英特尔也有两个DRAM相关的技术路线
- 12:41XBM和ZAM
- 12:43XBM全称是交叉批次内存(cross-batch memory)
- 12:45根据专利披露
- 12:46它用后端工艺
- 12:48也就是后道光刻和薄膜晶体管来做DRAM单元
- 12:51传统DRAM的单元在前道工艺制作
- 12:54后道只做金属连线
- 12:56XBM把存储单元做在后道的金属层之间
- 12:59这样DRAM单元和逻辑电路可以集成在同一块硅片上
- 13:03也让它成为内存内计算的潜在候选
- 13:05目前公开的细节还不多
- 13:07还很难判断这项技术的量产前景
- 13:09以及谁更适合生产
- 13:11ZAM全称是Z角内存(Z-angle memory)
- 13:13是封装层面的创新
- 13:14把堆叠里的DRAM芯片旋转90度横向排列
- 13:17芯片之间的垂直缝隙可以提升散热效率
- 13:20英特尔的合作伙伴、软银的全资子公司SAIMEMORY表示
- 13:24DRAM芯片还是向存储厂商采购
- 13:27他们主要做独特的封装和基底设计
- 13:29旋转之后芯片和基底的物理连接难度很高
- 13:32如何实现数据传输是核心挑战
- 13:35预计2029财年实现实用化
- 13:37高通的高带宽计算(HBC)走的是性价比路线
- 13:40它不用CoWoS先进封装,改用传统封装
- 13:43性能上做一些妥协
- 13:45但是省去了中介层和2.5D有机基板的高昂成本
- 13:48同时采用LPDDR来降低功耗
- 13:51第一代产品预计2027财年出货
- 13:53第二代2028年推出
- 13:55除了芯片和封装
- 13:56DRAM的模块形态也在创新
- 13:58MRDIMM、SOCAMM2、LPCAMM2都是这方面的代表
- 14:02MRDIMM和传统服务器用的RDIMM物理尺寸一致
- 14:05只是在模块上增加了更多接口芯片
- 14:08来提升带宽
- 14:09SOCAMM2的改动更大
- 14:11模块的外形和尺寸都和传统DIMM不同
- 14:13它支持LPDDR颗粒
- 14:15数据总线宽度从64位翻倍到128位
- 14:18高度更低
- 14:19既能降低功耗、提升单模块带宽
- 14:22还能改善服务器内部的风道和散热
- 14:25这里补充一下
- 14:26第一代SOCAMM是英伟达的专有试验版本
- 14:29SOCAMM2已经由JEDEC正式发布为行业标准
- 14:32它最先由英伟达的Vera CPU采用
- 14:35AMD的Verano CPU也会跟进支持
- 14:38LPCAMM2是面向AI笔记本的对应版本
- 14:41同样由JEDEC标准化
- 14:42早期的LPCAMM原型是三星主导的
- 14:45这三类模块都对应架构里的G2层级
- 14:48还有内存内计算(PIM)
- 14:49有时候也叫内存计算(CIM)
- 14:52它的思路是把逻辑电路和内存电路做在同一块芯片里
- 14:55直接在内存内部完成计算
- 14:57从根源上解决数据搬运的瓶颈
- 15:00这个思路和经典的冯诺依曼(John von Neumann)架构完全相反
- 15:03冯诺依曼体系是计算和存储分离
- 15:05PIM是把两者融合在一起
- 15:08存储厂商已经研究了很多年
- 15:10也提出了不少实现方式
- 15:11比如三星就在HBM里加入可编程计算单元
- 15:15但实际落地非常有限
- 15:16因为它需要处理器、软件、网络整个系统全部重新设计
- 15:20才能发挥出全部潜力
- 15:22而且现在的产业链已经形成了逻辑和存储分开制造的格局
- 15:27各自都有极大的规模和极高的效率
- 15:29全链条改造的成本太高
- 15:31接下来是存储级内存(SCM)
- 15:34它不是特指某一种技术
- 15:35而是所有性能介于DRAM和NAND之间的技术的统称
- 15:39大概对应架构里G2层级低端到G3层级高端的范围
- 15:44一类是原理完全不同的新兴存储
- 15:46比如磁阻存储器(MRAM)、相变存储器(PCM)、阻变存储器(RRAM)
- 15:52英特尔之前推出的3D XPoint就属于PCM技术
- 15:55这类技术的存储原理和DRAM、NAND有本质区别
- 15:59不过目前量产规模都不大
- 16:01另一类是增强型NAND
- 16:02比如Z-NAND、XL-FLASH
- 16:05通过搭配DRAM或者SRAM缓存
- 16:07或者采用SLC、MLC颗粒
- 16:09让NAND的延迟、IOPS更接近DRAM的水平
- 16:13这里稍微解释一下NAND颗粒的区别
- 16:15SLC也就是单层单元
- 16:17每个单元存1比特
- 16:19速度最快、寿命最长
- 16:20但容量最小、成本最高
- 16:22MLC也就是多层单元
- 16:24每个单元存2比特
- 16:25各方面比较均衡
- 16:27TLC也就是三层单元
- 16:29每个单元存3比特,是目前的主流
- 16:31容量和成本平衡得最好
- 16:33QLC也就是四层单元
- 16:35每个单元存4比特,容量最大成本最低
- 16:38但速度和寿命差一些
- 16:40铠侠的XL-FLASH采用SLC和MLC颗粒
- 16:44其GP系列SSD目前能做到千万级IOPS
- 16:47明年目标是上亿级
- 16:49三星的Z-NAND做成Z-SSD产品
- 16:52主打超低延迟
- 16:53还有厂商用伪SLC,也就是pSLC模式
- 16:57就是把TLC颗粒当SLC用
- 17:00牺牲容量换取更高的性能和寿命
- 17:02因为TLC是目前量产规模最大、经济性最好的工艺
- 17:06用pSLC模式可以享受规模效应的同时获得接近SLC的性能
- 17:11美光的XTR SSD就是这种方案
- 17:14铠侠自己有一个很清晰的产品划分
- 17:16不同的NAND技术对应AI推理的不同场景
- 17:19XL-FLASH对应Storage Next的G2.6层级
- 17:22TLC颗粒对应CMX的G3.5层级
- 17:26QLC颗粒对应G4层级的大容量存储
- 17:29NAND领域还有两个值得注意的方向
- 17:31一个是高带宽闪存(HBF)
- 17:33由闪迪和SK海力士主导
- 17:36目标是用NAND做到接近HBM的带宽
- 17:39同时拥有更低的成本和更大的容量
- 17:41如果放到架构层级里
- 17:42大概可以算作G1.5层级
- 17:45NAND本来比DRAM低一到两个层级
- 17:47要直接放到HBM旁边作为补充
- 17:50技术跨度非常大,门槛很高
- 17:52另一个是zNAND-O
- 17:53这是三星面向端侧AI推出的技术
- 17:56它采用TLC颗粒来保证大容量
- 17:58封装方式类似HBM
- 18:00先把NAND芯片堆叠起来
- 18:02再用先进封装技术和处理器紧密连接
- 18:05硬件层级的最下面两层是HDD和磁带
- 18:08HDD适合存储冷数据
- 18:09也就是大容量、低成本、访问频率低的数据
- 18:12对应架构里的G4层级
- 18:14现在KV缓存的规模越来越大
- 18:16非关键数据逐步在向下沉淀
- 18:18HDD的需求也在增长
- 18:20磁带本来只用于数据归档
- 18:22处在硬件层级的最底端
- 18:24但是现在全球数据存储需求暴涨
- 18:26NAND和HDD的产能都跟不上
- 18:28所以连磁带的需求都出现了增长
- 18:31最后
- 18:32伯恩斯坦在这份报告里对全球主要存储公司给出了评级和目标价
- 18:36这里说明一下
- 18:37伯恩斯坦的评级体系里
- 18:38跑赢大盘也就是Outperform的定义
- 18:41是未来12个月预期超越对应市场指数15个百分点以上
- 18:45跑输大盘也就是Underperform
- 18:47则是落后指数15个百分点以上
- 18:50具体来看,三星电子评级为跑赢大盘
- 18:53目标价44万韩元
- 18:54SK海力士也是跑赢大盘
- 18:56目标价330万韩元
- 18:58美光跑赢大盘,目标价1300美元
- 19:01铠侠评级为跑输大盘,目标价4万日元
- 19:05闪迪跑赢大盘,目标价3000美元
- 19:07希捷跑赢大盘,目标价1350美元
- 19:10西部数据跑赢大盘,目标价770美元
- 19:13这里提醒一下
- 19:14以上均为伯恩斯坦的预测数据
- 19:16仅作产业研究参考
- 19:17不构成任何投资建议
- 19:19总的来说呢
- 19:20AI内存的技术混战还在继续
- 19:22新的技术路线还在不断冒出来
- 19:24从架构层级看
- 19:25整个存储体系正在从以CPU为中心转向以GPU为中心
- 19:30每一层都在被重新定义
- 19:32从硬件介质看
- 19:33DRAM、NAND、SRAM各自的边界也在变得模糊
- 19:36大家都在往中间地带渗透
- 19:38对从业者来说
- 19:39这可能是存储行业过去二十年最热闹的时期
- 19:42至于哪条路线最终能跑出来
- 19:44现在下结论还为时过早
- 19:46感谢收看,我们下期再见
About this transcript
This page contains the full transcript of AI内存的技术混战 | 伯恩斯坦研究报告 | AI内存 | HBM | CXL | DRAM | NAND | KV缓存 | 存储器产业 | AI算力底层硬件 | 存储级内存 | 人工智能推理 by 最佳拍档, generated from the public captions YouTube serves with the video. The transcript has 510 words across 489 segments, with the original timestamps preserved so you can click any line to jump to that moment in the embedded player.
What you can do with it
Use the transcript to take notes, quote the speaker, build a study guide, generate a summary with ChatGPT or Claude via the YouTube Summary tool, or export it as a timed subtitle file with YouTube to SRT. You can also re-open it in the transcriber to translate the transcript into 100+ languages.
Free YouTube transcript tool
YouTube2Text is a free YouTube transcript generator — no signup, no daily limit. Paste any YouTube link and get the full transcript instantly, with timestamps, click-to-jump, translation to 100+ languages, AI prompts for ChatGPT, Claude, and Gemini, and exports to TXT, SRT, VTT, or Markdown.