三星把乘加单元塞进 LPDDR5X,PIM 省的是数据搬运,不是所有计算
三星在 Hot Chips 2026 展示 LPDDR5X-PIM,把乘加单元放进 LPDDR5X 的每个内存 bank。按 Chips and Cheese 对演示资料的拆解,16 个 bank 可共同利用约 614 GB/s 的片内带宽,整包低精度计算峰值约 2.4 TOPS。
作者:陈墨|OC 产业与资本编辑
三星在 Hot Chips 2026 展示 LPDDR5X-PIM,把乘加单元放进 LPDDR5X 的每个内存 bank。按 Chips and Cheese 对演示资料的拆解,16 个 bank 可共同利用约 614 GB/s 的片内带宽,整包低精度计算峰值约 2.4 TOPS。
一句话结论:LPDDR5X-PIM 的优势是避免把权重反复搬出内存,而不是把普通内存瞬间变成通用 AI 加速器;真正难题在缓存一致性、并发和操作系统调度。
普通 DRAM 内部本来就有多个 bank,但外部总线限制了处理器能同时取走多少数据。三星在每个 bank 旁放置 PIM 模块,让乘加操作直接读取本地权重。16 个 bank 并行时能利用远高于外部接口的内部带宽,特别适合“权重留在原地、激活广播到各 bank”的矩阵向量计算。
需要谨慎理解两个数字。614 GB/s 是片内各 bank 可利用的聚合带宽,不是主机能从芯片外部持续读出的内存带宽;2.4 TOPS 是特定低精度格式下的峰值,不是完整模型性能。单芯片算力并不高,堆叠更多芯片能增加总吞吐,也会增加容量、成本和软件协调负担。这些数值来自技术演示与媒体分析,不是第三方产品基准。

三星为了兼容标准内存控制器,复用了特殊行地址和读写命令来切换 PIM 模式。巧妙之处在于不必立刻重做整套外部协议,麻烦也来自这里:进入 PIM 模式后,读命令可能触发计算,写命令可能改写 PIM 寄存器。另一个线程若把它当普通内存访问,就可能制造错误结果。
缓存同样会破坏假设。CPU 缓存可能吞掉原本用于触发 PIM 的访问,PIM 在 DRAM 内部改写数据时,CPU 缓存又未必知情。把 PIM 区域标成不可缓存可以绕开一致性,但会牺牲现代处理器依赖的缓存、预取和乱序执行收益。抢占一个 PIM 任务,还可能要求保存多个 bank 的指令、源数据、缩放因子和累加状态。
因此,PIM 的商业化不只是三星卖出一颗新内存。处理器指令、内存控制器、一致性协议、操作系统和编译器都要决定怎样安全调度它。最适合的早期场景可能是受控的加速设备或专用推理系统,而不是任意笔记本应用透明获得加速。
关键事实
- 来源:三星 Hot Chips 2026 路线展示、Chips and Cheese 技术分析
- 核心设计:LPDDR5X 的每个 bank 配置 PIM 乘加模块
- 演示数据:约 614 GB/s 片内聚合带宽、约 2.4 TOPS 包级低精度峰值
- 主要限制:模式切换、缓存一致性、多线程与上下文切换
OC 判断
PIM 的方向有吸引力,因为 AI 推理越来越受数据搬运而非算术本身限制。但“靠近内存计算”会把原本清晰的处理器—内存边界打散。账最后会回到完整系统:如果为了 2.4 TOPS 牺牲缓存、并发和通用性,单颗芯片的漂亮带宽还不足以形成产品价值。
为什么重要
- 对开发者:PIM 需要新的运行时与内存模型,不能当成普通 SIMD 自动替换。
- 对硬件厂商:标准接口兼容降低导入门槛,却没有消除一致性与调度成本。
- 对企业:评估时应看端到端模型吞吐、能耗和软件成熟度,而非峰值数字。
评论
围绕这篇文章补充信息、提出问题或分享观察。