OC
三星把乘加单元塞进 LPDDR5X,PIM 省的是数据搬运,不是所有计算
科技 · 2026-08-30 · 芯片与基础设施 · 阅读 1

三星把乘加单元塞进 LPDDR5X,PIM 省的是数据搬运,不是所有计算

三星在 Hot Chips 2026 展示 LPDDR5X-PIM,把乘加单元放进 LPDDR5X 的每个内存 bank。按 Chips and Cheese 对演示资料的拆解,16 个 bank 可共同利用约 614 GB/s 的片内带宽,整包低精度计算峰值约 2.4 TOPS。

作者:陈墨|OC 产业与资本编辑

三星在 Hot Chips 2026 展示 LPDDR5X-PIM,把乘加单元放进 LPDDR5X 的每个内存 bank。按 Chips and Cheese 对演示资料的拆解,16 个 bank 可共同利用约 614 GB/s 的片内带宽,整包低精度计算峰值约 2.4 TOPS。

一句话结论:LPDDR5X-PIM 的优势是避免把权重反复搬出内存,而不是把普通内存瞬间变成通用 AI 加速器;真正难题在缓存一致性、并发和操作系统调度。

普通 DRAM 内部本来就有多个 bank,但外部总线限制了处理器能同时取走多少数据。三星在每个 bank 旁放置 PIM 模块,让乘加操作直接读取本地权重。16 个 bank 并行时能利用远高于外部接口的内部带宽,特别适合“权重留在原地、激活广播到各 bank”的矩阵向量计算。

需要谨慎理解两个数字。614 GB/s 是片内各 bank 可利用的聚合带宽,不是主机能从芯片外部持续读出的内存带宽;2.4 TOPS 是特定低精度格式下的峰值,不是完整模型性能。单芯片算力并不高,堆叠更多芯片能增加总吞吐,也会增加容量、成本和软件协调负担。这些数值来自技术演示与媒体分析,不是第三方产品基准。

LPDDR5X-PIM 的收益与系统软件代价对照

三星为了兼容标准内存控制器,复用了特殊行地址和读写命令来切换 PIM 模式。巧妙之处在于不必立刻重做整套外部协议,麻烦也来自这里:进入 PIM 模式后,读命令可能触发计算,写命令可能改写 PIM 寄存器。另一个线程若把它当普通内存访问,就可能制造错误结果。

缓存同样会破坏假设。CPU 缓存可能吞掉原本用于触发 PIM 的访问,PIM 在 DRAM 内部改写数据时,CPU 缓存又未必知情。把 PIM 区域标成不可缓存可以绕开一致性,但会牺牲现代处理器依赖的缓存、预取和乱序执行收益。抢占一个 PIM 任务,还可能要求保存多个 bank 的指令、源数据、缩放因子和累加状态。

因此,PIM 的商业化不只是三星卖出一颗新内存。处理器指令、内存控制器、一致性协议、操作系统和编译器都要决定怎样安全调度它。最适合的早期场景可能是受控的加速设备或专用推理系统,而不是任意笔记本应用透明获得加速。

关键事实

  • 来源:三星 Hot Chips 2026 路线展示、Chips and Cheese 技术分析
  • 核心设计:LPDDR5X 的每个 bank 配置 PIM 乘加模块
  • 演示数据:约 614 GB/s 片内聚合带宽、约 2.4 TOPS 包级低精度峰值
  • 主要限制:模式切换、缓存一致性、多线程与上下文切换

OC 判断

PIM 的方向有吸引力,因为 AI 推理越来越受数据搬运而非算术本身限制。但“靠近内存计算”会把原本清晰的处理器—内存边界打散。账最后会回到完整系统:如果为了 2.4 TOPS 牺牲缓存、并发和通用性,单颗芯片的漂亮带宽还不足以形成产品价值。

为什么重要

  • 对开发者:PIM 需要新的运行时与内存模型,不能当成普通 SIMD 自动替换。
  • 对硬件厂商:标准接口兼容降低导入门槛,却没有消除一致性与调度成本。
  • 对企业:评估时应看端到端模型吞吐、能耗和软件成熟度,而非峰值数字。

参考来源

评论

围绕这篇文章补充信息、提出问题或分享观察。

0
暂无评论。

发表评论

继续看看 OC 用户围绕这个话题说了什么、做了什么。

相关帖子

更多

你们的Codex额度提前耗完了没?戒断反应如何?

<p>我在第三天就消耗了只剩1%,忍了一天,然后今天干脆用这最后的1%,开着5.6 Sol 极高 强推我一个提示词笔记本应用的功能落地。最终用时3小时,居然还是跑完了。但是现在还是出现一些戒断反应,感觉啥也做不了,就无精打采的,困。</p> <p>我做了一个Prompt Notebook,专门用来收藏或者记录自己手搓的生图提示词。带Chrome一键收藏插件。支持AI优化提示词。支持提示词中提取常用字段作为提示词百科词汇。也自带生图功能用来测提示词。但是要搭配Cloudflare R2+Worker的图床。</p> <p>今天主要是做一个AI模特的资产库。将常用的AI模特固定下来,进行身份设定,以及模特的一些角色定妆图。之后生图可以直接调用AI模特自动作为垫图。</p> <p>这是AI模特资产库的界面: <img src="/upload/thread/202608/42b5f73e-938f-45de-b74e-da69da9d72a8.webp" alt="1bb0d28b-c7dd-4327-bafa-26b60323cbed" /> 这是主界面的提示词瀑布流,支持关键词或标签搜索: <img src="/upload/thread/202608/3e15b6e7-345f-48b4-aeff-1bbd89afe9d3.webp" alt="ab998e2f-9ccc-4173-832f-223aa6c6fa81" /> 这是提示词笔记的预览界面,可以复制提示词,分享提示词,点击分享还有分享短链:(https://prompt.jintao.co.uk/share/20260806LfsmY) <img src="/upload/thread/202608/bab31972-0468-4582-b873-6309233254a6.webp" alt="20260806-201213" /> 可惜现在没额度了,我又不想换模型折腾。现在还有些界面细节和小功能需要落地完善,可能还要虫子要抓。弄好了,打算放GitHub开源。</p> <p>有朋友想试试的么?</p>

shynloc 2 4