OC
104GB 模型塞进小内存 Mac 不是魔法,而是把内存墙换成 SSD 账单
科技 · 2026-09-03 · AI 与开发者生态 · 阅读 0

104GB 模型塞进小内存 Mac 不是魔法,而是把内存墙换成 SSD 账单

开源项目 slotstream 尝试在 Apple Silicon Mac 上运行 104GB 的 Qwen3.8-Flash-Next 四位量化模型。它不要求全部权重常驻内存,而是保留稠密主干,把每个 token 真正用到的专家权重从 SSD 读取,从而把计划中的最低内存门槛压到 8.1GB。

作者:林岚|OC 开发者生态编辑

开源项目 slotstream 尝试在 Apple Silicon Mac 上运行 104GB 的 Qwen3.8-Flash-Next 四位量化模型。它不要求全部权重常驻内存,而是保留稠密主干,把每个 token 真正用到的专家权重从 SSD 读取,从而把计划中的最低内存门槛压到 8.1GB。

一句话结论:slotstream 没有让 104GB 消失,它只是把容量问题从内存转移到存储空间、SSD 带宽、首 token 延迟和硬盘寿命;这是有价值的系统取舍,不是无代价突破。

项目利用 MoE 的稀疏性。模型拥有 512 个专家,每个 token 只激活其中 10 个;约 3.8GB 的稠密主干常驻内存,68GB 路由专家和 32GB n-gram 表按需读取。实现使用 pread 和跨层共享的固定专家池,避免把全部专家映射进统一内存。权重分成 24 个文件,支持断点下载和 SHA-256 校验。

目前真正测量的硬件只有一台 48GB M5 Pro:预热后约 12 token/秒,首 token 约 3 秒,峰值内存约 32GB。其他 8GB、16GB 和 24GB 配置是项目估算,不能写成已经验证。模型文件约占 110GB,可用磁盘最好至少 512GB;长提示的 prefill 仍慢,低内存机器更容易受 SSD 与缓存抖动影响。

容量被分解为常驻主干、按需专家、前缀缓存和磁盘读取

slotstream 提供兼容 Ollama/OpenAI 风格的聊天与生成端点,默认在 11434 端口服务,但并非完整替代。工具调用、图片、JSON Schema、logprobs 等功能不支持并返回 400;上下文上限为 32768。它还用前缀缓存缩短多轮对话,项目示例中第八轮从 25.8 秒降到约 6 秒,但缓存路径不保证逐 bit 相同,需要可复现结果时应关闭。

真正适合它的场景,是偶尔在本地做高能力文本推理、不能把数据发到云端、又愿意等更久的个人工作站。高并发服务、超长上下文或高频交互仍更适合足够内存或云端 GPU。把模型“跑起来”和把它“稳定服务”是两件事。

关键事实

  • 104GB 是量化权重规模,不是运行时内存需求;专家按 token 从 SSD 流式读取。
  • 48GB M5 Pro 是当前唯一实测机器,约 12 token/秒;低内存结果仍属估算。
  • 项目需要约 110GB 存储,并只实现部分 Ollama/OpenAI 接口。

OC 判断

本地模型的新空间不一定来自更小模型,也可能来自更聪明的数据移动。slotstream 的价值是把硬件限制显式变成可选择的性能曲线。开发者应测自己的提示长度、会话频率、SSD 写读负载和功能依赖,而不是只看“8GB 可运行”。

为什么重要

  • 对个人开发者:旧 Mac 可能获得更大模型的低频本地能力。
  • 对工具作者:稀疏专家与前缀缓存为端侧推理提供新的系统设计。
  • 对采购者:内存节省会转化为存储、延迟与兼容性成本。

参考来源

相关阅读

基于标题、摘要和正文内容自动匹配。

更多科技

评论

围绕这篇文章补充信息、提出问题或分享观察。

0
暂无评论。

发表评论

继续看看 OC 用户围绕这个话题说了什么、做了什么。

相关碎碎念

更多

帕格尼物语的任务全部打穿,然后开始玩社区创作的地图,这种游戏在建设的时候特别过瘾,建立起稳定的经济模型后也很过瘾,稳定下来观察小人的行为也很过瘾,然后如果没有外部矛盾,比如敌人侵略或者必须找到某种材料,等等的问题,就开始索然无味了。 人生其实也像这样的游戏,我曾经构建过几次自己的稳定架构,然后就索然无味,然后又因为抑郁,崩塌了,我在人生这个游戏最近感觉有有点动力不足,就是因为每次架构彻底崩塌才来重建,十分疲惫

tinyfool 0 1

最近越来越多思考,我们跟agent的关系,比如我最近用blender mcp很多,基本上我算是会用blender的,但是老记不住很多热键,以前我可以做很复杂的模型,但是要是不是的去查blender的操作热键。现在我完全不参与模型的建模,只让codex帮我生成。 但是我还是在查blender的热键,我现在需要的是numpad .这样聚焦到一个对象的方法,我需要的是numpad /这样的方法来把除了选中的对象,其他都隐藏的热键。 换言之,我现在需要高效的人工视觉复检blender mcp的成果,这是我对自己目前blender能力的需求了。

tinyfool 2 0

从第一份程序员职业至今,已经过了 20 年,现在已经不再亲自写代码了,年初看到 Codex/Claude 火爆,又起心动念开始堆代码,只不过现如果自己亲手写的代码,跟 AI 写的代码放在一起,我开始有种耻感涌上来。是到了把关注点挪到像我这种老登程序员的生活上的时候了。

lgn21st 1 1

相关帖子

更多

你们的Codex额度提前耗完了没?戒断反应如何?

<p>我在第三天就消耗了只剩1%,忍了一天,然后今天干脆用这最后的1%,开着5.6 Sol 极高 强推我一个提示词笔记本应用的功能落地。最终用时3小时,居然还是跑完了。但是现在还是出现一些戒断反应,感觉啥也做不了,就无精打采的,困。</p> <p>我做了一个Prompt Notebook,专门用来收藏或者记录自己手搓的生图提示词。带Chrome一键收藏插件。支持AI优化提示词。支持提示词中提取常用字段作为提示词百科词汇。也自带生图功能用来测提示词。但是要搭配Cloudflare R2+Worker的图床。</p> <p>今天主要是做一个AI模特的资产库。将常用的AI模特固定下来,进行身份设定,以及模特的一些角色定妆图。之后生图可以直接调用AI模特自动作为垫图。</p> <p>这是AI模特资产库的界面: <img src="/upload/thread/202608/42b5f73e-938f-45de-b74e-da69da9d72a8.webp" alt="1bb0d28b-c7dd-4327-bafa-26b60323cbed" /> 这是主界面的提示词瀑布流,支持关键词或标签搜索: <img src="/upload/thread/202608/3e15b6e7-345f-48b4-aeff-1bbd89afe9d3.webp" alt="ab998e2f-9ccc-4173-832f-223aa6c6fa81" /> 这是提示词笔记的预览界面,可以复制提示词,分享提示词,点击分享还有分享短链:(https://prompt.jintao.co.uk/share/20260806LfsmY) <img src="/upload/thread/202608/bab31972-0468-4582-b873-6309233254a6.webp" alt="20260806-201213" /> 可惜现在没额度了,我又不想换模型折腾。现在还有些界面细节和小功能需要落地完善,可能还要虫子要抓。弄好了,打算放GitHub开源。</p> <p>有朋友想试试的么?</p>

shynloc 2 4

你为什么不移民?

<p>我是一定要移了,在这里连正常呼吸都不行了。以前正常呼吸指的是言论自由,现在是生物学意义的正常呼吸问题了。</p> <p>你为什么不移民?</p>

tinyfool 740 15