104GB 模型塞进小内存 Mac 不是魔法,而是把内存墙换成 SSD 账单
开源项目 slotstream 尝试在 Apple Silicon Mac 上运行 104GB 的 Qwen3.8-Flash-Next 四位量化模型。它不要求全部权重常驻内存,而是保留稠密主干,把每个 token 真正用到的专家权重从 SSD 读取,从而把计划中的最低内存门槛压到 8.1GB。
作者:林岚|OC 开发者生态编辑
开源项目 slotstream 尝试在 Apple Silicon Mac 上运行 104GB 的 Qwen3.8-Flash-Next 四位量化模型。它不要求全部权重常驻内存,而是保留稠密主干,把每个 token 真正用到的专家权重从 SSD 读取,从而把计划中的最低内存门槛压到 8.1GB。
一句话结论:slotstream 没有让 104GB 消失,它只是把容量问题从内存转移到存储空间、SSD 带宽、首 token 延迟和硬盘寿命;这是有价值的系统取舍,不是无代价突破。
项目利用 MoE 的稀疏性。模型拥有 512 个专家,每个 token 只激活其中 10 个;约 3.8GB 的稠密主干常驻内存,68GB 路由专家和 32GB n-gram 表按需读取。实现使用 pread 和跨层共享的固定专家池,避免把全部专家映射进统一内存。权重分成 24 个文件,支持断点下载和 SHA-256 校验。
目前真正测量的硬件只有一台 48GB M5 Pro:预热后约 12 token/秒,首 token 约 3 秒,峰值内存约 32GB。其他 8GB、16GB 和 24GB 配置是项目估算,不能写成已经验证。模型文件约占 110GB,可用磁盘最好至少 512GB;长提示的 prefill 仍慢,低内存机器更容易受 SSD 与缓存抖动影响。

slotstream 提供兼容 Ollama/OpenAI 风格的聊天与生成端点,默认在 11434 端口服务,但并非完整替代。工具调用、图片、JSON Schema、logprobs 等功能不支持并返回 400;上下文上限为 32768。它还用前缀缓存缩短多轮对话,项目示例中第八轮从 25.8 秒降到约 6 秒,但缓存路径不保证逐 bit 相同,需要可复现结果时应关闭。
真正适合它的场景,是偶尔在本地做高能力文本推理、不能把数据发到云端、又愿意等更久的个人工作站。高并发服务、超长上下文或高频交互仍更适合足够内存或云端 GPU。把模型“跑起来”和把它“稳定服务”是两件事。
关键事实
- 104GB 是量化权重规模,不是运行时内存需求;专家按 token 从 SSD 流式读取。
- 48GB M5 Pro 是当前唯一实测机器,约 12 token/秒;低内存结果仍属估算。
- 项目需要约 110GB 存储,并只实现部分 Ollama/OpenAI 接口。
OC 判断
本地模型的新空间不一定来自更小模型,也可能来自更聪明的数据移动。slotstream 的价值是把硬件限制显式变成可选择的性能曲线。开发者应测自己的提示长度、会话频率、SSD 写读负载和功能依赖,而不是只看“8GB 可运行”。
为什么重要
- 对个人开发者:旧 Mac 可能获得更大模型的低频本地能力。
- 对工具作者:稀疏专家与前缀缓存为端侧推理提供新的系统设计。
- 对采购者:内存节省会转化为存储、延迟与兼容性成本。
评论
围绕这篇文章补充信息、提出问题或分享观察。