2.8 万亿参数 Kimi K3 塞进 Mac:能跑,但一分钟一个 Token 算不算本地 AI
作者:林岚|OC 开发者生态编辑
作者:林岚|OC 开发者生态编辑
据开源项目 deltafin 的演示,开发者已经能在 Apple Silicon 设备上加载并运行 Kimi K3。这个模型共有 2.8 万亿参数,每次推理激活约 1042 亿参数;完整模式需要约 1.7TB 存储,演示速度大致在每个 token 60 至 76 秒。
一句话结论:deltafin 证明消费级 Mac 可以作为超大模型的外存推理平台,但一分钟左右生成一个 token,更像一次系统边界实验,而不是能替代云端服务的本地助手。
Kimi K3 使用混合专家架构,共有 896 个专家,每次选择其中 16 个。它不需要每个 token 都计算全部 2.8 万亿参数,但模型权重仍要被保存和按需读取。Mac 的统一内存装不下完整权重,deltafin 因此把 SSD 当成更慢的扩展内存,流式读取当前计算需要的部分。
完整模式要下载约 1.7TB 数据,预计耗时 5 到 10 小时。流式模式可以先准备约 215GB 缓存、约半小时开始运行,代价是推理过程中等待更多远程或本地数据。问题不在模型“有没有启动”,而在存储带宽、随机读取和内存换页会把每一步计算拖多慢。

一分钟一个 token 意味着生成一小段回复可能要等数十分钟。它仍有工程价值:开发者可以验证模型格式、路由逻辑和极限内存方案,也能研究超大 MoE 模型在低成本硬件上的数据调度。但把它称为高效本地 AI,会混淆“理论可运行”和“实际可使用”。
真正可能落地的是这些技术的缩小版。更激进的量化、更小的专家集合、更好的预取和本地 NVMe 优化,都能把经验迁移到几十亿或几百亿参数模型。先别急着激动,最大的模型能在笔记本上吐出 token,不代表最大的模型就是笔记本的正确选择。
关键事实
- 来源:deltafin 仓库、Kimi K3 官方仓库与论文
- 涉及项目:deltafin、Kimi K3
- 核心技术:混合专家模型、Apple Silicon 统一内存、SSD 流式加载、量化
- 关键数字:2.8 万亿总参数、约 1042 亿激活参数、完整权重约 1.7TB、每 token 约 60 至 76 秒
OC 判断
这是漂亮的工程证明,不是性能胜利。它把超大模型推理的瓶颈从“算不动”改成“搬不动”:即便稀疏计算减少乘法,权重仍要在存储和内存之间移动。对多数本地应用,选择更小且能持续每秒生成多个 token 的模型,比加载参数最多的模型更有价值。
为什么重要
- 对开发者:项目提供了研究外存推理和 MoE 路由的真实样本。
- 对硬件用户:需要数百 GB 到 TB 级存储,且运行速度不适合日常对话。
- 对模型厂商:参数规模与可部署性是两套指标,发布时应同时披露。
评论
围绕这篇文章补充信息、提出问题或分享观察。