OC
把几台电脑的 GPU 拼起来:Mesh LLM 想做一个去中心化模型服务
科技 · 2026-07-12 · 阅读 25

把几台电脑的 GPU 拼起来:Mesh LLM 想做一个去中心化模型服务

分类:AI 基础设施 Tag:Mesh LLM、Iroh、分布式推理、本地 AI、GPU、开源 作者:周白|OC 编辑

作者 周白 周白

Iroh 官方博客 介绍,Mesh LLM 可以把多台设备上的 GPU 和内存组织成一个网络,并向应用提供 OpenAI 兼容接口。请求可以在本机执行、转给已经加载模型的节点,也可以把过大的模型按层拆到多台机器上运行。

一句话结论:Mesh LLM 不是把闲置显卡自动变成云厂商,而是尝试降低多机本地推理的网络和调度门槛,适合控制权比极致速度更重要的场景。

它最吸引人的使用方式很简单:应用仍然访问 localhost:9337/v1,不用知道模型实际跑在哪一台电脑上。节点之间使用 Iroh 提供的身份、NAT 穿透、QUIC 加密连接和中继回退,不要求每台机器都有公网 IP。

对于一张显卡放不下的模型,Mesh LLM 的 Skippy 模式会按层切分。比如前 16 层在第一台机器,后 16 层在第二台,激活值沿管线传递。这解决的是“能不能运行”,不保证“比单机更快”。每生成一个 token 都可能跨网络传递数据,普通 Wi-Fi、跨城市网络和性能不一致的节点都会增加等待。

模型按层切分并通过QUIC在节点间传递

这也是读者最容易产生的疑问:几台低端显卡相加,能不能等于一台高端卡?内存容量可以在一定条件下相加,带宽和延迟却不会消失。模型如果能完整放进一台机器,拆分通常反而更慢;只有模型过大、设备本来就存在、数据又不能交给外部 API 时,多机方案才可能值得。

Mesh LLM 还允许加入公共网络,这就带来另一层问题:模型权重、提示词、节点信誉和计费如何处理。传输加密只能保护链路,不能保证执行节点不会看到它必须计算的数据。敏感业务更适合使用明确控制成员的私有 mesh,而不是把“点对点”误解成天然隐私。

另一个容易忽略的问题是故障。单机推理失败通常只需要重启一个进程;模型被拆成三段后,任何节点掉线、升温降频或网络抖动都会拖住整条生成管线。系统必须知道怎样重新分配层、恢复上下文和避免已经输出一半的请求重新计费。官方文章讲清了传输协议,但生产环境真正难的是这些不漂亮的恢复细节。

开发者评估时不妨先做三个测试:同一模型单机和拆分后的首 token 延迟;持续生成时最慢节点对整体速度的影响;拔掉一台机器后请求能否恢复。若目标只是多用户共享几台显卡,把完整模型复制到不同节点再做路由,可能比按层切分更简单。只有单机确实放不下模型时,流水线拆分才是核心能力。

关键事实

  • Mesh LLM 提供 OpenAI 兼容 API,可本地、远程路由或按层拆分模型。
  • Iroh 负责节点身份、NAT 穿透、QUIC 连接和中继回退。
  • 官方目录称支持 40 多个模型,从小模型到 235B MoE 模型。
  • 项目仍处早期阶段,公开材料没有证明它在常见网络上优于成熟单机或数据中心方案。

OC 判断

Mesh LLM 的价值不是创造免费算力,而是把“办公室里已有的几台机器”变成可编程资源池。它最该证明的是故障恢复、延迟、吞吐和安全边界,而不是模型数量。

为什么重要

  • 对开发者:现有 OpenAI 客户端可以较低成本接入,但需要实际测量首 token 延迟和吞吐。
  • 对企业:私有 mesh 有助于保留数据控制权,也意味着运维和节点信任责任回到自己手中。
  • 对用户:分布式不等于更快,也不自动等于更私密。

参考来源

相关阅读

基于标题、摘要和正文内容自动匹配。

更多科技

评论

围绕这篇文章补充信息、提出问题或分享观察。

0
暂无评论。

发表评论

继续看看 OC 用户围绕这个话题说了什么、做了什么。

相关碎碎念

更多

正在做OC产品频道,支持独立开发者提交自己的app,网站,在OC得到宣传和外链。基础功能已经实现,还有一堆在路上。我们独特的是有一个能力让你把产品的用户写的文章视频也可以列在你的产品页下方。方便更多用户了解,这不是想替代你自己的产品页面,而是帮你把做每个产品页各种复杂的互动都自动化,这个产品页还是可以导流到你自己的产品页的

tinyfool 1 2

最近越来越多思考,我们跟agent的关系,比如我最近用blender mcp很多,基本上我算是会用blender的,但是老记不住很多热键,以前我可以做很复杂的模型,但是要是不是的去查blender的操作热键。现在我完全不参与模型的建模,只让codex帮我生成。 但是我还是在查blender的热键,我现在需要的是numpad .这样聚焦到一个对象的方法,我需要的是numpad /这样的方法来把除了选中的对象,其他都隐藏的热键。 换言之,我现在需要高效的人工视觉复检blender mcp的成果,这是我对自己目前blender能力的需求了。

tinyfool 2 0

其实爬虫要是行为正常,也无所谓,现在 OC 每天就不断的被一些不正常的AI爬虫爬,我也懒得去识别清理,但是把我的访问报表搞得很乱,期待google分析他们自己能识别吧 这个新闻用的方法是鼠标行为 https://ourcoders.com/tech/show/tech-20260821-001-11/ 我在google分析看的时候,是选择自然流量,效果差不多,另外 OC 的阅读量统计,都是至少停留 5 秒以上才算的,所以,也不会受这些流量影响,但是挺烦人啊

tinyfool 0 0

相关帖子

更多

你们的Codex额度提前耗完了没?戒断反应如何?

<p>我在第三天就消耗了只剩1%,忍了一天,然后今天干脆用这最后的1%,开着5.6 Sol 极高 强推我一个提示词笔记本应用的功能落地。最终用时3小时,居然还是跑完了。但是现在还是出现一些戒断反应,感觉啥也做不了,就无精打采的,困。</p> <p>我做了一个Prompt Notebook,专门用来收藏或者记录自己手搓的生图提示词。带Chrome一键收藏插件。支持AI优化提示词。支持提示词中提取常用字段作为提示词百科词汇。也自带生图功能用来测提示词。但是要搭配Cloudflare R2+Worker的图床。</p> <p>今天主要是做一个AI模特的资产库。将常用的AI模特固定下来,进行身份设定,以及模特的一些角色定妆图。之后生图可以直接调用AI模特自动作为垫图。</p> <p>这是AI模特资产库的界面: <img src="/upload/thread/202608/42b5f73e-938f-45de-b74e-da69da9d72a8.webp" alt="1bb0d28b-c7dd-4327-bafa-26b60323cbed" /> 这是主界面的提示词瀑布流,支持关键词或标签搜索: <img src="/upload/thread/202608/3e15b6e7-345f-48b4-aeff-1bbd89afe9d3.webp" alt="ab998e2f-9ccc-4173-832f-223aa6c6fa81" /> 这是提示词笔记的预览界面,可以复制提示词,分享提示词,点击分享还有分享短链:(https://prompt.jintao.co.uk/share/20260806LfsmY) <img src="/upload/thread/202608/bab31972-0468-4582-b873-6309233254a6.webp" alt="20260806-201213" /> 可惜现在没额度了,我又不想换模型折腾。现在还有些界面细节和小功能需要落地完善,可能还要虫子要抓。弄好了,打算放GitHub开源。</p> <p>有朋友想试试的么?</p>

shynloc 2 4