14MB 的 Needle 2 想在设备端调用工具:45M 参数够不够做 Agent
作者:林岚|OC 开发者生态编辑
作者:林岚|OC 开发者生态编辑
Cactus 发布 Needle 2,一个专门处理工具调用、设备操作和结构化提取的 4500 万参数开放模型。整个模型与运行引擎封装成 14MB 二进制,完整会话内存上限约 28MB,以 Apache 2.0 发布权重。
一句话结论:Needle 2 之所以能缩到 14MB,不是把通用聊天能力压缩了几百倍,而是把任务重新定义成“从一句话选择函数和参数”;对灯、手表和传感器足够,对开放问答、复杂规划和世界知识则不是同一个产品。
项目的核心判断是,设备已经把能力暴露成带类型参数的函数。用户说“把客厅灯调暗到一半”,模型只需要选择正确函数并填入房间和亮度,不必写长文章。输出还受字节级语法约束,只能形成合法调用结构;无法处理的请求返回空调用和置信度,由产品重问或交给云端。
4500 万参数经过从训练阶段开始的 CQ2-bit 量化,而不是训练完成后再强行压到 2-bit。Cactus 称,这让二进制保持 14MB、会话 RAM 约 28MB,并能在 Raspberry Pi 5 上达到每秒约 500 个解码 token,在部分低价手机上达到每秒 300 至 700 个。

速度数字需要结合输出任务理解。工具调用通常只有几十个结构化 token,而且语法可以提前排除大量不合法词表项;这与生成长篇自然语言的吞吐不可直接比较。项目还采用 256 token 滑动窗口,并把系统提示和工具定义固定保存,以换取可预测内存,但长对话细节会被逐步淘汰。
官方比较显示,Needle 在若干移动操作和函数调用基准上可与大 5 至 70 倍的小模型互有胜负。但对比存在两种不对称:竞争模型以较高精度运行,却承担通用聊天和知识能力;Needle 则针对设备调用专门训练。公司公开承认这种偏差,因此结论只能限定为“在极小设备预算下执行特定工具调用”。
厂商称 Needle 已可用于生产,并提到 Pebble 的 Index 01 应用。开发者仍需要在自己的函数集合、口音、歧义表达和危险操作上重测。一个灯控调用错了可能只是体验问题,门锁、汽车和医疗设备调用错了就是安全事件。
关键事实
- Needle 2 有 4500 万参数,二进制 14MB,会话 RAM 上限约 28MB
- 模型从训练阶段适配约 2-bit 的 Cactus Quants 压缩
- 官方称 Raspberry Pi 5 解码速度超过每秒 500 token
- 输出受结构化语法约束,并可按置信度升级到云端
OC 判断
Needle 2 最聪明的地方不是量化,而是拒绝做通用助手。把任务缩窄后,小模型才能在廉价设备上可靠工作。真正的生产门槛将是拒绝和升级策略,而不是再多拿几个函数调用基准第一。
为什么重要
- 对嵌入式开发者:极小模型让离线、低延迟和固定内存成为现实选项。
- 对产品团队:必须为低置信度和危险函数建立云端升级或人工确认。
- 对用户:本地运行减少数据外传,但不会自动避免错误设备操作。
评论
围绕这篇文章补充信息、提出问题或分享观察。