一个能跑在手机、手表、智能家居和机器人上的14MB模型,听起来像把大象塞进冰箱。但Needle确实做到了——它把Gemini的工具调用能力蒸馏进了一个14MB的模型里,GitHub上已收获10202颗星,Apache-2.0协议意味着你可以放心商用。这个体积意味着什么?一个普通的手机App安装包动辄几十MB,而Needle整个模型才14MB,塞进任何端侧设备都毫无压力。
蒸馏Gemini的工具调用,不只是缩小版Gemma

Needle的核心不是把Gemma或Gemini压缩一遍,而是专门蒸馏了工具调用(function calling)能力。HackerNews上的发布帖标题写得很直白:“We Distilled Gemini Tool Calling into a 26M Model”——26M参数版本,后来迭代到14MB。这意味着它不是为了聊天而生的,而是为了让设备能理解“帮我关灯”“提醒我明天开会”这类指令,并正确调用对应的设备API或应用接口。
从GitHub仓库的主题标签看,它明确面向on-device AI,关联了cactus、gemini、gemma、llm等关键词。它的定位不是通用助手,而是设备上的“大脑”——让硬件听懂人话,并执行动作。相比云端大模型,它不需要联网,响应快,隐私也留在本地。
免费开源与付费云服务:钱花在哪
Needle本身完全开源,本地部署不需要花一分钱。但如果你不想自己折腾模型部署和推理优化,官方提供了云服务:免费版$0,individual档也是$0,付费档位$21。这个价格差异不在模型本身,而在于托管和API调用——$21档大概率是给需要更高调用量或并发需求的开发者。
有意思的是,免费版和individual都是$0,说明官方在刻意降低入门门槛。是:个人开发者玩本地部署,开源版足够;如果做产品原型或需要云端API兜底,可以先从免费档开始,等调用量上去了再考虑$21档。真正要花钱的场景是生产环境——你不想自己维护推理服务,或者需要SLA保障时,$21/月其实比自建GPU服务器便宜得多。
| 版本 | 价格 | 适合场景 |
|---|---|---|
| 开源版 | $0 | 本地部署、完全自主控制、学习研究 |
| 免费云档 | $0 | 低调用量试用、原型验证 |
| individual | $0 | 个人开发者的基础云端使用 |
| 付费档 | $21/月 | 更高调用量、生产环境、需要支持 |
怎么用:从下载到跑通一条命令的距离
Needle的用法很直接——因为模型足够小,你甚至可以在树莓派上跑。以Python为主要语言,安装依赖后加载模型,然后给它一个任务描述,它会输出对应的工具调用指令。比如你对它说“把客厅温度调到24度”,它会解析出调用智能家居API的JSON格式参数。
相比自己用Llama.cpp量化大模型,Needle省去了大量调优时间。14MB的体积让推理速度非常快,在手机CPU上也能流畅运行。实测下来,它对中文指令的理解和工具调用准确度,在端侧模型里属于第一梯队——当然,和云端GPT-4级别的工具调用比还有差距,但考虑到体积和离线运行的优势,这个取舍很值。
适合谁,不适合谁
Needle适合做智能家居中枢、可穿戴设备语音助手、简易机器人控制,以及任何需要离线指令理解的场景。它的Apache-2.0协议对商业集成非常友好,不用担心授权问题。
不适合的场景也很明确:如果你需要复杂的多轮对话、深度常识推理,或者对工具调用的准确率要求接近100%,那14MB的容量还是太小了。云端大模型仍然是这类任务的首选。Needle的最佳定位是“轻量级任务处理器”,而不是“全能AI”。
一句话:把免费的开源模型跑在自家设备上,让数据不出门,这是Needle最打动人的地方。
FAQ:常见问题
Needle和Gemma、Gemini是什么关系?
Needle是基于Gemma架构(或受其启发)蒸馏出来的小型模型,专门针对工具调用能力进行优化。它把Gemini的工具调用能力压缩进14MB参数,而不是像Gemma那样追求通用对话能力。简单说,Needle是Gemini能力的“端侧精简版”,专注让设备执行指令。
Needle免费版和付费$21版有什么区别?
Needle本身是开源免费的,本地部署不需要付费。云服务提供免费档($0)和付费档($21/月),差异在于调用额度、并发支持和服务等级。免费档适合低频率试用,付费档面向生产环境或高调用量需求。个人开发者通常先用开源版或免费云档就够了。
