Needle2:仅14MB的智能体语言模型,让低价设备也能运行AI
在边缘AI的赛道上,我们常常关注那些运行在高端PC或Mac上的大模型,但真正的“边缘”其实是大量价格低廉的设备。来自Cactus团队的Henry在HN上发布了他们的最新成果——Needle2,一个仅有14MB的智能体语言模型,专为手机、可穿戴设备、智能家居、小型机器人和微控制器设计。
边缘AI的真正战场
据统计,全球有超过210亿台联网物联网设备,而PC仅有约15亿台。在新兴市场,大多数手机售价低于200美元,再加上树莓派、微控制器、智能家居设备等,大约五分之四的边缘设备成本低于200美元。这些设备通常没有GPU或NPU,只有几百MB的内存,而Needle2正是为它们量身定制的。
小模型的大智慧
Needle2仅有4500万参数,却能实现工具调用、设备控制和结构化提取。其关键在于将问题重新定义:打开灯、控制机器人这类任务并不需要世界知识,只需将用户的自然语言映射到预设的函数和参数上。这种简化的任务定义使得小模型也能胜任,而无需像聊天机器人那样需要数十亿参数。
结构化输出与边缘-云协同
Needle2通过字节级语法约束确保输出符合预设的JSON Schema,所有参数都用于理解用户意图。更重要的是,模型会给出置信度评分,对于超出能力范围的问题,会返回空调用,从而触发升级到云端处理。这种边缘-云协同机制确保了大多数常规请求能在本地快速、私密地处理,同时保留了对复杂任务的响应能力。
无损2bit量化
小模型在训练后量化时往往性能下降,而Needle2采用了Cactus Quants技术,从预训练到后训练全程使用2bit量化(包括权重、激活和KV缓存),使得部署时的模型与训练时一致,从而在14MB的体积内保留了全部性能,在树莓派5上可实现500+ tokens/s的解码速度。
未来展望
Needle2的发布标志着边缘AI向低成本设备迈出了重要一步。它证明了,通过任务定义、模型设计和量化技术的协同优化,小模型也能在资源受限的环境中发挥巨大作用。团队表示,他们将继续优化模型架构和推理性能,期待在更多设备上看到它的身影。
