Needle 2塞进14MB,先别急着给它开门

Needle 2塞进14MB,先别急着给它开门

Needle 2把工具调用模型压进14MB,端侧速度和隐私很诱人,但误动作、许可证冲突与工程成本仍要先验货。

作者丨沐秋
Needle 2 把「理解一句话并调用一个工具」压进了 14MB,但它离替你安全开门,还差一个人类确认键。
8 月 11 日凌晨,Cactus Compute 在 X 宣布 Needle 2:一个面向手机、可穿戴设备、智能家居、机器人和微控制器的端侧模型。它不是把 ChatGPT 缩小,而是把工作砍到工具调用、设备操作和结构化提取。1
同一个项目在 Hacker News 的 Show HN 帖子里拿到 462 分、159 条评论。这个热度说明开发者愿意围观,不等于它已经替大家验证了真实设备。2

01|它不是小聊天

Cactus 的取舍很直接:让模型听懂「把客厅灯调到 30%」,然后返回一个合法的函数调用;至于自由聊天、写长文和开放式知识问答,统统不在它的主赛道里。3
模型有 4500 万参数,装成一个 14MB 的二进制文件,一次完整会话约占 28MB 内存。官方还给它加了结构化输出、工具检索、置信度分数和空调用拒答。34
它用 schema 生成字节级语法约束,工具多于五个时先检索出最相关的五个;上下文则采用 256 token 滑动窗口,把工具声明钉在缓存里。语法约束能保证返回的 JSON 形状正确,不能保证用户真的想让它执行这个动作。4
Needle 2 官方架构图:从 token 进入模型,到工具检索、256 token 窗口和字节级语法约束,最后输出精确函数调用
官方架构图把 Needle 2 的路线画得很诚实:少存一点上下文,少算一点无关 token,把算力留给函数名和参数。3

02|小不等于万能

官方页面给出的速度很诱人:树莓派 5 解码超过 500 tokens/s,低于 200 美元的手机约为 300 至 700 tokens/s。这个数字更像部署上限的宣传窗口,不能直接翻译成「任何手机都一样快」。3
真正该看的是它赢了什么,又输给了什么。
评测Needle 2LFM2.5 230MFunctionGemma 270M
Mobile Actions,961 条63.7%69.1%64.0% 3
Seal-Tools,域内 700 条32.6%26.9%16.3% 3
BFCL v4,整体 3,641 条42.6%60.8%46.1% 3
这些是官方的严格 exact match:函数名、调用顺序和每个参数都要对。比较也并不对称,Needle 2 用训练感知的 CQ2-bit,专门学设备动作;另外两个模型保留了更宽的通用能力,并以 f16 运行。3
所以它买到的是端侧预算里的可用性,不是通用智能的平替。
Needle 2 官方评测图:Mobile Actions 准确率与模型参数量的关系
这张官方图能说明体积优势,却不能替你回答一个更难的问题:你的工具名称、参数描述和失败样本,是否也在它熟悉的范围里。4

03|安全阀不是刹车

Needle 2 把低置信度请求交给云端或更大模型,把没有对应工具的请求变成空调用。这个设计把「猜不出来」变成了可处理的信号。34
但置信度不是授权系统。
只要开发者把「锁门」注册成工具,模型就可能返回一个格式完全正确、语义却不该执行的调用。Schema 能挡住错格式,挡不住错意图,也挡不住一个已经被授权的危险动作。
Cactus 官方发布帖下面的回复,很快就集中到实际用例、连续调用上限和开放权重这些问题上,而不是单纯夸它小。1
还有一个更刺眼的早期信号:ToolDeckAI 自述在询问 HN 时,演示把前门锁上了。这个帖子只有极少互动,不能当成普遍故障证据,但足以提醒你不要把智能家居执行器直接接上默认 agent。5
AI 科技评论注意到,端侧模型最容易被误读的地方,正是「本地」两个字。数据不出云,不代表动作不需要审批。

04|开源也有账单

Needle 2 的公开入口是 GitHub 仓库和 Python 包,推理引擎首次从 Hugging Face 获取并缓存,之后推理不需要网络;仓库也提供 LoRA 微调和自定义工具 schema。4
它没有按 token 的托管价目表,但这不等于零成本。你要准备目标硬件,写好工具描述,测试拒答和误调用,还要承担模型升级与设备适配。
如果用官方的自动数据生成流程,还需要 OPENROUTER_API_KEY。本地训练省掉了云端推理费,却把调参时间和工程责任放回你的桌面。4
许可证也出现了需要先问清楚的缝隙:官方产品页写着 Apache 2.0,仓库里的 LICENSE 文件却是 MIT。36
在法务确认前,别把它简单写进产品的开源依赖清单里。

05|谁该先试

如果你的产品有固定的工具 API,最在意离线、延迟、隐私和内存占用,Needle 2 值得放进沙盒测一轮。
先用虚拟灯、虚拟门和虚拟日历,不要接真实执行器。
准备一组覆盖正常指令、歧义指令、越权指令和连续调用的测试集,分别记录准确率、空调用率、低置信度回退和误动作。
高风险动作保留人工确认,云端回退也单独记账。
如果你需要的是长上下文聊天、开放式规划或世界知识,它更适合做前置路由器,不适合顶掉通用模型。
Needle 2 把模型做成了一根很轻的扳手;至于它能不能碰门锁,先看你有没有装上锁舌。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.