判断车库门是否打开,并不需要把家庭照片交给云端大模型。一次 280 张家庭图像实测中,3B 本地视觉语言模型在这个二分类任务上达到 94.3% 零样本准确率。任务换成 13 类物体检测后,召回率降到 66.2%,空场景误报率达到 47%。真正值得保留的结论是架构:狭窄感知留在本地,只升级结构化事件,并阻止未经校准的模型直接控制家庭设备。
证据核验时间:2026 年 8 月 18 日。280 张图的结果来自单个家庭测试,未公开原始图片与复现包,不能视为通用安防基准。
阅读时间:约 8 分钟 · 全文约 3000 字
核心结论
- 本地 VLM 可以在图片不出设备的情况下回答一个狭窄家庭问题。二分类成功无法证明它能承担通用物体检测。
- 稳定架构是:摄像头 → 本地感知 → 结构化事件 → 策略路由 → 可选云端推理 → 可逆动作门。
- 云端默认只接收决策需要的最少事件字段,而非包含所有画面细节的描述文本。
- 自然语言置信度不是校准概率。路由需要结合多帧一致性、确定性传感器、专用检测器、重复采样和人工确认。
- 误报与漏报需要按动作代价评估。通知允许的错误率高于关门、解锁或修改报警状态。
车库实测证明了什么
Yage 使用 Liquid AI 的 LFM2.5-VL-3B 测试了 280 张家庭车库摄像头图片。人工把每张图标为开或关:只要能看到任何开口就算开,完全闭合才算关。模型没有见过车库专用样本。
针对这个单一零样本问题,准确率为 94.3%,开门 recall 为 92.6%,报告中的本地感知耗时约 1.5 秒。这个结果有价值,因为标签定义清楚,动作代价也可以被明确描述。
同一测试还给出了能力边界。任务扩展为从 13 类中检测人、车等物体后,recall 降到 66.2%,空场景误报率达到 47%。
这些数字来自同一位测试者,文章没有附带公开数据集、硬件规格、混淆矩阵和可运行评测包。它们适合形成设计假设,无法认证产品。正向结果说明小型通用 VLM 可以处理一个狭窄场景问题,反向结果说明任务范围比模型标签更重要。
LFM2.5-VL-3B 的目标场景
Liquid AI 于 2026 年 8 月 12 日发布 LFM2.5-VL-3B。模型有 31 亿参数,把 LFM2.5 文本基座与 SigLIP2 视觉编码器组合起来,直接回答,不运行长推理模式。厂商将它定位在低延迟边缘视觉、屏幕理解、grounding、OCR 和工具调用。
Liquid AI 报告其内存占用约 3 GB,在 Apple M5 Max 上达到 228 output TPS,在 AMD Ryzen AI Max+ 395 上为 116 TPS,在 Galaxy S26 Ultra 上为 20 TPS。厂商测试中的 RefCOCO 为 87.9,ScreenSpot-v2 desktop 为 78.7。
这些是厂商基准,可以证明部署可行性和产品定位,无法回答某个家庭摄像头的准确率。光照、角度、红外模式、季节、遮挡和室内物品都会改变数据分布。
模型只是组件,家庭自动化取决于周围的基础设施。
分层架构
摄像头 / 传感器
↓
本地触发器与帧采样
↓
本地 VLM 或专用检测器
↓
最小结构化事件 + 本地证据引用
↓
策略与置信度路由
├─ 忽略 / 等待下一帧
├─ 本地通知
├─ 用结构化文本请求云端推理
└─ 请求人工确认
↓
可逆动作门
↓
Home Assistant / 设备 API + 审计日志
每层只处理一件事。摄像头观察,本地模型把像素转换成狭窄判断,路由器检查证据是否足以进入下一步。云端模型可以结合日程、天气、家庭偏好和历史事件,动作门负责限制真正能够改变什么。
分层也让系统可调试。错误可以定位到感知、事件标准化、推理、策略或执行,不必全部归因于一次黑箱多模态回答。
上传事件,不上传场景
本地推理本身无法自动保护隐私。即使 JPEG 留在家里,一段描述也可能暴露姓名、车牌、医疗设备、作息和房间内容。
事件 schema 只保留下游决策需要的字段:
{
"event": "garage_door_open",
"camera_id": "garage-east",
"observed_at": "2026-08-18T09:42:15+08:00",
"temporal_votes": ["open", "open", "open"],
"sensor_corroboration": "reed_switch_unknown",
"evidence_ref": "local://events/8f31...",
"privacy_class": "household-routine",
"allowed_cloud_fields": ["event", "observed_at"]
}
本地证据引用可以指向一张短期保存的加密图片。判断是否通知家人时,云端通常只需要事件和时间。上传原图应当属于另一条有策略控制的升级路径。
这与端侧诈骗检测采用同一原则:本地处理的价值来自明确、可审计的数据边界。
置信度来自系统,而非模型自述
LFM2.5-VL-3B 输出自然语言,没有提供面向家庭事件的校准概率。要求它自报 92% 置信度,只会得到一个尚未证明可校准的数字。
可用的路由应组合独立信号:
- 多帧一致性:间隔数秒采集三帧,要求分类结果一致。
- 确定性传感器:与门磁、运动传感器、锁状态或设备遥测比较。
- 专用模型:已知高频物体使用小型分类器或检测器,VLM 负责开放词汇和异常描述。
- 提示与采样稳定性:使用固定的第二种提示或采样策略复核,不一致时升级。
- 分布检查:识别黑暗、模糊、遮挡、机位移动和验证集外场景。
- 人工确认:不可逆或安全关键动作之前请求确认。
路由器无需生成一个万能分数,只需让证据规则与动作风险匹配。
把通知和控制分开
同一个感知错误在不同动作下的代价完全不同。
| 动作 | 可接受证据 | 失败处置 |
|---|---|---|
| 添加本地时间线 | 单帧 | 标记不确定,不提醒 |
| 发送手机通知 | 多帧一致 | 提供本地快照复核入口 |
| 开灯 | 视觉加运动信号 | 超时自动恢复 |
| 关闭车库门 | 视觉加门磁与障碍检查 | 传感器冲突时请求确认 |
| 解锁室外门 | 强身份与明确授权 | 不依赖通用 VLM |
模型建议不能绕过动作门。云端模型负责说明它认为应该做什么,确定性策略负责判断动作是否允许、可逆、证据充分。
四项隐私控制
数据最小化
条件允许时只采集事件触发帧,在本地裁剪感兴趣区域。布尔状态足够时,不传背景细节。
保留期限
临时推理缓冲区与长期证据分开。普通负样本快速删除,只有发生提醒、争议或调试需要时才加密保留事件图片。
访问控制
摄像头、本地推理、云端路由和设备控制使用不同服务身份。感知进程不应持有开门权限。
可观测性
记录模型版本、提示版本、设备、延迟、标准化事件、路由理由、动作和之后的人工纠正。默认不记录原图和无限制场景描述。
日志保存决定与来源,而非复制家庭内容时,隐私与可观测性可以同时成立。
建立家庭专用评测集
通用 VLM benchmark 无法回答一个系统在你家是否可靠。本地冻结数据集至少覆盖:
- 白天、夜间、红外、逆光和天气;
- 部分打开与关闭过程;
- 车、人、宠物、快递和空场景;
- 遮挡、模糊、断网和机位移动;
- 发生概率低、动作代价高的状态。
测量完整事件流水线:
- 每类事件 precision 与 recall;
- 每天误报次数,而非只有准确率百分比;
- 高风险漏报;
- 本地延迟与云端升级延迟;
- 有多少帧离开设备;
- 每个可验收事件的云端调用和成本;
- 模型分歧与人工纠正率;
- 传感器、网络和模型故障后的恢复能力。
280 张车库图片的价值在于冻结了一个真实任务。生产成熟度需要继续加入家庭实际遇到的失败样本。
云端推理什么时候有价值
事件需要更广泛上下文时,云端推理才有价值:
- 车库门打开,家里没人,车还在里面,并且即将下雨。
- 画面有人,家庭日历显示今天会有维修人员上门。
- 包裹在日落后仍未取走,之前的通知也没人确认。
- 多次模糊事件说明摄像头或门磁可能需要维护。
云端应接收一个有边界的决策问题和允许动作,不能成为每一帧的默认目的地,也不能直接控制所有设备。
云端不可用时,低风险本地自动化可以按确定性规则继续运行。模糊或高风险事件保持等待、只做本地提醒,或请求人工复核。断网不能静默把家庭数据改送未批准的供应商,也不能降低动作门槛。
原生多模态云模型会继续降价和提速。本地与云端分层仍有长期价值,因为延迟、隐私、带宽、故障隔离和动作权限属于系统属性。
常见问题
3B 本地 VLM 可以替代安防检测器吗?
不能一概而论。家庭实测在单一车库门状态上表现较强,在 13 类检测上明显不足。已知标签集应优先使用经过场景验证的专用检测器。
图片留在本地就能保证隐私吗?
不能。描述、事件日志、embedding、时间戳和家庭作息同样敏感,需要同时最小化像素和派生数据。
系统怎样决定是否调用云端?
按事件类型、多帧一致性、传感器佐证、分布漂移、动作风险,以及云端上下文是否会实质改变决定来路由。
可以相信 VLM 自报的置信度吗?
在家庭任务上完成校准前,只能把它视为另一个模型输出。独立传感器和真实错误率更适合做路由输入。
哪些动作应保留人工批准?
室外访问、报警修改、财务动作、安全系统和难以回滚的操作,都需要确定性防护与明确授权。