Administrator
Published on 2026-08-18 / 3 Visits
0
0

本地视觉、云端推理:家庭自动化的隐私分层架构

判断车库门是否打开,并不需要把家庭照片交给云端大模型。一次 280 张家庭图像实测中,3B 本地视觉语言模型在这个二分类任务上达到 94.3% 零样本准确率。任务换成 13 类物体检测后,召回率降到 66.2%,空场景误报率达到 47%。真正值得保留的结论是架构:狭窄感知留在本地,只升级结构化事件,并阻止未经校准的模型直接控制家庭设备。

证据核验时间:2026 年 8 月 18 日。280 张图的结果来自单个家庭测试,未公开原始图片与复现包,不能视为通用安防基准。

阅读时间:约 8 分钟 · 全文约 3000 字

核心结论

  • 本地 VLM 可以在图片不出设备的情况下回答一个狭窄家庭问题。二分类成功无法证明它能承担通用物体检测。
  • 稳定架构是:摄像头 → 本地感知 → 结构化事件 → 策略路由 → 可选云端推理 → 可逆动作门。
  • 云端默认只接收决策需要的最少事件字段,而非包含所有画面细节的描述文本。
  • 自然语言置信度不是校准概率。路由需要结合多帧一致性、确定性传感器、专用检测器、重复采样和人工确认。
  • 误报与漏报需要按动作代价评估。通知允许的错误率高于关门、解锁或修改报警状态。

车库实测证明了什么

Yage 使用 Liquid AI 的 LFM2.5-VL-3B 测试了 280 张家庭车库摄像头图片。人工把每张图标为开或关:只要能看到任何开口就算开,完全闭合才算关。模型没有见过车库专用样本。

针对这个单一零样本问题,准确率为 94.3%,开门 recall 为 92.6%,报告中的本地感知耗时约 1.5 秒。这个结果有价值,因为标签定义清楚,动作代价也可以被明确描述。

同一测试还给出了能力边界。任务扩展为从 13 类中检测人、车等物体后,recall 降到 66.2%,空场景误报率达到 47%。

这些数字来自同一位测试者,文章没有附带公开数据集、硬件规格、混淆矩阵和可运行评测包。它们适合形成设计假设,无法认证产品。正向结果说明小型通用 VLM 可以处理一个狭窄场景问题,反向结果说明任务范围比模型标签更重要。

LFM2.5-VL-3B 的目标场景

Liquid AI 于 2026 年 8 月 12 日发布 LFM2.5-VL-3B。模型有 31 亿参数,把 LFM2.5 文本基座与 SigLIP2 视觉编码器组合起来,直接回答,不运行长推理模式。厂商将它定位在低延迟边缘视觉、屏幕理解、grounding、OCR 和工具调用。

Liquid AI 报告其内存占用约 3 GB,在 Apple M5 Max 上达到 228 output TPS,在 AMD Ryzen AI Max+ 395 上为 116 TPS,在 Galaxy S26 Ultra 上为 20 TPS。厂商测试中的 RefCOCO 为 87.9,ScreenSpot-v2 desktop 为 78.7。

这些是厂商基准,可以证明部署可行性和产品定位,无法回答某个家庭摄像头的准确率。光照、角度、红外模式、季节、遮挡和室内物品都会改变数据分布。

模型只是组件,家庭自动化取决于周围的基础设施。

分层架构

摄像头 / 传感器
      ↓
本地触发器与帧采样
      ↓
本地 VLM 或专用检测器
      ↓
最小结构化事件 + 本地证据引用
      ↓
策略与置信度路由
      ├─ 忽略 / 等待下一帧
      ├─ 本地通知
      ├─ 用结构化文本请求云端推理
      └─ 请求人工确认
      ↓
可逆动作门
      ↓
Home Assistant / 设备 API + 审计日志

每层只处理一件事。摄像头观察,本地模型把像素转换成狭窄判断,路由器检查证据是否足以进入下一步。云端模型可以结合日程、天气、家庭偏好和历史事件,动作门负责限制真正能够改变什么。

分层也让系统可调试。错误可以定位到感知、事件标准化、推理、策略或执行,不必全部归因于一次黑箱多模态回答。

上传事件,不上传场景

本地推理本身无法自动保护隐私。即使 JPEG 留在家里,一段描述也可能暴露姓名、车牌、医疗设备、作息和房间内容。

事件 schema 只保留下游决策需要的字段:

{
  "event": "garage_door_open",
  "camera_id": "garage-east",
  "observed_at": "2026-08-18T09:42:15+08:00",
  "temporal_votes": ["open", "open", "open"],
  "sensor_corroboration": "reed_switch_unknown",
  "evidence_ref": "local://events/8f31...",
  "privacy_class": "household-routine",
  "allowed_cloud_fields": ["event", "observed_at"]
}

本地证据引用可以指向一张短期保存的加密图片。判断是否通知家人时,云端通常只需要事件和时间。上传原图应当属于另一条有策略控制的升级路径。

这与端侧诈骗检测采用同一原则:本地处理的价值来自明确、可审计的数据边界。

置信度来自系统,而非模型自述

LFM2.5-VL-3B 输出自然语言,没有提供面向家庭事件的校准概率。要求它自报 92% 置信度,只会得到一个尚未证明可校准的数字。

可用的路由应组合独立信号:

  1. 多帧一致性:间隔数秒采集三帧,要求分类结果一致。
  2. 确定性传感器:与门磁、运动传感器、锁状态或设备遥测比较。
  3. 专用模型:已知高频物体使用小型分类器或检测器,VLM 负责开放词汇和异常描述。
  4. 提示与采样稳定性:使用固定的第二种提示或采样策略复核,不一致时升级。
  5. 分布检查:识别黑暗、模糊、遮挡、机位移动和验证集外场景。
  6. 人工确认:不可逆或安全关键动作之前请求确认。

路由器无需生成一个万能分数,只需让证据规则与动作风险匹配。

把通知和控制分开

同一个感知错误在不同动作下的代价完全不同。

动作 可接受证据 失败处置
添加本地时间线 单帧 标记不确定,不提醒
发送手机通知 多帧一致 提供本地快照复核入口
开灯 视觉加运动信号 超时自动恢复
关闭车库门 视觉加门磁与障碍检查 传感器冲突时请求确认
解锁室外门 强身份与明确授权 不依赖通用 VLM

模型建议不能绕过动作门。云端模型负责说明它认为应该做什么,确定性策略负责判断动作是否允许、可逆、证据充分。

四项隐私控制

数据最小化

条件允许时只采集事件触发帧,在本地裁剪感兴趣区域。布尔状态足够时,不传背景细节。

保留期限

临时推理缓冲区与长期证据分开。普通负样本快速删除,只有发生提醒、争议或调试需要时才加密保留事件图片。

访问控制

摄像头、本地推理、云端路由和设备控制使用不同服务身份。感知进程不应持有开门权限。

可观测性

记录模型版本、提示版本、设备、延迟、标准化事件、路由理由、动作和之后的人工纠正。默认不记录原图和无限制场景描述。

日志保存决定与来源,而非复制家庭内容时,隐私与可观测性可以同时成立。

建立家庭专用评测集

通用 VLM benchmark 无法回答一个系统在你家是否可靠。本地冻结数据集至少覆盖:

  • 白天、夜间、红外、逆光和天气;
  • 部分打开与关闭过程;
  • 车、人、宠物、快递和空场景;
  • 遮挡、模糊、断网和机位移动;
  • 发生概率低、动作代价高的状态。

测量完整事件流水线:

  • 每类事件 precision 与 recall;
  • 每天误报次数,而非只有准确率百分比;
  • 高风险漏报;
  • 本地延迟与云端升级延迟;
  • 有多少帧离开设备;
  • 每个可验收事件的云端调用和成本;
  • 模型分歧与人工纠正率;
  • 传感器、网络和模型故障后的恢复能力。

280 张车库图片的价值在于冻结了一个真实任务。生产成熟度需要继续加入家庭实际遇到的失败样本。

云端推理什么时候有价值

事件需要更广泛上下文时,云端推理才有价值:

  • 车库门打开,家里没人,车还在里面,并且即将下雨。
  • 画面有人,家庭日历显示今天会有维修人员上门。
  • 包裹在日落后仍未取走,之前的通知也没人确认。
  • 多次模糊事件说明摄像头或门磁可能需要维护。

云端应接收一个有边界的决策问题和允许动作,不能成为每一帧的默认目的地,也不能直接控制所有设备。

云端不可用时,低风险本地自动化可以按确定性规则继续运行。模糊或高风险事件保持等待、只做本地提醒,或请求人工复核。断网不能静默把家庭数据改送未批准的供应商,也不能降低动作门槛。

原生多模态云模型会继续降价和提速。本地与云端分层仍有长期价值,因为延迟、隐私、带宽、故障隔离和动作权限属于系统属性。

常见问题

3B 本地 VLM 可以替代安防检测器吗?

不能一概而论。家庭实测在单一车库门状态上表现较强,在 13 类检测上明显不足。已知标签集应优先使用经过场景验证的专用检测器。

图片留在本地就能保证隐私吗?

不能。描述、事件日志、embedding、时间戳和家庭作息同样敏感,需要同时最小化像素和派生数据。

系统怎样决定是否调用云端?

按事件类型、多帧一致性、传感器佐证、分布漂移、动作风险,以及云端上下文是否会实质改变决定来路由。

可以相信 VLM 自报的置信度吗?

在家庭任务上完成校准前,只能把它视为另一个模型输出。独立传感器和真实错误率更适合做路由输入。

哪些动作应保留人工批准?

室外访问、报警修改、财务动作、安全系统和难以回滚的操作,都需要确定性防护与明确授权。

参考资料


Comment