对话式 AI 隐私需要统一审计 Web、移动端、后端和第三方的数据流。最新同行评审研究覆盖九家主流服务,发现同一个账号在不同客户端上可能面对完全不同的追踪路径、身份标识、同意控制和对话暴露。本文把论文方法转化为一套可复现审计:测量哪些数据真实流出、接收方能否关联到个人,以及用户控制是否真正改变数据流。
阅读时间:约 10 分钟 · 约 4800 字
TL;DR
- 研究者结合静态分析、受控交互、网络仪器、全新浏览器配置和 Canary URL,分析九个 Web 服务与八个 Android 应用。
- 每个被测服务都连接至少一家被分类为广告或追踪基础设施的第三方机构;第三方存在本身不能证明每次传输都用于广告。
- 正常交互期间,9 个 Web 客户端中有 6 个、8 个移动客户端中有 3 个向第三方披露了某类对话衍生工件。
- Web 与移动端是两种隐私表面:Web 暴露更多 URL、标题、Cookie 和分享页数据,移动端暴露广告、账号、安装与设备标识。
- 合格审计要把权限、流量、标识符、接收方、访问控制、保留期限和用户操作写进同一本证据账。
产品边界远大于聊天窗口
用户看到的是一个助手品牌,数据经过的却是多个系统:浏览器或原生应用、第一方 API、分析 SDK、错误监控、广告基础设施、身份服务、分享页面和服务器侧转发。
只审隐私政策会漏掉实现,只看应用权限会漏掉 Web 标识和服务器侧流量,只看浏览器 Cookie 又会漏掉移动 SDK 与设备标识。
跨端审计应采用以下最小单位:
账号 × 客户端 × 同意状态 × 订阅层级 × 交互动作 × 接收方
这能把隐私从设置清单转化为可重放、可比较的数据流。
新研究具体测了什么
论文 Prompt like a Butterfly, Sting like a Tracker 已被 2027 Privacy Enhancing Technologies Symposium 接收。IMDEA Networks 将其标记为同行评审、待正式出版。研究覆盖 ChatGPT、Claude、Grok、DeepSeek、Perplexity、Gemini、Microsoft Copilot、Mistral Le Chat 和 Meta AI。九家都有 Web 客户端,其中八家提供 Android 应用。
Web 侧使用 Chrome Developer Tools Protocol 记录请求、存储访问、Cookie、JavaScript 执行和追踪像素。每个实验条件都从全新浏览器配置开始,分别比较忽略、拒绝和接受非必要 Cookie,以及可用的访客、免费和付费层级。
Android 侧结合 APK 静态分析与一台经过仪器化的 Android 12 设备,观察敏感 API、文件、运行时类和出站流量,包括使用证书固定的应用。研究者预先设置已知的假名化标识,以便在流量中搜索明文和常见哈希。
实验使用预定义的健康相关提示词、正常对话和分享链接动作。放入提示词和上传文件的 Canary URL 用于测试外部系统是否会在之后访问相关资源。
这是一套较强的黑盒设计,仍然属于时间点下限。试运行确认行为稳定后,每个配置只正式执行一次;Gemini 移动流量未能提取;企业与政务层、桌面客户端、语音界面、地区差异、长期记忆和不可见服务器处理均不在测量范围内。
先把三类发现分开
论文识别出 124 个第三方域名,归属于 44 家机构,其中 34 家被分类为广告和追踪服务。每个被测助手至少连接其中一家。
这个结论必须带上作者自己的限制:第三方组件也可能提供认证、支付、反欺诈、遥测或错误监控。观察到域名或 SDK,不足以单独证明每个事件都用于广告。
更值得关注的是对话工件:
| 观测行为 | Web | Android |
|---|---|---|
| 正常交互中披露对话衍生工件的服务 | 6/9 | 3/8 |
| 披露对话 URL | 5 家 | 0 |
| 披露对话标题 | 3 家 | 0 |
| 披露 Prompt | 1 家 | 1 家 |
| 披露对话截图 | 1 家 | 0 |
两端的风险形态不同。浏览器追踪器能够观察页面 URL、标题、Cookie 和应用状态;移动 SDK 可以组合账号 ID、哈希邮箱、广告 ID、安装 ID 和设备标识。研究还发现,移动客户端访问的不同端点中有 71% 来自 WebView,Web 与原生追踪的边界已经相互渗透。
同意和付费没有形成统一边界
拒绝非必要 Cookie 可以减少部分 Web 披露,但没有清除全部第三方连接。论文报告,9 个免费 Web 服务中仍有 4 个在拒绝后向第三方追踪服务发送数据。免费与付费层级连接的第三方集合也没有表现出稳定差异。
移动端采用另一套控制方式。多数应用要求用户接受服务条款和隐私政策后才能使用,启动时没有与 Web Cookie 分类同等的选择。
这形成一条直接审计规则:不要把某一端的结论复制到另一端。Web 设置在移动端可能没有对应项,付费计划可能改变功能而没有改变分析基础设施,拒绝 Cookie 可能减少广告调用,同时保留运营遥测。
控制项必须用前后流量差异验证,标签本身不是证据。
身份关联让元数据升级为对话暴露
单独的对话 ID 看起来敏感度有限。一旦与稳定账号、设备、Cookie 或广告标识组合,它就变成长期关联键。
论文观测到的组合包括用户 ID、匿名 ID、组织 ID、邮箱或哈希、会话 ID、广告 Cookie、Android Advertising ID、安装 ID 和 SDK 专用标识。可重置标识若与长期账号或安装 ID 同时传输,也可能在重置后重新绑定。
因此,审计应测量可关联性,而非只看原始字段是否敏感。每个事件至少记录:
- 是否包含对话工件;
- 是否包含直接或假名化身份标识;
- 接收方及其公司归属;
- 文档声明的处理目的;
- 同意状态与账号层级;
- 跨会话持久性;
- 能否重建或访问原对话。
这与 Coding Agent 的仓库数据流审计遵循同一原则:真正需要确认的是哪些信息跨过信任边界,以什么身份跨越,又获得什么下游权限。
分享链接本身是一套访问控制系统
所有被测服务都支持用户主动生成公开分享链接。论文发现,分享页面中出现 9 家第三方,它们能够读取页面上下文。
不同服务和账号层级的默认访问权限并不一致。研究者在部分配置中观察到默认公开或退出式私有控制。Grok 的分享流程中,论文报告 Meta 与 TikTok 收到最近一条 Prompt,TikTok 还收到对话截图。
Canary 实验提供了后续访问证据。研究者记录到与 Grok 相关的 70 次激活,持续时间从数小时到数天,来自 70 个 IP、48 个自治系统和 14 个国家。其他服务没有出现同类重复模式;作者也明确说明,未观测到访问不能证明没有访问。
分享链接审计至少要包含四项:
- 在全新未登录会话中测试访问;
- 测试撤销后的访问与缓存;
- 记录分享页面发出的第三方请求;
- 用 Canary 资源观察后续访问。
把审计做成证据账本
一套可复现跨端审计可以分为七步。
- 冻结实验矩阵:记录版本、地区、账号层级、同意状态、设备、浏览器和时间。
- 使用隔离身份:创建独立账号和可安全搜索的已知假名化标识。
- 重放同一任务:在各端使用固定 Prompt、上传文件、分享动作和删除动作。
- 多层采集:收集浏览器 HAR、存储、移动 SDK 清单、运行时流量、权限访问和屏幕录制。
- 统一接收方:把域名、SDK、代理端点和服务器转发映射到机构,同时保留用途不确定性。
- 关联工件与标识:标出 Prompt、标题、URL、截图或对话 ID 与稳定身份信号同时传输的事件。
- 验证用户控制:在拒绝、退出、换套餐、撤销分享、删除账号和重置标识后重复测试。
账本应区分四种证据状态:政策声明、代码中存在、流量中观测、下游访问已验证。这样可以避免把隐私承诺或 SDK 清单误当成真实行为结论。
组织采购时应要求什么
采购对话式 AI 时,应要求按渠道提供数据流图,而非单一隐私摘要。图中需要列明全部处理方与追踪服务、传输字段、目的、法律基础、保留期限、处理地区、账号关联、删除传播,以及企业与消费版本差异。
控制措施还要独立测试。企业合同写明数据不用于训练,只回答了一个问题。它无法同时证明运营遥测没有对话标识、分享页不会暴露内容、删除动作已经传播到第三方处理方。
敏感场景中,成本最低的降险方式通常是架构隔离:分开个人与组织账号、关闭公开分享、拒绝可选追踪、限制移动权限、避免在 Prompt 中输入秘密,并把高敏感任务放入具备组织级审计控制的产品。
常见问题
所有 AI 聊天机器人都会把对话文本发给广告商吗?
论文不支持这个结论。不同服务披露的工件、接收方和用途不同。正常交互中有 6 个 Web 客户端和 3 个 Android 客户端披露某类对话工件,直接披露 Prompt 的情况少得多。
拒绝 Cookie 能停止聊天机器人追踪吗?
在论文测试中,它减少了部分 Web 可选流量,但没有消除全部第三方连接。结果取决于服务和渠道,移动应用通常也没有同等的 Cookie 选择流程。
付费 AI 计划是否更保护隐私?
付费本身没有在被测第三方基础设施中形成稳定边界。企业层可能有不同合同控制,但不在本研究范围内,需要另行验证。
为什么对话 URL 也属于敏感数据?
它可能唯一标识或直接取回某段对话。与稳定用户或广告标识同时传输时,对话上下文可能被接入长期画像。
这项研究最大的限制是什么?
它是 2026 年 5 月在西班牙完成的九服务黑盒快照。稳定配置在试运行后只执行一次,若干产品和渠道未覆盖,服务器内部处理不可完全观测,Gemini 移动流量也未成功提取。
参考资料
- Oliveira 等:Prompt like a Butterfly, Sting like a Tracker
- IMDEA Networks:论文接受稿 PDF
- Jazlan 等:Tracking Conversations: Measuring Content and Identity Exposure on AI Chatbots
- 欧洲数据保护委员会:ePrivacy Directive 第 5(3) 条技术范围指南
- OWASP:LLM02:2025 敏感信息披露
可以从一个账号和一套固定 Prompt 开始:分别在 Web 与移动端执行,拒绝可选追踪,再比较真实接收方。差异就是隐私模型的起点。