用单 Token 样本为 LLM API 建立低成本漂移传感器,并严格区分变化检测、模型身份和根因归因三层证据。
ChatGPT Health 可以在普通对话中读取连接的病历。本文拆解权限、记忆、删除、HIPAA 和端到端验证边界。
真实 Chrome 让静态指纹失去判别力。可靠的 Browser Agent 治理需要行为检测、签名身份与细粒度授权三层协同。
越狱成功率无法说明真实危害。本文解析 Anthropic CJS 四轴评分,并对照 JEF 与 CVSS,建立从攻击成功到组织风险的分层评估方法。
Anthropic 在 Claude 内部发现了一个低容量、可语言化且具有因果作用的 J-space。它能承载没有输出的中间概念,却不能证明 Claude 拥有主观意识。
2026 年企业 AI 采购的核心问题,不是哪个模型跑分更高,而是哪个平台能通过你公司的安全审计。本文聚焦 CISO、合规官和采购团队真正评估的维度:认证资质、数据处理政策、加密架构、Agent 安全控制,以及 Anthropic 和 OpenAI 在信任哲学上的根本分歧。 企业 AI 市场在 20
Anthropic 最新可解释性研究在 Claude 内部映射出 171 个情绪概念。这些不是比喻,是因果性地影响模型行为的内部表征。对 AI 安全审计和产品开发意味着什么?
2026 年 3 月 27 日,Anthropic 因 CMS 配置错误泄露了约 3,000 份未发布资产。其中一份草稿描述了代号 Mythos(内部称 Capybara)的下一代模型,声称在 coding、reasoning 和 cybersecurity 上有显著进展,且在网络安全能力上"far
2026年2月,一个名为CodeWall的自主AI智能体,用两个小时渗透进麦肯锡的Lilli平台,带走了4650万条聊天记录、72.8万份文件和5.7万个账户的数据。攻击面不是传统意义上的零日漏洞,而是22个未认证的API端点加上一处SQL注入:一个通过常规渗透测试的系统里藏着的漏洞。真正让这次入侵