EvoUndo 说明能力提升不足以批准 Agent Harness 自我修改。持久变更合并前应通过状态见证、独立影响审计与反事实恢复测试。
Fable 5.1 与 Mythos 5.1 使用相同权重、不同护栏。模型选型应联合评测能力、干预、可用结果成本与访问资格。
Anthropic 多 Agent 冲突实验表明,协调系统还需要不可静默改写的委托记录、升级规则和独立验收。
一项研究重建了 315320 个客户端推理块。长期教训是加密还需要身份、上下文、有效期、撤销与防重放机制。
OpenAI 正按 Critical 网络风险对待 Astra。本文区分初步评测、保守处置和正式定级,并拆解研发期必须验证的控制。
Word AI 蠕虫 PoC 显示隐藏指令可进入 Copilot 生成文件。本文给出上下文隔离、来源追踪、生成后扫描和发布门禁方案。
用单 Token 样本为 LLM API 建立低成本漂移传感器,并严格区分变化检测、模型身份和根因归因三层证据。
ChatGPT Health 可以在普通对话中读取连接的病历。本文拆解权限、记忆、删除、HIPAA 和端到端验证边界。
真实 Chrome 让静态指纹失去判别力。可靠的 Browser Agent 治理需要行为检测、签名身份与细粒度授权三层协同。
越狱成功率无法说明真实危害。本文解析 Anthropic CJS 四轴评分,并对照 JEF 与 CVSS,建立从攻击成功到组织风险的分层评估方法。