机器人访问正在变成一套强制执行栈:身份、用途与默认策略

Web Bot Auth 只能验证签名身份。机器人访问治理还需要站点偏好、用途声明、名录分类、本地策略和可审计的边缘执行。

Administrator Administrator Published on 2026-09-10

Web Bot Auth and AI Crawler Control: The Five-Layer Enforcement Stack

Web Bot Auth verifies a signing key. Robot access needs declared purpose, directory classification, local policy, and auditable edge enforcement.

Administrator Administrator Published on 2026-09-10

KV Cache 变成 Agent 运行时后

KV cache 操作让预训练模型并发观察、思考和响应成为可能。机制已有实验,生产运行时仍在形成,状态治理将成为新的系统边界。

Administrator Administrator Published on 2026-09-09

KV Cache as an Agent Runtime: What Changes

KV-cache manipulation lets pretrained LLMs observe, reason, and respond concurrently. The mechanism works; the production runtime is still emerging.

Administrator Administrator Published on 2026-09-09

Astra 在 ARC-AGI-3 得分 62.7% 或 99.9%:Harness 本身就是评测对象

Astra 在不同 Harness 下得到 62.7% 和 99.9%。本文拆解分数语义、状态管理差异,以及速度和 token 数据的适用边界。

Administrator Administrator Published on 2026-09-05

Astra Scores 62.7% or 99.9% on ARC-AGI-3: The Harness Is Part of the Benchmark

Astra scored 62.7% or 99.9% on ARC-AGI-3 under different harnesses. Here is what changed, what the numbers mean, and what remains unproven.

Administrator Administrator Published on 2026-09-05

Claude Formalized Fermat's Last Theorem in 11 Days: What the Lean Verification Stack Actually Proves

Claude formalized Fermat's Last Theorem in Lean in 11 days. Here is what the 13-million-line proof and its verification stack establish.

Administrator Administrator Published on 2026-09-05

EvoUndo:给自我修改的 Agent Harness 加一道可恢复性门禁

EvoUndo 说明能力提升不足以批准 Agent Harness 自我修改。持久变更合并前应通过状态见证、独立影响审计与反事实恢复测试。

Administrator Administrator Published on 2026-09-02

EvoUndo: A Recoverability Gate for Self-Modifying AI Agent Harnesses

EvoUndo shows why capability gains are insufficient for self-modifying Agent Harnesses. Require witnessed, counterfactual recovery before merge.

Administrator Administrator Published on 2026-09-02

Claude Fable 5.1 与 Mythos 5.1:怎样评测安全护栏成本

Fable 5.1 与 Mythos 5.1 使用相同权重、不同护栏。模型选型应联合评测能力、干预、可用结果成本与访问资格。

Administrator Administrator Published on 2026-09-02
Previous Next