Automated Alignment Researchers Need an Evaluation Contract

Automated alignment researchers need more than strong scores. Anthropic's experiment shows the evaluation contract that makes gains testable.

Administrator Administrator Published on 2026-08-29

加州 AB 1651 AI 披露:高风险认证需要两套账

加州 AB 1651 提醒我们:日常生产需要结果核验账,高风险认证还需要独立的来源披露账。

Administrator Administrator Published on 2026-08-27

California AB 1651 AI Disclosure: Two Ledgers for High-Stakes Certification

California AB 1651 shows why AI governance needs one ledger for verified work and another for disclosure at certification gates.

Administrator Administrator Published on 2026-08-27

Admin Plugin:企业 Agent 控制面

OpenAI Admin Plugin 把工作区管理变成权限感知的 Agent 闭环。真正的架构由身份、动作控制、审批、结果证据与审计组成。

Administrator Administrator Published on 2026-08-26

Admin Plugin as an Enterprise Agent Control Plane

OpenAI's Admin Plugin turns workspace administration into a permission-aware agent loop. The real design is identity, action control, approval, eviden

Administrator Administrator Published on 2026-08-26

Qwen3.8-27B 实战评测:先冻结变量

一套可复用的 Qwen3.8-27B 实战评测合同:比较 tok/s 之前,先控制量化、引擎、缓存、上下文、推理强度、质量与并发。

Administrator Administrator Published on 2026-08-26

How to Benchmark Qwen3.8-27B for Real Workloads

A practical Qwen3.8-27B benchmark contract that controls quantization, engine, cache, context, reasoning effort, quality, and concurrency before compa

Administrator Administrator Published on 2026-08-26

OpenAI Jalapeño 基准审计:全栈推理闭环

审计 OpenAI Jalapeño 首批基准:1.5 至 1.9 倍每瓦吞吐说明了什么,遗漏了什么,以及全栈推理为何才是真正的战略资产。

Administrator Administrator Published on 2026-08-26

OpenAI Jalapeño Benchmark Audit: Full-Stack Inference

An audit of OpenAI Jalapeño's first benchmarks: what the 1.5–1.9x performance-per-watt lead proves, what it omits, and why full-stack inference is the

Administrator Administrator Published on 2026-08-26

MTIA 300 与 MetaRoCE:两条端点设计如何处理 AI 网络瓶颈

MTIA 300 把网络放进加速器封装,MetaRoCE 把传输智能放进端点 NIC。本文拆解两条设计线的共同目标、机制差异与证据边界。

Administrator Administrator Published on 2026-08-25
Previous Next