Fable 5.1 与 Mythos 5.1 使用相同权重、不同护栏。模型选型应联合评测能力、干预、可用结果成本与访问资格。
AI Agent 分数由模型、Harness、任务、测试和环境共同生成。本文给出五层评测框架,把公开榜单转成可复现的团队选型证据。