审计 GigaToken 约 1000 倍加速的测试条件、独立复现和兼容风险,并判断 CPU Tokenization 何时真正影响 LLM 吞吐。
An audit of GigaToken's 1000x claim, independent results, compatibility risks, and when CPU tokenization changes LLM throughput.
"把 Tokenizer 视为 checkpoint ABI,用可验证的迁移契约原地扩展预训练模型词表,并守住生成质量与真实性能。"
"A practical contract for expanding a pretrained LLM tokenizer in place while preserving token identity, model quality, and real inference performance
"判断 AI Agent 何时需要领域特定语言,何时 JSON Schema 已经够用,并用最小 DSL 架构建立可验证的执行边界。"
"Learn when an AI agent needs a domain-specific language, when JSON Schema is enough, and how to build a minimal DSL with deterministic validation."
"GPT-5.5 是 OpenAI 自 GPT-4.5 以来首个完全重新训练的基础模型。SWE-bench Verified 88.7%、Terminal-Bench 2.0 82.7%、1M 上下文检索质量从 36.6% 跃升至 74.0%。本文完整拆解 benchmark 数据、定价策略,以及
"GPT-5.5 is OpenAI's first fully retrained foundation model since GPT-4.5. It delivers 88.7% on SWE-bench Verified, 82.7% on Terminal-Bench 2.0, and m
Claude Opus 4.7 全面技术解析:87.6% SWE-bench Verified、+14.6 MCP-Atlas、+44 XBOW、自验证行为、高分辨率视觉、xhigh effort level、迁移指南、多模型路由策略。
Claude Opus 4.7 analysis: 87.6% on SWE-bench Verified, +10.9 on SWE-bench Pro, +44 on XBOW Vision. The most comprehensive technical breakdown availabl