Meta GEM 将端到端 MFU 提升至 20% 至 25%。真正可复用的是围绕真实负载持续识别并转移瓶颈的方法。
Meta GEM training efficiency shows why LLM-scale recommenders need workload-specific kernels, precision, parallelism, memory, and profiling.