3.2 计算最优:Chinchilla 与 20 token/参数#在固定算力预算下,模型规模并非越大越好。参数量 $N$ 与训练数据量 $D$ 应当等比例同步放大,经验上每个参数约配 20 个 token;GPT-3、Gopher 等早期巨模型均处于数据不足、训练不充分的状态。登录后才可看登录 Satori 账户