4.3 · 配比、课程与去污染#

数据清洗决定了哪些文本可用,而配比(data mixing)、课程与退火(curriculum & annealing)、去污染(decontamination)决定各域文本以何种比例、在何种训练阶段进入模型,以及如何防止评测题泄漏进训练集。在千亿参数、万亿 token 量级下,这三项工作对最终能力的影响往往超过继续扩充语料规模。

登录后才可看