增量预训练后Loss不下降、微调后模型只会回答训练样本中的问题、蒸馏数据包含教师模型的错误、科学计算模型盐度损失异常波动——这些是NLP大模型训练中最常见也最棘手的问题。华为云《盘古大模型最佳实践》系统总结了增量预训练、微调、蒸馏、科学计算四类训练场景的实操经验,为模型调优提供了可复用的方法论。
增量预训练——让模型学习领域知识
训练参数与Loss曲线解读
金融场景增量预训练使用CCI3.0-HQ、FineWeb Edu、IndustryCorpus2数据集,配比1:6。训练参数:热身比例0.01、数据批量大小32、学习率0.000005、训练轮数1。正常Loss曲线应随迭代步数增加呈下降趋势直至稳定。
核心评价思想是“收益有多大,代价有多高”——对比训练前后模型在领域评测集上的性能提升,以及通用能力是否发生遗忘。若领域能力未达预期,需检查数据质量、增加领域数据比例;若通用能力下降严重,需增加通用指令数据比例。
典型问题与解决方案
训练过程中Loss偶尔出现突刺——同时监控grad norm数值,若同步跳变说明数据质量较差,需再次精细加工。训练Loss逐步降到0——训练轮数过多产生过拟合,应减少训练轮次(通常1-2轮即可)。Loss迟迟不下降或隐约上升——学习率过大,建议减小学习率重新训练。Loss波动较大——检查Batch Size设置,适当增加使训练更平稳。
微调训练——提升特定任务能力
训练参数与过拟合/欠拟合诊断
催收意图识别微调使用31万条通用+8万条行业数据,配比1:4。训练参数:热身比例0.01、序列长度32768、数据批量大小8、学习率0.00002、训练轮数3。
微调后模型回答重复某句话——检查话题重复度控制/温度/核采样参数设置,适当增大参数值;检查训练数据是否存在文本重复;检查训练轮次或学习率是否过高导致过拟合。回答出现乱码——检查数据是否包含异常字符,检查训练轮次或学习率,适当降低推理温度或核采样。回答异常中断——检查最大Token限制,增加该参数值;检查数据是否包含异常截断。只能回答训练样本中的问题——过拟合,降低训练轮次或学习率。
微调数据质量优化
一份高质量数据应具备:数据与目标任务一致、无异常样本(空数据、重复、水印、异常字符)、数据多样性。情感分类场景典型低质量数据包含与目标任务不一致的样本或Prompt不固定。文案创作场景典型低质量数据多样性差。优化方案:数据过滤(去空、去重、字符串过滤、PPL困惑度过滤)、数据转换(同义词替换、语法结构修改)、基于大模型的数据泛化、人工标注。
模型蒸馏——能力迁移到小模型
蒸馏流程与数据质量
催收意图识别需要识别6种意图:咨询、投诉、表扬、建议、催复、投诉撤销。使用DeepSeek-R1-32K作为教师模型,对500条场景数据进行蒸馏,配比1500条通用+1500条金融指令数据。学生模型Pangu-NLP-N1-Reasoner-128K全量微调,训练轮数1、学习率0.00002。
教师模型的缺陷会被学到——蒸馏数据需进行清洗和校准。真实场景性能要求与模型规模不匹配——需聚焦小场景针对性优化。过拟合问题——进行多次蒸馏采样增加数据多样性。
科学计算大模型微调
数据预处理与参数优化
区域海洋要素模型可预报15层深海层(0m至500m)的海温、海盐、海流经向/纬向速率和海表高度,时间分辨率24h,水平分辨率1/12°。微调使用Hycom再分析数据,要求包含5个表面层特征和15个深海层特征。
数据预处理优化案例:盐度(S)变量存在数据缺失与数据块偏移,导致训练损失异常、波动大且不收敛。通过统计学方法(四分位距、Z-score、样本分布)和可视化方法排查异常值并删除后,盐度损失恢复正常收敛。训练参数优化建议:学习率过高导致损失波动甚至梯度爆炸,使用学习率衰减策略;学习率过低导致下降缓慢,使用学习率预热方法。