LLM Domain Adaptation
A systematic journey to master domain-specific LLM adaptation & distillation
阶段路线图
Phase 1: Deep Dive
CPT + DPO/GRPO + Knowledge Distillation + Synthetic Data
CPT 理论
Don't Stop Pretraining, HuatuoGPT-II, BloombergGPT, 灾难性遗忘
CPT 实战准备
医疗语料构建, 数据清洗 pipeline, 混合比例实验设计
CPT 实验(上)
Qwen3.5-0.8B-Base 全量 CPT 跑通(GPU hang 3 次试错解), 小数据过拟合反弹曲线
CPT 实验(下)+ 遗忘量化 + LoRA sweep
全量FT翻车(遗忘+42%)→换Qwen3-1.7B→LoRA sweep三比例domain gain全正,50-50最优成为后续baseline
DPO + GRPO 理论 + 数学推导
DPO/IPO/KTO/GRPO 论文精读, DPO loss 手推, 失败模式对比
DPO + GRPO 实战准备
偏好数据集构建, TRL DPOTrainer/GRPOTrainer 源码, 实验矩阵设计
DPO 实验(上)
β-sweep {0.1/0.3/0.5}, 无灾难遗忘✅, 但 holdout 胜率没涨=过拟合+长度偏差
DPO 实验(下)+ 失败模式 sweep
noise/极端β/IPO 三维 sweep, IPO 唯一正解(修 mean 不修 sum)
GRPO 实战(主攻深度方向)
MCQ 答对率 reward, holdout +2.2pp, 无遗忘, 实测裁断 TRL+MPS+GRPO 可跑
Distillation 理论
DistilBERT, Self-Instruct, Zephyr 7B, 三种蒸馏方法对比
Response Distillation 实战
本地 30B teacher 蒸馏, 三对照 real/distill/mixed, distill 知识保住
Feature Distillation + On-Policy(主攻深度方向)
Feature-level 对齐, On-policy 蒸馏, 三种策略完整对比
合成数据生成 + 数据质量评估
Self-Instruct, Evol-Instruct, 合成数据替代实验