PL

LLM Domain Adaptation

A systematic journey to master domain-specific LLM adaptation & distillation

4
阶段
38
总周数
185
总任务数
64%
总进度

阶段路线图

Phase 1: Deep Dive

CPT + DPO/GRPO + Knowledge Distillation + Synthetic Data

深钻 阶段进度49/56 tasks (88%)
9

CPT 理论

Don't Stop Pretraining, HuatuoGPT-II, BloombergGPT, 灾难性遗忘

10

CPT 实战准备

医疗语料构建, 数据清洗 pipeline, 混合比例实验设计

11

CPT 实验(上)

Qwen3.5-0.8B-Base 全量 CPT 跑通(GPU hang 3 次试错解), 小数据过拟合反弹曲线

12

CPT 实验(下)+ 遗忘量化 + LoRA sweep

全量FT翻车(遗忘+42%)→换Qwen3-1.7B→LoRA sweep三比例domain gain全正,50-50最优成为后续baseline

13

DPO + GRPO 理论 + 数学推导

DPO/IPO/KTO/GRPO 论文精读, DPO loss 手推, 失败模式对比

14

DPO + GRPO 实战准备

偏好数据集构建, TRL DPOTrainer/GRPOTrainer 源码, 实验矩阵设计

15

DPO 实验(上)

β-sweep {0.1/0.3/0.5}, 无灾难遗忘✅, 但 holdout 胜率没涨=过拟合+长度偏差

16

DPO 实验(下)+ 失败模式 sweep

noise/极端β/IPO 三维 sweep, IPO 唯一正解(修 mean 不修 sum)

17

GRPO 实战(主攻深度方向)

MCQ 答对率 reward, holdout +2.2pp, 无遗忘, 实测裁断 TRL+MPS+GRPO 可跑

18

Distillation 理论

DistilBERT, Self-Instruct, Zephyr 7B, 三种蒸馏方法对比

19

Response Distillation 实战

本地 30B teacher 蒸馏, 三对照 real/distill/mixed, distill 知识保住

20

Feature Distillation + On-Policy(主攻深度方向)

Feature-level 对齐, On-policy 蒸馏, 三种策略完整对比

21

合成数据生成 + 数据质量评估

Self-Instruct, Evol-Instruct, 合成数据替代实验