课程介绍
这门课系统讲大模型微调。第 1 章剖析高效微调原理:什么场景需要微调与 RAG、微调与全量微调的区别、预训练流程与两个挑战、网络通信、数据并行、模型并行与 3D 并行、微调步骤和 LoRA 原理;第 2 章讲强化学习微调:强化学习、PPO、RLHF、DPO 与 GRPO。
第 3 章是大模型训练数据工程:微调数据的重要性与格式划分,预训练、SFT、偏好和 COT 数据集,数据集生成与工具部署,并动手构建 COT、SFT 和偏好数据集。第 4 章用 Llama-Factory 做 LoRA 微调和效果验证,并完成 Text2SQL 模型微调(数据集格式、准备、处理、注册、微调与 DeepSpeed 实战);第 5 章微调医疗场景 Embedding 模型,覆盖选型、数据集清洗、微调核心代码与效果检验。
第 6 章讲蒸馏专属大模型:蒸馏与微调的区别、蒸馏流程、资源评估与服务器租赁、全量微调工具部署、蒸馏数据集准备以及蒸馏前后效果对比;第 7、8 章以企业金融大模型微调项目收尾,完整讲 SFT 方案的设计与落地(数据集构建、LoRA 参数、训练监控指标与 ROUGE、Perplexity 评估、模型部署)和奖励模型方案(为什么选 GRPO、数据集构建策略、RewardBench 选型)。本帖目录为前 8 章,第 9 章(GRPO 方案)暂无课节。
网盘说明:本课程为百度网盘资源。
课程目录
第1章 模型高效微调原理剖析
1-1 课程介绍
1-2 高效微调原理之什么场景需要微调?
1-3 高效微调原理之什么场景需要RAG?
1-4 高效微调原理之微调和全量微调的区别
1-5 高效微调原理之预训练的流程
1-6 高效微调原理之预训练的两个挑战
1-7 高效微调原理之预训练之网络通信
1-8 高效微调原理之预训练之数据并行
1-9 高效微调原理之预训练之模型并行
1-10 高效微调原理之预训练之3D并行
1-11 高效微调原理之微调步骤
1-12 高效微调原理之LoRA原理
第2章 大模型强化学习原理剖析
2-1 强化学习微调之什么是强化学习?
2-2 强化学习微调之什么是PPO?
2-3 强化学习微调之什么是RLHF?
2-4 强化学习微调之什么是DPO?
2-5 强化学习微调之什么是GRPO?
第3章 大模型训练数据工程
3-1 大模型微调数据的重要性
3-2 大模型微调数据格式划分
3-3 大模型微调预训练数据集
3-4 大模型微调SFT数据集
3-5 大模型微调偏好数据集
3-6 大模型微调COT数据集
3-7 大模型微调数据集生成实战
3-8 大模型微调数据集工具部署
3-9 大模型微调数据集构建实操-构建COT数据集
3-10 大模型微调数据集构建实操-构建SFT数据集
3-11 大模型微调数据集构建实操-构建偏好数据集
第4章 Llama-Factory 微调实战
4-3 Llama-Factory微调之模型和数据准备
4-4 Llama-Factory微调之LoRa微调实战
4-5 Llama-Factory微调之模型效果验证
4-8 Text2SQL模型微调之数据集格式说明
4-9 Text2SQL模型微调之数据集准备
4-10 Text2SQL模型微调之数据处理
4-11 Text2SQL模型微调之数据集注册
4-12 Text2SQL模型微调之微调实战
4-15 Text2SQL模型微调之基于DeepSpeed实战
第5章 微调医疗场景 Embedding 模型
5-2 Embedding模型微调之适用场景剖析
5-3 Embedding模型微调之基础模型选型
5-4 Embedding模型微调之数据集准备
5-5 Embedding模型微调之技术方案选型
5-6 Embedding模型微调之环境准备
5-7 Embedding模型微调之基础模型校验
5-8 Embedding模型微调之数据集校验
5-9 Embedding模型微调之数据集清洗
5-11 Embedding模型微调之微调数据准备核心逻辑
5-12 Embedding模型微调之微调核心代码
5-13 Embedding模型微调之微调效果检验
第6章 蒸馏专属大模型
6-1 模型蒸馏之蒸馏和微调的本质区别
6-2 模型蒸馏之微调和全量微调的本质区别
6-3 模型蒸馏之为什么蒸馏方案突然火了起来?
6-4 模型蒸馏之模型推理能力的重要性
6-5 模型蒸馏之蒸馏流程剖析
6-6 模型蒸馏之全量微调工具推荐
6-7 模型蒸馏之资源评估和服务器租赁
6-8 模型蒸馏之基础模型下载
6-9 模型蒸馏之全量微调工具安装部署
6-10 模型蒸馏之蒸馏数据格式说明
6-11 模型蒸馏之基础模型效果测试
6-12 模型蒸馏之蒸馏数据集准备
6-13 模型蒸馏之基于Llama-Factory进行全量微调
6-14 模型蒸馏之模型蒸馏前后效果对比
第7章 企业金融大模型微调项目—SFT 方案设计与落地
7-1 整体项目之项目背景
7-2 整体项目之项目需求
7-3 整体项目之技术方案
7-4 SFT 微调之微调技术流程
7-5 SFT 微调之数据集选择
7-6 SFT 微调之模型选型
7-7 SFT 微调之微调方案选型
7-8 SFT 微调之数据集构建 – 数据集解析
7-9 SFT 微调之数据集构建 – 数据构建策略
7-10 SFT 微调之数据集构建 – 单轮数据集构建
7-11 SFT 微调之数据集构建 – 多轮数据集构建
7-12 SFT 微调之 LoRa 微调 – 微调技术方案选型
7-13 SFT微调之LoRa微调-微调技术方案设计思考
7-14 SFT微调之LoRa微调-微调环境构建
7-15 SFT微调之LoRa微调-微调基座模型下载
7-16 SFT微调之LoRa微调-数据样本初始化
7-17 SFT微调之LoRa微调-数据处理
7-18 SFT微调之LoRa微调-LoRA参数配置
7-19 SFT微调之LoRa微调-SFT微调参数配置
7-20 SFT微调之LoRa微调-创建数据整理器
7-21 SFT微调之LoRa微调-基础模型加载
7-22 SFT微调之LoRa微调-模型评估内存优化回调函数
7-23 SFT微调之LoRa微调-最佳模型保存函数
7-24 SFT微调之LoRa微调-最后模型保存函数
7-25 SFT微调之LoRa微调-模型微调的早停机制
7-26 SFT微调之LoRa微调-微调的checkpoints机制设置
7-28 SFT微调之LoRa微调-TensorBoard可视化监控
7-29 SFT微调之LoRa微调-核心监控指标之train_loss分析
7-30 SFT微调之LoRa微调-核心监控指标之eval_loss分析
7-31 SFT微调之LoRa微调-核心监控指标之learning_rate分析
7-32 SFT微调之LoRa微调-核心监控指标之grad_norm分析
7-33 SFT微调之LoRa微调-多轮对话微调数据处理
7-34 SFT微调之LoRa微调-微调效果评估之ROUGE指标
7-35 SFT微调之LoRa微调-微调效果评估之Perplexity指标
7-36 SFT微调之LoRa微调-微调效果评估之评估效果说明
7-37 SFT微调之LoRa微调-微调效果评估之SFT模型部署
第8章 企业金融大模型微调项目—奖励模型方案设计与落地
8-1 奖励模型之需求背景分
8-2 奖励模型之为什么选GRPO?
8-3 奖励模型之为什么GRPO必须微调奖励模型?
8-4 奖励模型之整体流程设计
8-5 奖励模型之微调数据集构建方案思考
8-6 奖励模型之微调数据集构建策略
8-7 奖励模型之微调数据集构建脚本执行
8-8 奖励模型之奖励模型训练路径分析
8-9 奖励模型之基于RewardBench排行榜选型
8-10 奖励模型之奖励模型选型
配套资料
资料