主流大模型精调方式的系统对比(模型 精度)
ccwgpt 2025-07-14 15:18 4 浏览 0 评论
预训练后精调框架对比
方法 | 核心思想 | 数据需求 | 成本 | 典型应用场景 | 代表模型 |
Post-pretrain | 领域增量预训练 | 大规模领域文本 | 极高 | 专业领域适应(医疗/法律) | Galactica |
SFT | 监督式指令微调 | 高质量标注对 | 中-高 | 基础能力对齐 | LLaMA-2-Chat |
RFT | 基于反思的迭代优化 | 错误修正数据 | 中 | 复杂推理提升 | ReSTEM |
DPO | 直接偏好优化(替代RLHF) | 偏好排序数据 | 低 | 快速对齐 | Zephyr-7B |
KTO | Kahneman-Tversky优化理论驱动 | 二元反馈 | 极低 | 轻量级对齐 | 最新研究 |
RLHF | 基于人类反馈的强化学习 | 多轮偏好标注 | 极高 | 安全对齐 | ChatGPT |
SimPO | 相似性优先优化(无奖励模型) | 正负样本对 | 中 | 小规模高效对齐 | InternLM2 |
预训练:Post-pretrain
您可以基于大量的无标注纯文本数据定制行业或者领域大模型,并进一步SFT提升指令遵循能力。
监督微调:SFT
提供全量更新、LoRA的训练模式。通过有监督的方式精调模型,从而提升模型在特定任务上的指令遵循能力。
偏好对齐:RFT
RFT的核心是通过自动化生成的奖励信号驱动模型优化,让模型通过多轮试错和反馈逐步提升推理能力。
偏好对齐:DPO
基于成对的正负反馈数据,直接训练大模型,使其更符合人类偏好。
偏好对齐:KTO
根据用户正向或负向反馈进行模型训练,高效对齐用户行为偏好。
偏好对齐:RLHF-奖励模型
基于人类反馈的偏好排序数据训练奖励模型。
偏好对齐:RLHF-强化学习
通过最大化奖励来调优大模型,使得大模型与人类偏好对齐。
偏好对齐:SimPO
基于成对的正负反馈数据,简单高效的对齐偏好信息。
前沿进展
混合策略:
- SFT→DPO→RLHF 三阶段 pipeline(Claude 3)
- RFT+SimPO 迭代优化(Google Gemini)
计算优化:
- MemFree-RLHF:显存占用降低70%
- 1-bit RLHF:量化强化学习
理论突破:
- Distributional DPO:建模偏好不确定性
- Meta-KTO:动态调整损失敏感系数
6. 生产环境建议
- 快速上线:DPO(Zephyr方案)
- 安全关键型:RLHF+安全过滤器(OpenAI范式)
- 小团队低成本:SimPO+LoRA(仅需2块A100)
- 领域专家模型:Post-pretrain → SFT → RFT
典型代码库推荐:
- TRL(HuggingFace RLHF全流程)
- Alignment Handbook(DPO/KTO实现)
- DeepSpeed-Chat(RLHF优化)
相关推荐
- RACI矩阵:项目管理中的角色与责任分配利器
-
作者:赵小燕RACI矩阵RACI矩阵是项目管理中的一种重要工具,旨在明确团队在各个任务中的角色和职责。通过将每个角色划分为负责人、最终责任人、咨询人和知情人四种类型,RACI矩阵确保每个人都清楚自己...
- 在弱矩阵组织中,如何做好项目管理工作?「慕哲制图」
-
慕哲出品必属精品系列在弱矩阵组织中,如何做好项目管理工作?【慕哲制图】-------------------------------慕哲制图系列0:一图掌握项目、项目集、项目组合、P2、商业分析和NP...
- Scrum模式:每日站会(Daily Scrum)
-
定义每日站会(DailyScrum)是一个Scrum团队在进行Sprint期间的日常会议。这个会议的主要目的是为了应对Sprint计划中的不断变化,确保团队能够有效应对挑战并达成Sprint目标。为...
- 大家都在谈论的敏捷开发&Scrum,到底是什么?
-
敏捷开发作为一种开发模式,近年来深受研发团队欢迎,与瀑布式开发相比,敏捷开发更轻量,灵活性更高,在当下多变环境下,越来越多团队选择敏捷开发。什么是敏捷?敏捷是一种在不确定和变化的环境中,通过创造和响应...
- 敏捷与Scrum是什么?(scrum敏捷开发是什么)
-
敏捷是一种思维模式和哲学,它描述了敏捷宣言中的一系列原则。另一方面,Scrum是一个框架,规定了实现这种思维方式的角色,事件,工件和规则/指南。换句话说,敏捷是思维方式,Scrum是规定实施敏捷哲学的...
- 敏捷项目管理与敏捷:Scrum流程图一览
-
敏捷开发中的Scrum流程通常可以用一个简单的流程图来表示,以便更清晰地展示Scrum框架的各个阶段和活动。以下是一个常见的Scrum流程图示例:这个流程图涵盖了Scrum框架的主要阶段和活动,其中包...
- Mockito 的最佳实践(mock方法)
-
记得以前面试的时候,面试官问我,平常开发过程中自己会不会测试?我回答当然会呀,自己写的代码怎么不测呢。现在想想我好像误会他的意思了,他应该是想问我关于单元测试,集成测试以及背后相关的知识,然而当时说到...
- EffectiveJava-5-枚举和注解(java枚举的作用与好处)
-
用enum代替int常量1.int枚举:引入枚举前,一般是声明一组具名的int常量,每个常量代表一个类型成员,这种方法叫做int枚举模式。int枚举模式是类型不安全的,例如下面两组常量:性别和动物种...
- Maven 干货 全篇共:28232 字。预计阅读时间:110 分钟。建议收藏!
-
Maven简介Maven这个词可以翻译为“知识的积累”,也可以翻译为“专家”或“内行”。Maven是一个跨平台的项目管理工具。主要服务于基于Java平台的项目构建、依赖管理和项目信息管理。仔...
- Java单元测试框架PowerMock学习(java单元测试是什么意思)
-
前言高德的技术大佬在谈论方法论时说到:“复杂的问题要简单化,简单的问题要深入化。”这句话让我感触颇深,这何尝不是一套编写代码的方法——把一个复杂逻辑拆分为许多简单逻辑,然后把每一个简单逻辑进行深入实现...
- Spring框架基础知识-第六节内容(Spring高级话题)
-
Spring高级话题SpringAware基本概念Spring的依赖注入的最大亮点是你所有的Bean对Spring容器的存在是没有意识的。但是在实际的项目中,你的Bean必须要意识到Spring容器...
- Java单元测试浅析(JUnit+Mockito)
-
作者:京东物流秦彪1.什么是单元测试(1)单元测试环节:测试过程按照阶段划分分为:单元测试、集成测试、系统测试、验收测试等。相关含义如下:1)单元测试:针对计算机程序模块进行输出正确性检验工作...
- 揭秘Java代码背后的质检双侠:JUnit与Mockito!
-
你有没有发现,现在我们用的手机App、逛的网站,甚至各种智能设备,功能越来越复杂,但用起来却越来越顺畅,很少遇到那种崩溃、卡顿的闹心事儿?这背后可不是程序员一拍脑袋写完代码就完事儿了!他们需要一套严谨...
- 单元测试框架哪家强?Junit来帮忙!
-
大家好,在前面的文章中,给大家介绍了以注解和XML的方式分别实现IOC和依赖注入。并且我们定义了一个测试类,通过测试类来获取到了容器中的Bean,具体的测试类定义如下:@Testpublicvoid...
你 发表评论:
欢迎- 一周热门
- 最近发表
- 标签列表
-
- 框架图 (58)
- flask框架 (53)
- quartz框架 (51)
- abp框架 (47)
- jpa框架 (47)
- springmvc框架 (49)
- 分布式事务框架 (65)
- scrapy框架 (56)
- shiro框架 (61)
- 定时任务框架 (56)
- java日志框架 (61)
- JAVA集合框架 (47)
- mfc框架 (52)
- abb框架断路器 (48)
- ui自动化框架 (47)
- beego框架 (52)
- java框架spring (58)
- grpc框架 (65)
- ppt框架 (48)
- 内联框架 (52)
- cad怎么画框架 (58)
- ps怎么画框架 (47)
- ssm框架实现登录注册 (49)
- oracle字符串长度 (48)
- oracle提交事务 (47)