大模型微调技术博客
分享大模型微调技术前沿、行业实践与最新研究成果
离线对齐如何追平迭代式 DPO?DP3O 偏好蒸馏方法解析
在大模型对齐(alignment)的实践里,一个让不少团队困惑的现象长期存在:直接偏好优化(Direct Preference Optimization, …
阅读全文 →
大模型量化后精度如何保住?REAL-Q 端到端损失对齐量化方法解析
大语言模型的落地,绕不开一个现实问题:显存和带宽。把权重从 16 位浮点压缩到 4 位整数,模型体积能缩小约 4 倍,推理成本大幅下降,但精度损失始终是量化部 …
阅读全文 →
LoRA 微调初始化如何逼近全参数微调?TaRA 训练感知低秩初始化方法解读
LoRA 自 2021 年提出以来,一直是参数高效微调(PEFT)事实上的标准,但它的效果对"怎么初始化"极度敏感——低秩分解天然存在信息瓶 …
阅读全文 →
LoRA 微调如何让优化器真正尊重低秩几何?LoRA-TSD 切空间谱下降优化器解析
自 Hu 等人 2021 年提出 LoRA 以来,参数高效微调(PEFT)的竞争焦点大多集中在"怎么初始化"上——从 PiSSA、DoRA …
阅读全文 →
LoRA 微调为什么收敛慢、还伴随灾难性遗忘?NoRA 归一化低秩适配方法解析
自 Hu 等人 2021 年提出 LoRA 以来,它几乎成了参数高效微调(PEFT)的代名词:冻结预训练权重,只训练两个低秩矩阵 A、B 的乘积,训练开销骤降、 …
阅读全文 →
大模型自我提升如何判断真假?Phantom Gains 控制组审计揭示七个测量陷阱
“自我提升”(self-improvement)是后训练阶段最诱人的叙事之一——让模型拿自己的输出当训练数据,像滚雪球一样越滚越强。但怎 …
阅读全文 →
大模型 4-bit 量化会让反复更新的信息更容易「遗忘」吗?Compress & Forget 实证解读
把开源大模型量化到 4-bit 再上线,早已是业界的默认动作——bitsandbytes 的 NF4/INT4 能在几乎不掉通用基准分的前提下,把显存占用和推 …
阅读全文 →
大模型微调如何摆脱反向传播的显存依赖?SubZero+ 零阶优化大学习率方法解析
零阶优化(Zeroth-Order, ZO)为大模型微调打开了一扇"不用反向传播"的门。2023 …
阅读全文 →
LoRA 微调如何进一步逼近全参数微调?LoRA-GA² 多步梯度自适应对齐方法解读
自 LoRA(Low-Rank Adaptation,arXiv:2106.09685)问世以来,它几乎成了大模型微调的事实标准:冻结预训练权重,只在旁路加两 …
阅读全文 →
GRPO 后训练中组梯度互相冲突怎么办?GUPO 梯度不确定性校准方法解析
自 DeepSeek-R1 把强化学习带进推理模型的后训练以来,GRPO(Group Relative Policy Optimization)几乎成了这一赛 …
阅读全文 →
低资源语言大模型如何学会用母语思考?SFT 打底 + 可验证奖励 RL 修补的双阶段微调方法
一个看似简单的问题正在困扰多语言大模型:当用户用低资源语言提问时,模型到底"用哪种语言在思考"?如果它心里默念的是英语、嘴上才切换成希腊语 …
阅读全文 →
长上下文推理 KV 缓存撑爆显存怎么办?OasisKV 前瞻稀疏预取把吞吐提升最高 2.1×
长上下文、长思维链(long-CoT)推理的兴起,正在把大模型推理服务从"算力受限"推向"显存受限"。 …
阅读全文 →
大模型个性化如何不更新权重实现微调?Weightless Fine-Tuning 以不到 7% 算力逼近 SFT
监督微调(SFT)是让大模型贴合目标分布的标准手段,但在"个性化"这类场景里,它的成本会迅速变得难以承受:每个作者、每个用户都要一份独立的 …
阅读全文 →
大模型 RL 对齐训练如何避免奖励黑客?Rubric Dropout 随机丢弃评分细则法解析
在对齐训练里,有一类任务没有"标准答案"——比如摘要写得好不好、客服话术得不得体、一段代码是否优雅。这类任务没法用规则判分,于 …
阅读全文 →
DPO 对齐训练如何避免 token 贡献一刀切?Se-DPO 自演化 Token Credit 方法解析
DPO(Direct Preference Optimization,直接偏好优化)已经成为大模型对齐训练的主流方法之一——它绕开了 RLHF 需要显式奖励模 …
阅读全文 →
大模型量化后非英语能力为何退化 2-4 倍?LCD 语言条件反量化方法解析
量化是让大模型跑上低成本硬件、支撑高并发推理部署的核心手段,但一个长期被低估的代价是:激进的量化会"不公平地"伤害非英语语言。2026 …
阅读全文 →
金融建议生成如何用 GRPO 超越商业大模型?因果审计验证 2 倍毛利润提升
为企业从经营报表自动生成可落地的财务建议,是大模型在金融 NLP 落地的高价值场景。这类任务要求模型同时具备数值推理、领域知识与风险判断能力,而直接监 …
阅读全文 →
多专家 LoRA 为何越加越臃肿?MoEGen 超网络生成式低秩更新解析
多专家 LoRA 的隐形包袱:存储随专家数线性膨胀 参数高效微调(PEFT)早已是企业定制大模型的标配,而把「混合专家(MoE)」思想搬进 PEFT 是一条自 …
阅读全文 →
大模型怎样从用户反馈中持续自我改进?SLIFT 双适配器选择性自学习框架解析
用户反馈是金矿,但也是雷区 做过企业级大模型落地的人都知道,模型上线只是开始。真正的持续改进来自用户每天与它交互时产生的反馈——“这里答错 …
阅读全文 →
微调后模型输出千篇一律怎么办?CreativeInstruct 创造力标记法与 GRPO 增益解读
后训练在换取"听话"的同时,付出了多样性代价 做过指令微调和 RLHF 的团队大多有过一个共同体验:模型变得更听话、更规范、更少胡说八道, …
阅读全文 →
大模型后训练没有标注答案怎么办?U-OPSD 零标注自蒸馏追平并超过有监督 GRPO
一、后训练最贵的那一项,其实是"答案" 在企业做大模型后训练,最先卡住项目的往往不是算力,而是标注。 无论走哪条技术路线,现有主流方法都要 …
阅读全文 →
任务知识该写进提示词还是微调进权重?KV-Skill 外挂算子把 4B 模型准确率从 23.4 拉到 77.2
一、当"写得对"不等于"做得到" 在企业落地大模型时,工程团队几乎都会遇到同一个岔路口:一段业务流程知识——比如风控审 …
阅读全文 →
多任务大模型微调为什么越练越差?SFT冲突与RL共存机理揭示,Parallel-RL并行训练保留103.2%单任务性能
研究背景:一个所有微调服务商都撞过的墙 给客户交付大模型定制时,最常见的需求形态不是"把某一件事做好",而是"把这五件事都做 …
阅读全文 →
微调后模型安全护栏为何失守?DataRx缺失感知采样用1%数据把攻击成功率从59.23%降至13.70%
研究背景:一个反直觉的安全退化现象 企业客户把通用大模型交给服务商做领域微调时,最常提的一个隐性诉求是:“别把模型微调坏了。“这里 …
阅读全文 →
多租户LoRA服务如何兼顾性能与效率?SALT子空间对齐训练框架解析
研究背景 在多租户大模型服务场景中,同时托管数十乃至数百个 LoRA 适配器已是主流做法。但这带来了一个棘手的系统困境:高秩适配器确实能带来更好的下游任务性 …
阅读全文 →
推理大模型为什么一量化到三值就崩?ScaleQ-1.58 「自推理校准」方法解读
大模型推理部署一直面临一个核心矛盾:全精度模型(FP16/BF16)精度高但显存和算力成本惊人,量化则能大幅降低部署门槛,但在极低位宽——尤其是 1.58 …
阅读全文 →
LoRA微调何时触发灾难性遗忘?Intruder Threshold光谱定律提前预测入侵维度阈值,一次SVD减少62%遗忘
一、LoRA微调的隐形代价:入侵维度与灾难性遗忘 LoRA(Low-Rank Adaptation)已成为大模型参数高效微调的事实标准——它只需在原有权重矩阵 …
阅读全文 →
多个LoRA适配器如何自动协同?LoGo无需训练即可实例级动态选择与合并
低秩适配(LoRA)已成为大模型参数高效微调的事实标准。一套基础模型搭配几十个 LoRA 适配器,即可覆盖从情感分析到代码生成等多种下游任务。然而一个关键工程 …
阅读全文 →
HARGO:置信度调制的GRPO优化,破解多任务异构对齐难题
研究背景:GRPO的"一视同仁"困境 Group Relative Policy Optimization (GRPO) 已成为2026年 …
阅读全文 →
CARE:让每个 Token 按需分配专家预算,MoE-LoRA 推理效率新范式
研究背景:MoE-LoRA 的"一刀切"困境 混合专家 LoRA(MoE-LoRA)已成为大模型高效微调的主流范式之一。 …
阅读全文 →
外挂记忆取代全参微调:MemSFT 实现零遗忘领域适配,通用能力保持率超 99.9%
一、领域微调的"宿命之痛":对齐税 大模型微调有个令人头疼的规律:领域能力提升越多,通用能力就掉得越多。这在学界被称为"对齐 …
阅读全文 →
2026年7月大模型微调技术月度综述:LoRA进化、GRPO反思与ACL 2026前沿扫描
一、月度概览 2026年7月,大模型微调领域迎来了全年最大规模的论文发布潮——ACL 2026于7月中旬在圣地亚哥召开,Findings和主会论文集中亮 …
阅读全文 →
【今日大模型微调速递】IFCLoRA:拓扑感知的LoRA秩分配,不增加训练成本即提升1.82%推理精度
LoRA 自提出以来已成为大模型参数高效微调(PEFT)的事实标准,但一个长期被忽视的问题始终存在:固定的秩预算如何在模型各层之间分配? …
阅读全文 →
清华&西交大联手登上Nature子刊:Hyper-RAG用超图计算将大模型幻觉降低48%
大语言模型(LLM)落地最大的拦路虎是什么?不是算力不够、不是参数量不够大,而是幻觉(hallucination)——模型一本正经地胡说八道。2026年5月,清 …
阅读全文 →
2026大模型微调技术五大趋势:从实验室到生产落地
趋势一:LoRA 从"固定秩"走向"动态秩" LoRA(Low-Rank Adaptation)自 2021 年提出以 …
阅读全文 →
【今日大模型微调速递】西交大提出 PACMR-DPO:无需元数据的元加权DPO,噪声标签下对齐性能大幅提升
研究背景 大语言模型对齐的核心方法之一——Direct Preference Optimization(DPO),因其省去了显式奖励建模和强化学习阶段的复杂性, …
阅读全文 →
【今日大模型微调速递】LeLoRA:ACL 2026 重磅提出可学习的低秩适配框架,让模型自己决定该微调哪些参数
在参数高效微调(PEFT)领域,LoRA(Low-Rank Adaptation)自 2021 年提出以来一直是事实标准。它的核心思想简洁而优雅:将权重更新限制 …
阅读全文 →