对于国内的大模型开发者而言,微调是将通用大模型适配到业务场景的核心步骤,但长期以来存在两个普遍痛点:一是不同参数高效微调(PEFT)技术的实际性能缺乏统一的横向对比标准,论文里的指标往往因为硬件、数据集、任务设置不同没有参考价值;二是视频、图像类多模态大模型的工业级分布式微调门槛高,往往需要大量自定义代码和格式转换工作。近期海外社区的两项更新,刚好针对性解决了这两个问题。

标准化LoRA微调排行榜上线:相同任务硬件下比真实耗时

开源社区最新推出的LoRA Speedrun项目,搭建了第一个完全公开的参数高效微调技术竞技场。该项目固定了所有评测变量:基础模型为Apache 2.0许可的Qwen2.5-1.5B,任务为微调至GSM8K测试集准确率≥57%,硬件统一为单张NVIDIA L40S显卡,排名指标直接采用开发者实际支付成本对应的墙钟耗时,而非没有实际参考意义的FLOPs或训练步数。

所有提交的记录都需要在网络隔离的沙箱环境中用不同随机种子独立运行3次,全部达标后取平均耗时作为正式成绩,任何人都可以通过Modal提供的免费计算额度提交方案或复现已有记录。目前排行榜的最佳成绩为6分05秒,采用序列打包+仅 completion 损失掩码的优化技巧,比无优化的基线方案耗时降低了49%,同时准确率还从59.4%提升到了61.1%。

该项目的核心价值在于解决了此前微调技术对比的“苹果与橘子”问题,DoRA、rsLoRA、PiSSA、LoRA+等各类PEFT变种,以及Unsloth、Liger等自定义内核优化,都可以在同一基准下公平比拼。由于L40S采用与消费级RTX 4090相同的AD102芯片,排行榜验证过的优化技巧可以直接迁移到消费级显卡的微调场景中。

Hugging Face联乘NVIDIA:扩散模型微调无需代码重写

Hugging Face与NVIDIA联合发布的NeMo Automodel与Diffusers深度整合方案,为多模态扩散模型的工业级微调提供了开箱即用的分布式训练能力。该方案完全原生支持Diffusers生态,开发者直接调用Hub上的Diffusers格式权重即可开始训练,无需进行任何 checkpoint 格式转换,训练完成的权重也可以直接加载到Diffusers Pipeline中进行推理,下游的量化、编译、自定义采样器等工具全部可以正常使用。

方案的并行能力完全通过配置文件实现,开发者无需改写模型代码,仅通过修改YAML配置即可切换FSDP2、张量并行、上下文并行、流水线并行等不同并行策略,可平滑支持从单卡到上百卡的训练规模。目前该方案已经内置了FLUX系列、Wan视频模型、混元视频、Qwen-Image等主流多模态模型的微调配方,同时支持全量微调与LoRA等参数高效微调模式。

当Diffusers生态新增支持新的扩散模型时,开发者仅需要添加少量数据预处理和模型适配代码,即可在NeMo Automodel中启用该模型的分布式训练能力,无需重写整个训练流水线,大幅缩短了新模型的落地周期。

实测性能:多模态微调效率最高提升超50%

官方公开的测试数据显示,在8张NVIDIA H100 80GB显卡的环境下,FLUX.1-dev的LoRA微调吞吐可达每秒53.73张512×512图像,比全量微调的35.51张/秒提升了51%,单卡吞吐可达6.72张/秒。针对视频模型的测试中,14B参数的Wan 2.1文本生成视频模型的LoRA微调,单卡每秒可处理0.263个49帧的512×512视频片段,显存占用比全量微调降低了近10GiB。

官方给出的落地案例显示,针对FLUX.1-dev模型在78张塔罗牌数据集上进行风格微调,仅需要200步训练即可稳定学习到目标风格,触发词调用时输出内容会呈现对应的复古塔罗牌视觉特征,不使用触发词时则保留基础模型的通用生成能力,不会出现风格泄露问题。

国内开发者的落地参考边界

这两项工具的适用场景有明确的边界,开发者可以根据自身需求选择。LoRA Speedrun排行榜更适合从事微调技术研发的团队,无需自行搭建统一测试环境,即可快速验证自己的PEFT优化、内核优化等技术方案的实际效果,优秀成果还可以获得全球行业曝光。NeMo Automodel则更适合做多模态AIGC业务的商业团队,无需投入大量人力开发分布式训练框架,即可快速落地10B级以上图像、视频模型的微调能力。

需要注意的是,LoRA Speedrun目前仅覆盖Qwen2.5-1.5B的数学推理任务,优化技巧在其他模型、其他任务上的泛用性需要额外验证,不能直接套用到所有业务场景。NeMo Automodel目前仅支持流匹配架构的扩散模型,传统扩散架构、大语言模型的微调还不支持,分布式调度目前也仅支持SLURM,Kubernetes支持还在开发中。