LLaMA Factory是什么?
LLaMA Factory是一套面向大语言模型和视觉语言模型的开源训练、微调、评估与推理框架。它把模型加载、数据模板、训练阶段、参数高效微调、分布式训练、量化、导出和部署入口整合在统一的命令行与WebUI中,目标是减少不同模型之间重复编写训练代码的成本。
项目支持100多种LLM与VLM,覆盖LLaMA、LLaVA、Qwen、Mistral、Mixtral、Gemma、Yi、Baichuan、ChatGLM、Phi等常见系列。框架本身不提供模型权重、训练数据或GPU算力,使用者仍需遵守每个模型与数据集各自的许可证。
0.9.5版本更新
截至本次核验,官方最新公开版本为0.9.5,于2026年5月发布,重点增加Qwen3.5、Qwen3.6、Gemma 4和Transformers v5支持,并加入FSDP2、ROCm 7.2及Intel XPU相关适配与修复。当前安装文档也将Python环境要求更新到3.11及以上,升级旧项目时应重新核对PyTorch、Transformers、CUDA或NPU组件的兼容组合。
版本号变化可能影响模型模板、配置字段和量化后端。生产任务不建议直接跟随主分支,应固定LLaMA Factory、Transformers、PyTorch、加速库和模型Revision,再用短任务验证后升级。
零代码WebUI
LLaMA Factory WebUI提供训练、评估与预测、对话和导出四类主要界面。用户可以选择模型、训练阶段、数据集、微调方式、量化位数、学习率、批大小和输出目录,然后启动任务并查看日志,适合第一次接触大模型微调或需要重复调整配置的用户。
WebUI只是配置与任务入口,不会降低模型本身的显存和算力需求。模型路径、聊天模板、数据格式、量化方法或设备环境配置错误时,界面同样会启动失败;长时间任务仍应配合进程管理、日志、Checkpoint与训练监控。
命令行与YAML配置
熟悉工程流程的用户可用命令行和YAML文件启动训练。配置文件可以保存模型位置、数据集、模板、训练阶段、微调类型、优化器、精度、分布式方式、保存策略和评估参数,便于放入版本控制并在多台机器复现。
正式项目应把配置、依赖锁定、数据版本、随机种子和代码提交一起归档。API Key、访问令牌和内部存储地址不要直接写入公开YAML或日志,应通过环境变量或Secret管理。
数据集格式与模板
自定义数据集通常需要在data_info配置中登记名称、文件路径、字段映射和格式。框架支持指令微调、对话、多轮消息、偏好对、KTO反馈以及图像、视频等多模态数据。数据格式与所选训练阶段不匹配会直接报错或产生错误标签。
聊天模板决定系统提示、角色标记、停止符和标签遮罩。训练、评估、对话、合并与API部署应使用一致模板;只看Loss下降并不能发现模板错位,最好抽查Tokenizer后的输入和目标Token。
预训练与监督微调
框架支持增量预训练和监督微调。增量预训练用于让基础模型继续学习领域语料,监督微调用问答或对话样本训练指令遵循能力。两者的数据构造、学习率、训练长度和评估方法不同,不应仅修改一个阶段参数就互相替代。
领域语料需要去重、清洗、版权审查和隐私处理。监督数据还要检查答案正确性、拒答边界、格式一致性与长短分布,低质量合成数据会把错误模式写入模型。
Full、Freeze与LoRA
Full全参数微调会更新模型大部分或全部参数,灵活性高但显存、通信和Checkpoint成本最大。Freeze只训练选定层或模块,在资源与效果之间折中。LoRA通过低秩适配器训练少量参数,是个人工作站和多任务适配中最常用的方式。
框架还支持DoRA、LoRA+、LongLoRA、PiSSA、LoftQ、LLaMA Pro、Mixture-of-Depths、GaLore和BAdam等方法。不同方法并非在所有模型、设备和分布式后端上都兼容,选择前应以当前版本文档和小样本实验为准。
QLoRA与低比特量化
QLoRA在低比特基础模型上训练LoRA适配器,可显著降低显存占用。框架支持2、3、4、5、6和8位方案,并可接入AQLM、AWQ、GPTQ、LLM.int8、HQQ和EETQ等后端,但实际可用性受到操作系统、GPU、模型结构和依赖版本限制。
低比特训练不等于任何显卡都能运行。模型权重之外还要为KV、激活、优化器、梯度、数据批次和上下文长度留出空间;量化也可能降低吞吐或精度,应同时测试训练稳定性与下游效果。
偏好优化与强化学习
LLaMA Factory支持奖励模型训练、PPO、DPO、KTO、ORPO等偏好对齐流程,并覆盖多种直接偏好优化变体。DPO一类方法通常使用胜负回答对,KTO可以使用正负反馈样本,PPO还需要奖励、价值与策略相关组件。
偏好数据应控制长度、主题、难度和标注者偏差。Reward上升不代表事实性、安全性和用户体验全面提升,正式发布前需要独立基准、人工盲评、红队测试和回归评估。
多模态模型微调
框架可训练LLaVA、Qwen视觉语言模型等多模态架构,把图像或视频字段与文本消息共同输入。多模态任务适合视觉问答、文档理解、图表分析和图片描述,但不同模型的媒体占位符、分辨率、帧采样和模板要求不同。
图像与视频数据会显著提高存储、解码、显存和数据加载开销。上传或训练前还要处理人物肖像、版权图片、敏感文档和地理位置等风险。
DeepSpeed、FSDP与多机训练
大模型训练可以接入DDP、DeepSpeed、FSDP、FSDP2和Ray等方案,利用数据并行、参数分片和优化器状态分片扩展到多卡或多机。0.9.5增加FSDP2支持,为较新的PyTorch分片接口提供入口。
分布式训练需要统一驱动、通信库、网络、主机时间和共享存储,并正确设置全局Batch、梯度累积与保存方式。单卡配置直接放大到多机可能引起学习率、吞吐、通信和Checkpoint问题。
NVIDIA、AMD、Intel与昇腾NPU
常用环境包括NVIDIA CUDA,也提供AMD ROCm和Intel XPU相关支持。昇腾场景覆盖Atlas A2与A3训练系列,可进行预训练、SFT、奖励模型、DPO,以及Full、Freeze、LoRA、适配器合并、DDP、FSDP、FSDP2和DeepSpeed,并可使用部分NPU融合算子。
昇腾环境需要匹配CANN、驱动、固件、PyTorch与torch-npu版本;CUDA、ROCm和XPU也有各自矩阵。硬件名称出现在文档中不等于所有模型与算子都已验证,应按模型、精度、算子和集群规模做兼容性测试。
FlashAttention、Unsloth与训练加速
框架可使用FlashAttention-2降低注意力计算的显存与时间开销,并可选择Unsloth等加速路径。它们对GPU架构、PyTorch、CUDA、Triton和模型实现有明确要求,安装失败时应先回到官方基础环境验证。
吞吐提高不应以数值不稳定为代价。启用混合精度、梯度检查点、编译或融合算子后,要比较Loss、梯度、显存、速度和最终评估,保留一套可回退的基准配置。
Checkpoint、LoRA合并与模型导出
训练过程可按步数或Epoch保存Checkpoint,并设置保留数量。每个实验应使用独立输出目录,避免覆盖不同数据、模板或超参数的适配器。LoRA训练完成后可与基础模型合并,并按目标后端导出或量化。
合并操作需要足够的CPU内存、显存和磁盘临时空间。合并后的模型体积接近基础权重,且不能因此获得基础模型未授予的再分发权;发布前要附带正确许可证与模型卡。
对话、批量推理与vLLM
框架提供命令行Chat和网页对话入口,可加载基础模型或指定LoRA适配器进行检查。批量预测可使用Transformers或vLLM推理引擎,vLLM更适合高吞吐生成,但支持范围、量化格式和显存管理方式与训练端不同。
训练成功不等于部署可用。应测试首Token延迟、吞吐、并发、上下文长度、停止条件、结构化输出、GPU占用和异常输入,并确认加载的Adapter、模板与基础模型完全对应。
OpenAI兼容API
使用API启动命令可以把模型暴露为OpenAI兼容服务,方便现有客户端、评测工具或应用接入。服务端可指定模型、模板、微调类型和适配器路径,也能与流式输出结合。
该接口是部署入口而非托管云服务。生产使用要自行补充认证、TLS、限流、审计、内容安全、队列、健康检查、自动恢复和资源隔离,不能把无鉴权端口直接暴露到公网。
实验监控与报告
训练配置可接入TensorBoard、Weights & Biases、SwanLab、MLflow和Trackio等实验跟踪工具,记录Loss、学习率、奖励、吞吐、显存和评估指标。团队应统一项目、Run名称、Tag和保存周期,避免实验无法追溯。
监控平台可能收到配置、日志和生成样本。涉及企业数据或用户提示词时,应选择本地存储或私有化方案,并在上报前脱敏。
安装方式
常见安装流程是克隆官方仓库,在独立Python环境中执行可编辑安装,并按需要安装评估、量化、分布式、NPU或推理依赖,最后用版本命令验证。Windows、Linux、WSL、Docker与不同加速卡的依赖组合并不相同。
安装前先确定训练设备和后端,再选择PyTorch与驱动版本,比一次安装全部可选依赖更稳定。线上机器应记录环境清单,并将模型缓存、数据、输出和临时目录放在容量充足的磁盘。
价格与使用成本
LLaMA Factory核心软件免费开源,没有官方订阅费。实际成本来自GPU或NPU算力、云主机、存储、网络、模型下载、数据制作、标注、评测和运维。全参数训练、多机训练和长上下文数据的成本会远高于LoRA小规模实验。
网络上出现的LLaMA Factory Online等托管服务属于独立的云端产品或合作服务,GPU单价和权益会动态变化,不能把其价格当成开源项目的官方软件价格。
是否开源?
LLaMA Factory仓库采用Apache License 2.0,可按许可证使用、修改与分发。该许可证只覆盖项目代码,不自动覆盖Meta、Qwen、Google、智谱等第三方模型,也不覆盖用户数据、数据集或生成内容。
商业使用前必须分别检查代码依赖、模型权重、Tokenizer、数据集和评测集条款。某些模型限制商用、用户规模、领域或再分发方式。
适合哪些用户?
- 希望用WebUI完成第一次LoRA或QLoRA微调的学习者;
- 需要统一训练多种开源LLM与VLM的算法工程师;
- 进行SFT、DPO、KTO、PPO与奖励模型实验的研究团队;
- 需要DeepSpeed、FSDP或昇腾NPU分布式训练的机构;
- 希望合并Adapter、批量评测并部署兼容API的开发者。
产品优势
- 覆盖100多种语言与视觉语言模型;
- WebUI与CLI兼顾入门和可复现工程流程;
- Full、Freeze、LoRA、QLoRA及多种新型微调方法齐全;
- 支持预训练、SFT、奖励建模与多种偏好优化阶段;
- 兼容DeepSpeed、FSDP、vLLM和多类硬件;
- Apache 2.0开源,社区活跃且更新频繁。
限制与注意事项
模型支持列表很长,但不同训练阶段、量化方案和硬件组合并非全部可用。WebUI不能代替数据清洗、显存估算、依赖管理和评估;全参数微调需要大量显存与存储,QLoRA也可能受操作系统和量化后端限制。
启用trust_remote_code会执行模型仓库提供的代码,应固定可信Revision并审查来源。公开服务需要鉴权与安全控制,训练数据需要处理隐私、版权和提示注入风险。
常见问题
LLaMA Factory免费吗?
核心代码免费且采用Apache 2.0许可证。GPU云主机、存储、模型与数据可能产生费用,第三方托管服务另行计价。
LLaMA Factory支持哪些微调方法?
支持Full、Freeze、LoRA、QLoRA,以及DoRA、LoRA+、PiSSA等扩展;训练阶段包括预训练、SFT、奖励建模、PPO、DPO、KTO和ORPO等。
没有编程经验可以使用吗?
可以通过WebUI配置训练、评估、对话和导出,但仍需理解模型、数据格式、模板、显存和环境依赖。建议先用小模型与少量数据验证完整流程。
可以部署API吗?
可以启动OpenAI兼容API,也可用vLLM进行批量或高吞吐推理。正式上线需要自行建设鉴权、限流、安全审核与监控。
支持昇腾NPU吗?
支持Atlas A2与A3训练系列及多种训练阶段和分布式方案,但必须匹配CANN、驱动、固件、PyTorch与torch-npu版本。
LLaMA Factory是模型吗?
不是。它是训练与微调框架,不自带可直接商用的模型权重。用户需要选择并下载符合许可证的基础模型。
桂公网安备45132202000164号