LoRA for Diffusion(Diffusion LoRA)
3 秒看懂
LoRA for Diffusion 是将低秩适配(Low-Rank Adaptation)技术嫁接到扩散模型(Stable Diffusion / SDXL / Flux 等)上的微调方法:冻结原始模型数十亿参数的权重,仅训练注入注意力层的一对小型低秩矩阵(通常几 MB~几十 MB),即可学会特定风格、角色或物体,实现”轻量定制”。
一句话价值: 把”重训一个大模型”变成”训练一个可叠加的小插件”,大幅降低定制门槛与算力成本。
3 分钟产业解释
为什么重要?
扩散模型(Diffusion Model)是当前 AI 图像/视频生成的主干技术。Stable Diffusion、DALL·E、Midjourney 底层均基于此范式。然而,原始预训练模型只能输出”通用”内容——如果品牌方想要”特定画风”、游戏公司想要”特定角色”、电商想要”特定商品图”,就需要针对自有数据做微调(fine-tuning)。
传统全量微调的痛点:
| 维度 | 全量微调(Full Fine-Tuning) | Diffusion LoRA |
|---|---|---|
| 可训练参数量 | 数亿至数十亿 | 数万~数百万 |
| 存储占用 | 数 GB(一个完整模型副本) | 数 MB~数十 MB |
| 训练所需 VRAM | 高(通常需 A100 80GB 级别) | 中低(消费级 GPU 亦可) |
| 训练数据量 | 通常需数千~数万张 | 数十~数百张即可起步 |
| 可组合性 | 不同微调版本不可叠加 | 多个 LoRA 可按权重叠加混用 |
| 训练耗时 | 数小时~数天 | 数分钟~数小时 |
LoRA 将”微调一个完整大模型”变成了”训练一个可插拔的小适配器”,其核心商业价值在于:
- 大幅降低定制成本:消费级 GPU(如 RTX 4090)即可完成训练,CivitAI 等平台上有数十万个社区贡献的 LoRA 适配器。
- 催生模型生态:类似手机 App Store,LoRA 适配器可独立分发、叠加组合,形成围绕基础模型的”微调生态”。
- 企业落地加速:品牌风格迁移、IP 角色一致性、工业设计特定品类生成等场景,从”概念验证”到”可用”的时间大幅缩短。
产业链位置
基础大模型(Stability AI / OpenAI / Black Forest Labs)
│
▼
微调框架 & 工具链(kohya_ss / HuggingFace PEFT / Ostris AI Toolkit)
│
▼
LoRA 适配器创作者(社区创作者 / 企业内部团队)
│
▼
分发平台(CivitAI / HuggingFace Hub / 企业内部模型仓库)
│
▼
终端应用(ComfyUI / WebUI / API 服务 / 企业级工作流)
15 分钟专家深入
核心机制:为什么低秩分解有效?
LoRA 的理论出发点来自一个经验观察——Aghajanyan et al.(2021)的 “Intrinsic Dimensionality” 研究指出,预训练大模型的参数更新在微调任务上通常具有较低的内在维度(intrinsic dimensionality)。换言之,适应新任务所需的权重变化 ΔW 实际上位于一个低秩子空间内。
基于此,LoRA 不直接学习 ΔW(维度为 d×k),而是将其分解为两个小矩阵的乘积:
\Delta W = B \cdot A, \quad B \in \mathbb{R}^{d \times r}, \ A \in \mathbb{R}^{r \times k}, \quad r \ll \min(d, k)
在前向传播时:
h = W_0 x + \frac{\alpha}{r} \cdot B A x
其中:
- W₀:原始预训练权重(冻结,不更新)
- r(rank):低秩矩阵的秩,核心超参数
- α(alpha):缩放因子,控制 LoRA 贡献的强度
- α/r:实际缩放比,确保不同 rank 下训练稳定性
关键洞察:当 r=64 时,对于一个 d=k=1024 的注意力投影矩阵,原始 ΔW 需要 1,048,576 个参数,而 LoRA 仅需 2×1024×64 = 131,072 个参数,压缩比约 8×。对整个模型的数十个注意力层累积,总体压缩效应极为可观。
Diffusion LoRA 的技术特化
将 LoRA 应用于扩散模型时,有几个区别于 LLM 应用的关键特征:
1. 目标层选择
在经典的 Stable Diffusion 1.x/2.x 架构中,U-Net 包含三类注意力层:
| 层类型 | 说明 | LoRA 常用目标 |
|---|---|---|
| Self-Attention | U-Net 各分辨率层内部的自注意力 | Q, K, V, Out 投影 |
| Cross-Attention | 将文本嵌入条件注入 U-Net 的交叉注意力 | Q, K, V, Out 投影 |
| FFN / MLP | 注意力后的前馈网络 | 有时也纳入 |
实践中的经验(来源:社区经验汇总):
- 仅适配 cross-attention 的 K/V 投影是最轻量的方案,文件仅数 MB。
- 适配全部 self-attention + cross-attention 的 Q/K/V/Out 是社区”全量 LoRA”的常用配置。
- 部分高精度场景还会覆盖 FFN 层(如 LyCORIS 的 LoCon 变体)。
2. 架构适配演进
Stable Diffusion 1.x/2.x (U-Net)
└── LoRA 注入 U-Net 的 attention blocks
└── rank 通常 4~128
SDXL (更大 U-Net + 双 text encoder)
└── LoRA 注入更大规模的 attention blocks
└── 因参数量增长,同等 rank 的 LoRA 文件更大
SD3 / Flux (DiT 架构 / Transformer-based)
└── LoRA 注入 Transformer blocks 的 attention + MLP
└── 架构从 U-Net 迁移到纯 Transformer,LoRA 注入点随之改变
3. 训练流程
典型 Diffusion LoRA 训练流程:
输入:目标概念的数十~数百张图像 + 对应文本描述
│
▼
预处理:图像 resize/crop → 编码为 latent(VAE encode)
│
▼
前向:对 latent 添加噪声 → 预测噪声(与标准扩散训练一致)
│
▼
损失:预测噪声与真实噪声的 MSE(均方误差)
│
▼
反向传播:仅更新 LoRA 参数(B、A 矩阵),原始权重冻结
│
输出:保存 LoRA 权重文件(.safetensors,数 MB~数十 MB)
关键训练超参数(来源:社区最佳实践汇总):
| 超参数 | 典型范围 | 说明 |
|---|---|---|
| Rank (r) | 4, 8, 16, 32, 64, 128 | 越大拟合能力越强,但过拟合风险增加 |
| Alpha (α) | 通常等于 r 或 r/2 | 控制适配强度;α/r 为实际缩放比 |
| Learning Rate | 1e-4 ~ 1e-5 量级 | 需配合 scheduler |
| 训练步数 | 数百~数千步 | 取决于数据集大小与重复次数 |
| Batch Size | 1~8 | 受限于 VRAM |
| 数据集规模 | 20~200 张(常见) | 也可用数千张做风格迁移 |
4. 与全量微调的理论对比
全量微调在参数空间中搜索 ΔW ∈ R^(d×k),自由度为 d×k。LoRA 将搜索空间限制为秩-r 流形,自由度为 r×(d+k)。当 r 远小于 d 和 k 时,这是一个巨大的正则化——本质上是用低秩先验约束了微调空间,从而:
- 减少过拟合风险(对小数据集尤为重要)
- 降低计算与存储开销
- 提供天然的可组合性(不同 LoRA 的低秩子空间近似正交时,叠加后不会严重相互干扰)
技术原理(最深)
低秩分解的数学结构
前向传播改写
原始线性层:h = W₀x
LoRA 增强后:
h = W₀x + (α/r) · B · A · x
= W₀x + (α/r) · ΔW · x
其中:
- W₀ ∈ R^(d×k):冻结的原始权重
- A ∈ R^(r×k):LoRA 的”降维”矩阵,随机高斯初始化
- B ∈ R^(d×r):LoRA 的”升维”矩阵,零初始化(确保训练开始时 ΔW=0)
- α:缩放因子(超参数)
- r:秩(超参数)
初始化设计的核心含义:训练开始时,模型行为与原始模型完全一致(因为 BA = 0),这保证了从预训练知识出发的稳定迁移。
为什么零初始化 B 而非随机初始化两者?
如果 A 和 B 都随机初始化,初始 ΔW 不为零,会破坏预训练模型的已有能力,导致训练不稳定。零初始化 B 确保了”渐进注入”——模型从原始能力平滑过渡到微调后的能力。
参数量分析
以一个注意力投影矩阵为例(设 d_model = 768,如 SD 1.x):
| 方案 | 可训练参数量 | 相对全量比 |
|---|---|---|
| 全量微调 | 768 × 768 = 589,824 | 100% |
| LoRA (r=4) | 4 × (768 + 768) = 6,144 | 1.04% |
| LoRA (r=16) | 16 × (768 + 768) = 24,576 | 4.17% |
| LoRA (r=64) | 64 × (768 + 768) = 98,304 | 16.67% |
| LoRA (r=128) | 128 × (768 + 768) = 196,608 | 33.33% |
对 SD 1.x 的 U-Net(约 860M 参数),若对全部注意力层应用 LoRA (r=16),可训练参数通常在数百万量级 [社区估算],远小于原始 860M。
推理时的权重合并
训练完成后,LoRA 权重可以直接合并到原始权重中:
W_merged = W₀ + (α/r) · B · A
合并后模型结构与原始模型完全相同,不引入额外推理延迟。这是 Diffusion LoRA 相比 Adapter 等其他 PEFT 方法的重要优势——推理零开销。
可组合性:多 LoRA 叠加
多个 LoRA 可以按权重叠加:
W_final = W₀ + Σ_i [ w_i · (α_i/r_i) · B_i · A_i ]
其中 w_i 是用户指定的混用权重(如 0.7 表示某风格 LoRA 的强度为 70%)。
技术限制:当多个 LoRA 的低秩子空间存在冲突(如两个角色 LoRA 的适配方向重叠)时,叠加会产生干涉伪影。这是社区实践中”LoRA 冲突”问题的数学根源。
SDXL 与 DiT 架构下的适配差异
┌──────────────────────────────────────────────────────┐
│ SD 1.x U-Net 注意力层结构 │
│ │
│ Self-Attn (Q,K,V,Out) ←── LoRA 注入点 │
│ ↓ │
│ Cross-Attn (Q,K,V,Out) ←── LoRA 注入点(文本条件) │
│ ↓ │
│ FFN (proj_in, proj_out) ←── 可选 LoRA 注入点 │
│ │
│ × 16 个 ResBlock,总计约 64~128 个注入层 │
└──────────────────────────────────────────────────────┘
┌──────────────────────────────────────────────────────┐
│ DiT (SD3 / Flux) Transformer 层结构 │
│ │
│ Self-Attn (Q,K,V,Out) ←── LoRA 注入点 │
│ ↓ │
│ Cross-Attn (Q,K,V,Out) ←── LoRA 注入点 │
│ ↓ │
│ MLP (gate_proj, up_proj, down_proj) ←── LoRA 注入点 │
│ │
│ Transformer blocks × N │
└──────────────────────────────────────────────────────┘
DiT 架构(如 Flux)中 MLP 层的参数占比更大,部分实践表明覆盖 MLP 层的 LoRA 可以获得更好的表达能力,但也带来更大的文件体积。
LyCORIS 变体(扩展了解)
社区在标准 LoRA 基础上发展了多种变体:
| 方法 | 核心改进 | 说明 |
|---|---|---|
| LoCon (LoRA for Convolution) | 将 LoRA 扩展到卷积层 | 不仅作用于线性层,也适配 Conv2d |
| LoHa (LoRA with Hadamard Product) | 用 Hadamard 积替代矩阵乘积 | 理论上更强的表达能力 |
| LoKr (LoRA with Kronecker Product) | 用 Kronecker 积分解权重更新 | 更激进的参数压缩 |
| GLoRA | 通用化 LoRA 框架 | 统一多种 PEFT 变体 |
这些变体与标准 LoRA 共享相似的训练流程和工具链,但在参数效率和表达能力上有不同的 trade-off [社区技术文档]。
技术演进史
| 时间 | 事件 | 意义 |
|---|---|---|
| 2021.06 | Hu et al. 发表 LoRA 原始论文(Microsoft) | 提出低秩适配范式,针对 Transformer 语言模型 |
| 2022.08 | Stable Diffusion 1.x 开源发布 | 扩散模型进入大众视野,社区开始探索微调方法 |
| 2022.10~11 | Textual Inversion / DreamBooth | 早期扩散模型定制方案,但前者能力有限,后者需全量微调 |
| 2022.12~2023.01 | cloneofsimo (Simo Ryu) 等社区研究者将 LoRA 引入 Stable Diffusion | Diffusion LoRA 的正式开端;发布首个 SD-LoRA 训练代码 |
| 2023.02~03 | kohya_ss 训练器流行 | 降低 LoRA 训练门槛,GUI 化工具推动大规模社区采用 |
| 2023 Q2 | CivitAI 平台兴起 | LoRA 适配器作为独立资产分发的生态开始形成 |
| 2023.06 | LyCORIS 库发布(KohakuBlueleaf) | LoCon、LoHa、LoKr 等变体系统化 |
| 2023.07 | SDXL 发布 | 更大 U-Net,LoRA 配合 SDXL 微调成为新标准 |
| 2023 H2 | HuggingFace PEFT 库增加 Diffusion LoRA 支持 | 企业级/工程化的 PEFT 集成 |
| 2024 | SD3 / Flux 等 DiT 架构模型发布 | LoRA 从 U-Net 迁移到 Transformer blocks |
| 2024 | ControlNet + LoRA 组合使用成为标准工作流 | 条件控制 + 风格定制的双重适配 |
技术路线对比
| 维度 | Full Fine-Tuning | DreamBooth | Textual Inversion | Diffusion LoRA | LoCon / LyCORIS |
|---|---|---|---|---|---|
| 可训练参数 | ~全部(数亿) | ~全部(数亿) | ~数千(embedding) | 数万~数百万 | 数万~数百万(+卷积层) |
| 文件大小 | 2~6 GB | 2~6 GB | ~数十 KB | ||
| 训练数据需求 | 数百~数千张 | 3~20 张(实例) / 数十张(风格) | 3~20 张 | 20~200 张(常见) | 20~200 张 |
| 训练 VRAM | 高(A100 40/80GB 级) | 高 | 低~中 | 中低(消费级 GPU 可) | 中低 |
| 身份保真度 | 高 | 很高(少量样本) | 中 | 高 | 高 |
| 风格迁移能力 | 很强 | 中 | 弱~中 | 强 | 强 |
| 可组合性 | 差(单一模型) | 差 | 中(可叠加 embeddings) | 很好(多 LoRA 叠加) | 好 |
| 推理额外开销 | 无 | 无 | 极小 | 无(合并后) | 无(合并后) |
| 过拟合风险 | 高(小数据集) | 中~高 | 低 | 低~中(取决于 rank 和数据量) | 低~中 |
| 社区生态规模 | 小 | 中 | 中 | 极大(数十万级适配器) | 增长中 |
上下游
上游
| 环节 | 关键要素 | 代表供应方 |
|---|---|---|
| 基础扩散模型 | 预训练好的 U-Net / DiT 权重 | Stability AI、Black Forest Labs(Flux) |
| 文本编码器 | CLIP / T5 / OpenCLIP | OpenAI、Google、LAION |
| VAE | 潜空间编解码器 | Stability AI、社区微调版 |
| 训练框架 | LoRA 训练器、PEFT 库 | HuggingFace PEFT、kohya_ss、Ostris AI Toolkit |
| 算力 | GPU 训练资源 | NVIDIA、云厂商 |
下游
| 环节 | 应用场景 | 代表 |
|---|---|---|
| 创意设计 | 特定画风/角色/IP 生成 | 自由画师、游戏工作室 |
| 电商 | 商品图风格统一、模特换装 | 电商 SaaS、AIGC 工具公司 |
| 广告营销 | 品牌视觉一致性生成 | 营销科技公司 |
| 影视预览 | 概念设计、Storyboard | 影视前期制作 |
| 游戏 | 角色概念、场景素材 | 游戏美术管线 |
| LoRA 分发平台 | 适配器资产交易/分享 | CivitAI、HuggingFace Hub |
关键指标
训练侧
| 指标 | 典型范围 | 说明 |
|---|---|---|
| 训练步数 | 500~5,000 步 | 数据集小则需更多 epoch |
| 训练耗时 | 10 min ~ 数小时 | 取决于数据量、rank、GPU |
| 峰值 VRAM | SDXL 更高;开启 gradient checkpointing 可降低 | |
| 最终文件大小 | ~5 MB (r=4, 仅 K/V) ~ 200 MB (r=128, 全层) [社区估算] | SDXL 的同 rank LoRA 文件更大 |
| Loss 收敛 | 通常 500~2000 步后趋于平稳 | 需监控过拟合 |
推理侧
| 指标 | 数值/说明 |
|---|---|
| 推理延迟增量 | 0(合并权重后) |
| 额外显存占用 | 0(合并后);未合并时微量 |
| 质量影响 | 理论上存在低秩截断的信息损失,但实践中差异通常不可感知 |
供需与市场数据
需求侧
- CivitAI 平台上托管的 LoRA 适配器数量在 2024 年已超过数十万个 [行业观察,无精确官方数据],是全球最大的 Diffusion LoRA 分发平台。
- 企业侧需求:品牌方、电商、游戏公司对”定制化视觉内容生成”的需求是 LoRA 采用的核心驱动力。
- 社区侧需求:个人创作者通过 LoRA 学习特定画师风格、动漫角色、特定物体,是生态活跃度的主要来源。
供给侧
| 供给侧要素 | 现状 |
|---|---|
| 基础模型 | SD 1.5 仍是社区最活跃的 LoRA 训练基底(生态惯性);SDXL 和 Flux 为新增量 |
| 训练工具 | kohya_ss、Ostris AI Toolkit、HuggingFace PEFT 等多套工具并存 |
| 分发渠道 | CivitAI(社区)、HuggingFace Hub(社区+企业)、企业内部模型仓库 |
市场规模
精确的 Diffusion LoRA 市场规模数据目前缺乏权威第三方统计 [未充分披露]。但可以从以下维度定性评估:
- LoRA 微调工具链与服务是 AIGC 工具市场的重要细分。
- LoRA 适配器作为”模型资产”的交易/授权尚处于早期,定价机制未成熟。
- 企业级 LoRA 训练平台(如 Stability AI 的微调 API、Replicate 等 MLOps 平台的微调服务)正在形成 B2B 收费模式。
代表公司与资本映射
| 角色 | 代表公司/平台 | 与 LoRA 的关系 |
|---|---|---|
| 基础模型提供方 | Stability AI(SD 系列) | 开源基础模型,LoRA 微调的核心基底 |
| 基础模型提供方 | Black Forest Labs(Flux) | 新一代 DiT 架构模型,LoRA 生态正在建设 |
| 工具链提供方 | HuggingFace(PEFT 库) | 企业级 LoRA 训练与部署的标准化工具 |
| 社区训练工具 | kohya_ss | 社区最流行的 Diffusion LoRA 训练 GUI |
| 分发平台 | CivitAI | 最大的 LoRA 适配器社区平台 |
| MLOps / 推理平台 | Replicate、fal.ai | 提供云端 LoRA 微调与推理 API |
| 云算力 | NVIDIA、AWS、GCP 等 | LoRA 训练的底层算力供应 |
| 企业应用 | 小冰(Xiaoice)、各垂直 AIGC 工具公司 | 将 LoRA 微调集成到企业内容生成流水线 |
资本视角:LoRA 本身不是独立的商业品类,而是嵌入在”AI 图像/视频生成”产业链中的关键技术手段。其价值体现在:①降低定制成本(提升基础模型的商业化适配效率);②催生平台生态(CivitAI 等);③支撑企业级 AIGC 服务的差异化供给。
产业观察
核心观察
-
LoRA 是”模型定制化”的标准化方案——当基础大模型趋于同质化,差异化竞争将来自”定制化能力”。LoRA 是当前最成熟的定制化技术路径,其工具链和生态的完善度直接影响大模型的商业化效率。
-
观察 LoRA 生态的平台效应——CivitAI 等平台的 LoRA 资产积累构成网络效应:更多创作者 → 更多 LoRA → 更多用户 → 更多创作者。具备平台效应的分发方可作为产业生态观察对象。
-
企业级微调服务是 B2B 机会——品牌方需要的不是”自己训练 LoRA”,而是”输入素材 → 输出可用的定制模型”。提供端到端微调服务(训练+质检+部署)的公司有 SaaS 化机会。
-
技术迭代方向需持续观察——LoRA 在 rank 选择、多 LoRA 调度、LoRA + ControlNet 联合优化等方面仍有技术演进空间。DoRA(Weight-Decomposed Low-Rank Adaptation)等改进方案已在 LLM 侧验证效果,向扩散模型的迁移仍需观察。
风险
- 架构变迁风险:从 U-Net 到 DiT 的迁移改变了 LoRA 注入点和最佳实践,生态需要适配。
- 全量微调成本下降:随着硬件和分布式训练技术进步,全量微调的成本可能下降到压缩 LoRA 优势的程度。
- 质量上限:LoRA 的低秩约束在极端定制需求(如全新的视觉概念、复杂的多角色场景)下可能成为瓶颈。
常见误读纠偏
❌ 误读 1:“LoRA 能学到全量微调学不到的东西”
纠偏: LoRA 的表达能力是全量微调的子集。全量微调可以更新整个参数空间,LoRA 只能更新低秩子空间。LoRA 的优势不在于”更强”,而在于”够用且高效”——在数据量有限、定制需求明确的场景下,低秩约束反而起到了正则化效果,防止过拟合。但在需要大幅改变模型行为的场景下,全量微调的能力上限更高。
❌ 误读 2:“Rank 越高,LoRA 效果一定越好”
纠偏: Rank 与效果并非单调正相关。rank 过高会导致:
- 过拟合风险增加(尤其在小数据集上)
- 文件体积增大,失去”轻量”优势
- 多 LoRA 叠加时冲突更严重
实践中,rank=432 在多数风格/角色学习任务上已足够。rank=64128 更多用于需要高度写实细节或复杂概念的场景 [社区经验]。
❌ 误读 3:“LoRA 合并后和原始模型推理速度完全一样”
纠偏: 这一说法在”权重合并”模式下是正确的——合并后的权重矩阵与原始结构相同,计算图不变,推理速度一致。但如果采用”不合并、运行时动态加载”的模式(如 ComfyUI 中动态切换多个 LoRA),则会引入少量额外的矩阵运算和显存开销。区别在于部署方式,而非 LoRA 本身的特性。
❌ 误读 4:“LoRA 只适合小数据集”
纠偏: 虽然 LoRA 因低参数量而在小数据集上表现良好(不易过拟合),但这不意味着它只适合小数据。在大数据集上,LoRA 同样有效——例如用数千张高质量图像做”画风 LoRA”,效果通常优于少量数据。LoRA 在大数据集上的主要限制是表达能力上限(受 rank 约束),而非数据量本身。
学习路径
入门(1~2 天)
- 理解扩散模型基础:阅读 Lilian Weng 的 “What are Diffusion Models?” 博客
- 理解 LoRA 原理:阅读 LoRA 原始论文(Hu et al., 2021)的 Section 4(方法)
- 动手实践:使用 CivitAI 下载一个 SD 1.5 LoRA,在 AUTOMATIC1111 WebUI 或 ComfyUI 中加载体验
进阶(1~2 周)
- 训练第一个 LoRA:使用 kohya_ss 或 Ostris AI Toolkit,用 20~50 张图片训练一个角色/风格 LoRA
- 理解超参数调优:实验不同 rank、alpha、learning rate、步数组合的效果
- 阅读 HuggingFace PEFT 文档:理解工程化的 LoRA 实现细节
- 探索 LyCORIS:尝试 LoCon 等变体,理解与标准 LoRA 的差异
深入(持续)
- 阅读 LoRA 原始论文全文:理解 intrinsic dimensionality 理论背景
- 研读 DoRA 等改进方案:跟踪 PEFT 技术演进
- 探索 DiT 架构下的 LoRA:在 Flux 等新架构上实验 LoRA 训练
- 关注 LoRA + ControlNet / IP-Adapter 等组合方案:理解多条件组合生成的技术栈
推荐资源
| 类型 | 资源 |
|---|---|
| 论文 | Hu et al., “LoRA: Low-Rank Adaptation of Large Language Models” (2021) |
| 论文 | Ryu & Song, “LoRA for Stable Diffusion” (2023, GitHub/社区) |
| 博客 | HuggingFace PEFT 文档 — LoRA 章节 |
| 工具 | kohya_ss (GitHub) / Ostris AI Toolkit (GitHub) |
| 平台 | CivitAI (civitai.com) — 浏览社区 LoRA 作品 |
| 视频 | Aitrepreneur、Olivio Sarikas 等 YouTube 频道的 SD LoRA 教程 |
一句话总结
Diffusion LoRA 通过低秩分解将大模型微调的成本压缩了 1~2 个数量级,同时保留了足够的表达能力来学习风格、角色和物体——它是当前 AI 图像生成定制化的事实标准方法,也是支撑”模型即平台”生态的关键技术基础。
延伸阅读与来源
| 来源 | 内容 |
|---|---|
| Hu, E. J. et al. (2021). “LoRA: Low-Rank Adaptation of Large Language Models.” arXiv:2106.09685 | LoRA 原始论文 |
| Aghajanyan, A. et al. (2021). “Intrin |