模型层 开放阅读

SmoothQuant

SmoothQuant

概念 ID
smoothquant
更新时间
2026-05-29
来源数量
待补

SmoothQuant

1. 3 秒看懂

SmoothQuant 是一种面向大规模语言模型(LLM)的训练后量化(PTQ) 方法。其核心创新在于:通过一个数学上完全等价的“平滑”变换,将 LLM 推理过程中最难量化的激活值(Activation) 中的通道级离群值(Outlier)难度,部分迁移到分布更均匀、更易量化的权重(Weight) 矩阵上。该过程无需代价高昂的重新训练,仅依赖极少量的校准数据(通常 100–1000 个样本),即可让模型在 全 INT8 计算 下实现几乎无损失的推理精度。SmoothQuant 消除了混合精度量化带来的复杂系统设计,使标准 GPU 能够以约 2 倍的吞吐量运行千亿参数模型,同时将显存占用缩减一半,是当前 LLM 高效部署的核心使能技术之一。

2. 产业动机与技术背景

大语言模型的规模化落地面临两大现实瓶颈:推理成本硬件门槛。一个 175B 的 GPT-3 模型在 FP16 精度下需要约 350 GB 显存,即使使用顶级的 NVIDIA A100(显存 40 GB 或 80 GB)也需要多卡并行;而每次查询的延迟与能耗在云端以每秒百万次调用计的业务场景中,直接决定了商业可行性。量化——将模型权重和中间计算从 FP32/FP16 压缩为 INT8 甚至 INT4——是公认的降低部署成本、提升推理速度的主流手段。在计算机视觉领域,INT8 量化已成熟应用多年,精度损失可控制在 1% 以内。然而,当同样的方法直接应用于 LLM 时,往往会遭遇灾难性的精度崩塌。

问题根源在于 激活值离群值。研究发现,在 Transformer 的每个线性层(如 Query、Key、Value、FFN 中的全连接层)中,输入激活值 X 的分布呈现极端的通道间不平衡:约 0.1% 的通道(即“离群通道”)的数值范围比其余 99.9% 的通道高出 10 到 100 倍。这些离群通道出现在固定的位置(主要由模型结构中的 LayerNorm 和残差连接引发),其过大的幅值使得全局 INT8 量化的量化步长必须由这些离群值决定,导致绝大多数通道的有效信息被压缩到极少数离散级别中,造成严重的信息丢失和精度崩溃。

这一现象在产业界引发了激烈的技术路线分化:一方主张通过混合精度来“绕过”离群值问题,即对离群通道保留 FP16 计算,而对非离群通道执行 INT8 加速;另一方则试图寻找一种让模型能够全整型化的方法。SmoothQuant 正是后者中最具代表性的突破之一,它用一种简单、高效且数学上精确的变换,从根本上解决了激活值离群值问题,为 LLM 的全 INT8 推理扫清了最重要的障碍。

3. 量化技术基础与 LLM 特有的离群值困境

要理解 SmoothQuant 的精妙,首先需要建立对神经网络量化的基础知识。统一仿射量化(Uniform Affine Quantization)将连续的浮点张量 T 映射为低位宽的整数 T_q,其形式为: T_q = clip(round(T/Δ) + z, q_min, q_max) 其中 Δ 为量化步长(scale),z 为零点(zero point),clip 将超出可表示范围的值截断。对于 INT8 对称量化,通常会使用张量级(tensor-wise)或通道级(channel-wise)量化。在 Transformer 中,权重 W 可以比较方便地采用通道级量化(即每个输出通道拥有独立的量化步长),因为权重是静态的模型参数;而激活值 X 是动态产生的,为了兼容高效的通用矩阵乘法(GEMM)内核,通常采用更粗粒度的张量级量化(即整个激活张量共享一个步长)或 Token 级/块级量化。

对于小型视觉模型,这种张量级 INT8 量化效果尚可。但 LLM 的激活值分布出现了本质变化。在 Transformer 层内,LayerNorm 的输出(即后续线性层的输入)会在极少数固定通道上产生系统性的高幅值。典型地,观察一个 OPT 或 LLaMA 模型的某个线性层输入,可以发现在通道维度上,大多数通道的最大绝对值集中在 05 之间,而某几个通道(如通道 6 或通道 72)的最大绝对值却高达 50100。这些离群通道通常对应着令牌嵌入维度中的特定位置,且在大量不同输入下始终稳定出现。

为何混合精度不是终局方案? 为应对离群值,LLM.int8() 提出了一个经典解法:将激活矩阵按列(通道)分解为离群部分和非离群部分。对离群通道,保持 FP16 矩阵乘法;对非离群通道,执行 INT8 矩阵乘法;最后将两部分结果相加。该方法保住了 FP16 的精度,在许多任务中做到零损失,但它存在三大缺陷:(1)系统实现复杂,需要定制化的内核来高效处理“部分 FP16 + 部分 INT8”的异构运算;(2)即使在 FP16 通道很少的情况下,这种混合计算也打破了常规 GEMM 的流水线,导致在 GPU 上无法充分利用 Tensor Core 的吞吐;(3)推理加速比远低于理论峰值,实测往往只有 1.2–1.5 倍加速,远未达到全 INT8 理论上的 2 倍。产业界亟需一种全 INT8 且精度无损的方案,这就是 SmoothQuant 出场的背景。

4. SmoothQuant 的核心思想与数学等价变换

SmoothQuant 的提出基于一个关键洞察:激活值 X 的离群值集中在通道间,而其通道内的分布相对平滑;权重 W 的通道间幅度差异远小于激活值,且其可以通过静态校准调整。 那么,能否通过一个数学变换,将造成量化困难的“通道间剧烈差异”从激活值迁移到权重上呢?答案是肯定的,且变换本身不改变任何计算结果。

对于任意线性层 Y = X · W(忽略偏置 b,不影响结论),其中 X ∈ R^{T×C_in}W ∈ R^{C_in×C_out}。SmoothQuant 引入一个对角缩放矩阵 diag(s),其中 s ∈ R^{C_in}(或某些实现中为 C_out 维度),将其插入计算图中: Y = X · W = (X · diag(s)^{-1}) · (diag(s) · W)

定义 平滑后的激活值 X' = X · diag(s)^{-1}平滑后的权重 W' = diag(s) · W。由于 diag(s)^{-1} · diag(s) = I,该变换在数学上完全等价,没有引入任何近似。其物理含义是:对每个输入通道 j,通过除以 s_j 缩小激活值的幅度;同时将该通道对应的权重行乘以 s_j 以进行补偿,保持矩阵乘法的最终结果不变。

这种变换的价值是双重的:

  • 对于 X‘,离群通道被 s_j 压制,通道间的幅度差异大幅减小,使其对张量级 INT8 量化变得友好。
  • 对于 W’,虽然对应通道的行被放大,但权重的原始通道间分布本来就相对平坦,引入的放大不会造成新的量化困难——尤其在采用通道级量化时,每个输出通道拥有独立的量化步长,完全可以吸收这种幅度变化。

这样,SmoothQuant 实现了“激活值量化困难—权重量化容易”之间的平滑转移。该思想优雅且极具工程实用价值:无需重训、不改变模型结构、仅需少量校准数据

5. 缩放因子 s 的确定与迁移强度超参数 α

变换的等价性保证了精度无损的可能性,但前提是选取合适的缩放因子 s。如果 s 取得过大,虽然激活值离群得以压制,但权重会被过度放大,导致权重端成为新的量化瓶颈;反之,若 s 过小,激活值离群依然存在。因此,s 的选取本质上是 在激活值量化误差和权重量化误差之间寻找最优平衡点

SmoothQuant 使用校准数据集,收集各线性层的激活值统计量。对每个输入通道 j(即维度 C_in),计算激活值在所有 token 和 batch 样本上的绝对最大值 max(|X_j|);同时,计算权重矩阵对应行(即 W_{j,:})的绝对最大值 max(|W_{j,:}|)。然后,通过一个平滑强度超参数 α ∈ [0, 1] 来控制迁移比例: s_j = max(|X_j|)^α / max(|W_{j,:}|)^{(1-α)}

该公式的含义极为直观:

  • α = 1 时,s_j = max(|X_j|)X' = X / max(|X|)(张量级归一化),激活值离群被完全压制,但权重的量化完全未考虑,权重可能遭受较大失真。
  • α = 0 时,s_j = 1 / max(|W_{j,:}|),权重被归一化,而所有的离群难题全部留在激活值端。
  • 0.5 是一个自然的中庸选择,将离群难度均匀分摊给激活值和权重。

在原始论文和实践中,α 被设定为 0.5 作为默认值,且在广泛的实验中表现鲁棒。对于某些特殊模型(如 GLM 系列或某些极端深度的模型),α 可在 0.4–0.6 之间微调以榨取最后一点精度。值得注意的是,α 的调整仅影响缩放因子的计算,不需要重新执行昂贵的模型训练。校准过程只需一次前向传播并记录最大值,整个变换对于千亿参数模型也仅需数分钟,完全可集成于模型部署流水线。

6. 技术实现细节:校准流程与硬件适配

SmoothQuant 的落地实现可概括为三步:

步骤一:校准数据收集(Calibration) 从目标任务域中随机采样或使用开源的校准数据集(如 Pile 的截断子集、C4 等),数量通常为 100–1000 个序列。对原始 FP16 模型执行标准前向推理,并在每个线性层之前记录输入激活值张量 X。为避免内存爆炸,可以在每一层计算时动态收集并丢弃中间激活,仅保留各通道的绝对最大值统计量。

步骤二:计算缩放因子 s 并平滑权重 按照上节公式,利用预设的 α(一般 0.5)计算每个输入通道的 s_j。然后执行权重的离线变换:W' = diag(s) · W。对于量化,W' 会进一步进行通道级量化(per-channel quantization)得到 INT8 权重;对于某些实现,也可能结合 Group 量化以获得更细粒度的误差控制。

步骤三:插入量化算子与平滑激活推理 在计算图中,将原始线性层替换为 SmoothQuant 等效层:前向传播时,先动态计算 X' = X / s(通过逐通道除法或预计算的缩放对角矩阵),再对 X' 执行张量级动态量化(tensor-wise dynamic INT8),最后与已量化的 W' 执行 INT8 矩阵乘法。对于残差连接和注意力计算中的其他部分(如 Softmax),通常保留 FP16 以保持数值稳定性,但这部分计算量极小,不会成为瓶颈。

硬件效率:全 INT8 GEMM 可以在 NVIDIA GPU 的 Tensor Core 上以峰值算力执行。以 A100 为例,INT8 Tensor Core 的算力是 FP16 的 2 倍。配合 FasterTransformer、TensorRT-LLM 等推理框架,SmoothQuant 可以实现端到端约 1.8–2.2 倍的推理加速,显存占用降低约 50%。此外,由于消除了混合精度分支,内核调用更加规则,计算延迟的可预测性也更好,这对云服务的服务水平协议(SLA)至关重要。

7. 精度评估:多模型、多任务表现

SmoothQuant 在多个开放 LLM 上进行了详尽验证,涵盖 OPT 系列(6.7B–175B)、BLOOM 系列、GLM 系列等。典型结果如下:

  • OPT 模型:在 WikiText-2、LAMBADA、HellaSwag、PIQA 等多个自然语言下游任务上,SmoothQuant 的 INT8 推理结果与 FP16 基线相比,精度差异在统计误差范围内(< 0.5%)。例如,OPT-175B 在 LAMBADA 上 FP16 精度为 76.5%,SmoothQuant INT8 为 76.3%;在 HellaSwag 上分别为 57.2% 与 57.0%。这证明了该方法在超大规模模型上的鲁棒性。
  • BLOOM 模型:多语言场景下的同样结论。BLOOM-176B 在 XCOPA、XNLI 等多语言任务中,INT8 推理精度几乎无损。
  • LLaMA 系列:虽然论文未涵盖,后续社区与框架(如 torch_int、vLLM 扩展)广泛测试了 LLaMA-7B 到 70B 的 SmoothQuant 适配,证实仅需调整 α 或结合分组量化即可取得 < 1% 的困惑度(PPL)下降。
  • GLM-130B:中文大规模模型亦表现出色,在 MMLU 等综合评测中,INT8 推理得分与 FP16 持平。

更重要的是,SmoothQuant 在零样本场景生成任务中的表现同样稳健。在长文本生成任务上,通过核采样(nucleus sampling)生成的文本流畅度、事实一致性均未出现可察觉下降。这种即插即用且几乎无损的特质,使其迅速被主流推理框架(NVIDIA TensorRT-LLM、FasterTransformer、Intel Extension for Transformers)原生集成。

8. 消融实验与超参数深度分析

除了端到端精度,SmoothQuant 的论文和后续开源研究进行了全面的消融实验,揭示了其工作原理的深层机制。

α 的影响:在 OPT-13B 上,α 从 0.2 扫描到 0.8,发现 α 在 0.4–0.6 范围内 PPL 保持稳定且最优;α=0 或 α=1 的极端情况 PPL 暴涨,印证了平衡迁移的必要性。有趣的是,不同的层可能偏好稍有不同的 α。部分工作(如 Outlier Suppression+)提出层自适应 α,对浅层和深层使用不同迁移强度,可进一步降低 0.1–0.2 的 PPL。

缩放维度选择:前述描述为在 C_in 维度迁移,实际上也可以选择在 C_out 维度。SmoothQuant 对此进行了对比,证明在 C_in 维度迁移更有效,因为离群值本质上出现在激活值的输入通道上。

结合更细粒度的量化:默认的激活张量级动态量化是快速且高效的,但对某些激活通道分布仍残存不均衡时,可引入Token 级量化(每行一个量化步长)或Group 级量化,配合 SmoothQuant 后能进一步提升精度上界,代价是引入轻微计算开销。在许多部署中,为了最大化吞吐,仍坚持张量级量化,SmoothQuant 已足够。

权重中的离群现象:值得注意,SmoothQuant 迁移后的权重 W' 在某些通道会被放大,如果权重量化采用张量级量化,可能会造成新的瓶颈。因此,SmoothQuant 的实施必须配合权重通道级量化。幸运的是,通道级量化对权重大小是静态的,已在几乎所有推理框架中标准支持。

9. 与主流 LLM 量化方案的深度对比

在 LLM 量化赛道,主要存在三种范式:混合精度(LLM.int8())激活值平滑(SmoothQuant)权重重排序(GPTQ)。三者并非完全互斥,但在设计哲学和部署特性上有显著差异。

  • SmoothQuant vs. LLM.int8():两者均解决激活值离群值问题。LLM.int8() 使用“分离—合并”策略,对离群通道特殊处理;SmoothQuant 使用“迁移—均衡”策略,消除了特例处理。SmoothQuant 在推理吞吐和系统简洁度上有明显优势,实测在相同硬件上加速比可达 2.0x,而 LLM.int8() 通常在 1.3–1.5x。然而 LLM.int8() 提供了数学上严格的 FP16 等价(对于非离群通道),在极限安全场景可能仍有一席之地。两者可组合:对 SmoothQuant 处理后仍然存在的极少数离群通道再采用混合精度兜底,但这种边际收益通常不必要。

  • SmoothQuant vs. GPTQ:GPTQ 是基于渐进式反量化误差修正的权重量化方法,可直接将权重量化到 INT4 甚至 INT3,且对激活值不做平滑处理。GPTQ 主要是权重端的极致压缩,但对激活值离群依旧敏感;在激活值离群严重的情况下,仅使用 GPTQ 而保持激活 FP16 可能导致推理时仍需浮点运算,或需要结合动态量化。SmoothQuant 通常将权重和激活都量化到 INT8,实现全 INT8 推理。两者可以组合,例如使用 SmoothQuant 平滑激活后,对权重进一步使用 GPTQ 压缩到 INT4,形成 INT4 权重量化 + INT8 激活量化 的混合位宽方案,在边缘设备上提供更极致的内存节省。

  • SmoothQuant vs. 静态离线校准 + 流水线方法:还有一些方法(如 ZeroQuant)试图通过逐层知识蒸馏或优化校准数据集规模来达成 PTQ,但往往需要更多的工程努力和更复杂的校准流程。SmoothQuant 在实用性和精度保留上达到了一个极佳的平衡点,这也是其被社区广泛采纳的根本原因。

10. SmoothQuant 的优越性与工程价值

归纳起来,SmoothQuant 的工程创新价值体现在五个维度:

  1. 无损精度:在千亿参数尺度上实现 <0.5% 任务精度下降,绝大部分情形可认为无性能退化,满足绝大多数商业应用对质量的要求。
  2. 全整型计算:彻底摆脱混合精度的异构 GEMM,统一为纯 INT8,利于硬件加速和编译器优化;Tensor Core 利用率接近峰值。
  3. 零额外训练开销:仅需分钟级的校准(单次前向统计),无需梯度计算、优化器状态存储,部署成本极低。
  4. 框架无关性:可作为一个简单的离线变换脚本,独立于训练框架和推理引擎,可轻松集成于 PyTorch、ONNX、TensorRT 等工作流。
  5. 扩展性强:其平滑思想可以推广到任何包含线性变换的结构(如 CNN 的全连接层、Attention 中的投影矩阵),甚至非 Transformer 架构。对于未来的 MOE 模型、多模态 LLM,同样适用。

在实际云计算服务中,SmoothQuant 使企业在相同的 GPU 集群上能够服务于两倍数量的并发用户,或将响应延迟缩短一半,直接拉低每次 API 调用的成本。这也是为何国内多家大模型云服务商(如智谱、MiniMax、百川等)在大模型推理引擎中迅速落地 SmoothQuant 类技术。

11. SmoothQuant 的局限性与挑战

任何技术都不是银弹,SmoothQuant 同样存在局限:

  • α 的敏感性:尽管默认 α=0.5 足够鲁棒,但对于一些离群值模式极其尖锐的模型(例如某些预训练中间版本的模型),可能需要针对性微调 α,否则会出现局部精度孔洞。这要求部署团队具备一定的量化调试经验。
  • 极低位宽扩展性:SmoothQuant 设计初衷是 INT8 激活。当进一步压缩激活到 INT4 或更低时,即使经过平滑,激活的量化误差仍可能过大。此时需要更复杂的向量级量化(如 GPTQ 对权重的逐组量化)或借助更先进的非均匀量化技术。
  • 校准数据偏差:校准集如果与目标部署域严重不匹配,会导致统计量偏差,进而影响缩放因子。虽然这种敏感性远低于知识蒸馏等方法,但在极度领域外推理(OOD)时仍需谨慎评估。
  • 部分全连接算子之外的适用性:SmoothQuant 直接作用于线性层。对于 Softmax、LayerNorm 等非线性和归一化操作,仍保持 FP16。虽然这些操作的计算占比很低,但在某些极端限制(如全整型芯片)下,需要进行相应的整型化替换。
  • 与稀疏计算、级联缓存等融合:当与 KV-cache 量化、FlashAttention 等组合时,需要仔细管理量化域与缩放因子的传递,存在额外的工程集成复杂度。

这些局限是当前社区积极研究的方向,也催生了以 SmoothQuant 为基础的多种变体方案。

12. 从 SmoothQuant 到 AWQ 及后续演进

SmoothQuant 的核心贡献——通过通道级缩放来迁移量化困难——在学术界和工业界引发了持续的技术创新浪潮。一个直接的演进是 AWQ(Activation-aware Weight Quantization)。AWQ 观察到,不仅激活值离群通道难以量化,权重中对应这些离群通道的行对模型输出也至关重要。它反其道而行,通过保留而非压缩这些关键权重行的精度,并应用等效的通道缩放来提高低比特下的权重有效性。AWQ 可以视为 SmoothQuant 思想的深化:SmoothQuant 是同时平滑权重和激活以适配 INT8;AWQ 则专注于权重,通过寻找最佳的 per-channel scaling 来保护重要权重,实现 INT4 权重下的高效推理。两者在原理上一脉相承,并在实际应用中经常配合使用。

除此之外,还有 SmoothQuant+Outlier Suppression Framework 等工作,将 SmoothQuant 的平滑操作前移,与 LayerNorm 的仿射参数融合,以彻底从源头抑制离群值的产生。这些变体证明了“平滑”范式具有很强的通用性和扩展潜力。

NVIDIA 的 TensorRT-LLM 也集成了 SmoothQuant 及类似功能,形成了从校准到部署的自动化工作流;Intel 的 Habana Gaudi 处理器同样采用了基于平滑的 INT8 方案。可以说,SmoothQuant 的开创性在于它定义了 LLM 量化中“校正激活值分布”这一重要解法类别。

13. 产业应用场景与部署实践

SmoothQuant 已在多个产业场景中发挥决定性作用:

  • 云端大模型 API 服务:对于提供 ChatGPT-like 服务的企业,使用 SmoothQuant 可以在同构 GPU 集群上将并发吞吐提升 2 倍,将单次生成成本降低一半。结合动态批处理(Dynamic Batching)和 PagedAttention 技术,可实现极致的成本效益。
  • 私有化部署与隐私计算:金融机构、政务系统需要在本地服务器私有化部署百亿级模型。全 INT8 推理使一台 8×A100 服务器可以容纳并实时运行 175B 模型,无需依赖云端,保障数据主权。
  • 边缘与端侧推理:在高端移动 SoC(如骁龙 Gen 3、Apple M 系列芯片)或车载芯片上,SmoothQuant 使 7B–13B 模型以 INT8 形式流畅运行成为可能。以 LLaMA-2-7B 为例,平滑后 INT8 模型可在搭载 Apple M2 SoC 的 MacBook 上达到实时对话的生成速度,同时内存占用仅需约 4 GB。
  • AIGC 与多模态模型:Stable Diffusion 等扩散模型的 VAE 和 UNet 中也存在类似离群值问题。将 SmoothQuant 迁移到这些架构,同样可以减少显存占用,加速图像生成。

各大推理框架(如 vLLM、llama.cpp、MLC-LLM)均将 SmoothQuant 或其变体作为 INT8 推理的首选方案之一,形成了繁荣的开源生态。

14. 技术影响与未来展望

SmoothQuant 不仅是 LLM 量化历史上的一个里程碑,更对未来的推理系统和硬件设计产生了深远影响。

  • 量化架构设计范式转移:它让人们意识到,通过数学等价变换在激活和权重之间重新分配量化误差是一个强大的设计原则。这一原则正在被推广到更广泛的张量运算中,如交叉注意力层、MoE 的路由机制等。
  • 软硬协同优化:工业级 NPU 和 AI 加速芯片开始专门为这种平滑量化操作设计硬件原语,例如支持通道级缩放融合的 GEMM 单元,以避免额外的除法开销。未来推理芯片的指令集中可能直接包含 SmoothQuant 变换操作。
  • 与稀疏、蒸馏等压缩技术的融合:SmoothQuant 的全整型推理为与结构化稀疏、2:4 稀疏等进一步压缩技术提供了相容的基底。一个平滑后的 INT8 模型可以顺利应用稀疏权重组,实现算力和带宽的双重节省。
  • 自动化量化工具链:以 SmoothQuant 为基础的自动化工具(如 NVIDIA 的 Model Optimizer)正走向零代码校准,仅需用户提供少量示例,即可自动确定 α、选择量化粒度并导出优化模型,大幅降低 LLM 部署门槛。
  • 向训练端扩展:虽然 SmoothQuant 是 PTQ 方法,但其平滑思想也正被探索应用到量化感知训练(QAT)中,以加速大模型的低精度微调和预训练。

展望未来,随着 LLM 规模迈入万亿参数时代,推断能效将成为决定性瓶颈。SmoothQuant 及其衍生技术将继续作为核心技术基座,支撑起大模型从实验室到广泛商业部署的“最后一公里”。

15. 总结

SmoothQuant 是一场关于“如何优雅地解决 LLM 激活值离群值”的技术革命。它跳出了“识别并特殊处理离群通道”的混合精度思维定式,通过一个在数学上严格等价、工程上极简的平滑变换,将量化难度在激活值和权重之间重新分配,最终实现了全 INT8 且几乎无损的 LLM 推理。该技术的核心价值在于:用最小的侵入性(无重训、极少校准数据)换取最大的系统性能增益(2 倍加速、50% 内存节省),并具备极强的泛化和扩展能力。

从产业角度看,SmoothQuant 直接降低了 LLM 大规模部署的算力门槛和能源消耗,使大模型服务在商业上可行、在环境上可持续。从学术角度看,它开创了一种“通过等效变换重构量化问题”的研究范式,深刻影响了 AWQ、GPTQ+ 平滑等后续工作。如今,SmoothQuant 已成为 LLM 推理基础设施中不可或缺的一环,其在产业界和开源社区中的广泛应用,是对其价值的最佳证明。对于任何希望以低成本、高效率落地大模型的企业和开发者而言,深入理解并应用 SmoothQuant 已不仅仅是一种优化选择,更是一项基本素养。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型