【发布时间】:2021-09-29 12:08:25
【问题描述】:
我能够使用 intel lpot(neural compressor) 成功量化用于拥抱脸文本分类的 pytorch 模型
我的机器中现在有原始的 fp32 模型和量化的 int8 模型。为了推断,我使用以下代码加载了量化的 lpot 模型
model = AutoModelForSequenceClassification.from_pretrained('fp32/model/path')
from lpot.utils.pytorch import load
modellpot = load("path/to/lpotmodel/", model)
我能够看到各种时间的改进,但我想确认模型权重是否已经真正量化并使用 int8、fp16 等数据类型,理想情况下这应该是加速的原因。我遍历模型权重并打印权重的 dtypes,但我看到所有权重都是 fp32 类型的
for param in modellpot.parameters():
print(param.data.dtype)
输出
torch.float32
torch.float32
torch.float32
torch.float32
torch.float32
torch.float32
torch.float32
..
...
如何验证我的 pytorch 模型是否已量化?
【问题讨论】:
-
您可以通过以下方式检查权重值: print(list(model.named_parameters())) 也许无论如何都有帮助
标签: python pytorch quantization intel-lpot