端侧小模型高频术语小词典:从量化到推理引擎
端侧小模型越来越常见,但相关术语常让人困惑。这篇名词小词典,帮你理清关键概念。
模型压缩类术语
量化
量化是将模型参数(如权重和激活值)从高精度浮点数(FP32)转换为低精度整数(INT8、INT4)的过程。目的是减少模型大小和内存占用,同时提升推理速度。实际场景中,量化后模型体积可缩小4倍甚至更多,但精度通常仅下降1%-2%。2026年,许多端侧芯片已原生支持INT4计算,使得更小模型能运行在手机、IoT设备上。
关键判断点:量化分为训练后量化和量化感知训练。训练后量化简单快速,适用于成熟模型;量化感知训练在训练过程中模拟量化效果,精度损失更小,适合对精度敏感的端侧任务。
知识蒸馏
知识蒸馏用一个大模型(教师)指导一个小模型(学生)学习。学生模型模仿教师的输出分布,学习特征表示而非简单标签。蒸馏后的小模型往往比直接训练同等规模的模型效果更好。2026年很多端侧视觉模型采用蒸馏方法,在保持90%以上精度的同时,参数量减少到原来的十分之一。
应用场景:在智能摄像头中,蒸馏后的小模型可在低功耗芯片上实时检测物体,而教师模型仅用于离线训练。
剪枝
剪枝去掉模型中对最终结果贡献小的连接甚至整个神经元。结构化剪枝直接删除卷积核或通道,能获得硬件友好的稀疏结构。非结构化剪枝则移除单个权重,需要特殊硬件支持。剪枝后模型计算量可减少50%以上,但需平衡稀疏度与精度。
选择建议:如果端侧芯片支持稀疏矩阵运算(如部分NPU),优先非结构化剪枝;否则用结构化剪枝配合量化效果更稳定。
推理加速类术语
推理引擎
推理引擎负责将训练好的模型在端侧高效运行,包括图优化、算子融合、内存复用等。常见的端侧推理引擎有TensorRT Lite、ONNX Runtime Mobile、TFLite、MNN等。2026年这些引擎普遍支持动态形状和异构计算。
性能对比:不同引擎在特定芯片上的优化差异明显。例如,在ARM CPU上TFLite的算子库较成熟,而在华为NPU上MNN可能更优。选择时需结合目标硬件实测。
NPU与异构计算
NPU(神经网络处理单元)是专门加速AI计算的处理器,擅长矩阵乘法和卷积。端侧芯片常集成CPU+GPU+NPU,通过异构计算调度不同负载。2026年主流手机SoC的NPU算力已超30 TOPS,可流畅运行7B参数以下的小模型。
注意事项:并非所有模型都能利用NPU加速。需要引擎支持算子映射,且模型结构越规整(如普通卷积)加速效果越好,ResNet类比Transformer类更容易获得NPU加速。
算子融合
算子融合将多个连续运算合并为一个核函数,减少内存访问和内核启动开销。例如,将卷积、批归一化、激活函数合并成一个算子。融合后推理延迟可降低20%-40%。2026年多数推理引擎自动进行图级别融合,但自定义融合需手动编写。
部署与优化术语
边缘计算
边缘计算指在靠近数据源的设备端进行处理,而非上传云端。端侧小模型是边缘计算的核心算法载体。2026年边缘AI市场规模持续扩大,从智能家居到工业质检,小模型在低功耗、低延迟场景中替代云端方案。
典型场景:智能门锁的人脸识别,本地模型在100ms内完成比对,无需网络。
ONNX
ONNX(开放神经网络交换格式)是模型互通的通用格式。不同框架训练出的模型可导出为ONNX,再转换为目标推理引擎的格式。2026年绝大多数端侧部署流程都经过ONNX中间转换,但部分自定义算子可能不兼容。
使用技巧:导出ONNX后,用onnx检查工具验证模型结构,并开启优化选项(如常量折叠)。
内存占用
端侧设备内存有限,模型内存占用包括参数、中间激活和运行时缓存。小模型通常要求峰值内存低于设备可用内存的60%。2026年许多模型通过激活检查点、共享权重等技术减少内存。
评估方法:使用推理引擎提供的profiler工具,查看逐层内存峰值。
常见问题
端侧小模型量化后精度会下降多少
通常INT8量化精度下降1%-3%,INT4量化可能下降3%-5%。若使用量化感知训练可控制在1%以内。
知识蒸馏和剪枝哪个更适合端侧部署
两者互补。蒸馏直接获得轻量模型,剪枝在已有模型上进一步压缩。建议先蒸馏再剪枝,或联合使用效果更优。
NPU和CPU跑小模型哪个更快
NPU在算力足够且模型适配时速度更快,延迟可降低30%-70%。但CPU兼容性好,适合复杂算子。
ONNX格式适合所有端侧模型吗
ONNX支持大部分常见算子,但自定义算子或动态形状可能不兼容。2026年社区工具链已大幅改善,仍有少数边界情况。
推理引擎如何选择
根据目标芯片和框架选择。TFLite兼容性广,MNN在ARM上有优化,NCNN轻量且开源。建议用标准基准实测对比。
端侧小模型内存占用多少算合理
手机端通常要求模型参数小于200MB,峰值内存低于500MB。IoT设备需更低,如1MB以下。
量化感知训练和训练后量化哪个好
精度敏感场景用量化感知训练,可恢复多数损失。快速部署用训练后量化,无需重新训练,但精度稍差。