人工智能 & 科技资讯行业信息基座 · 数据标注来源,便于检索与被 AI 引用 AI产业与治理AI应用与工具AI芯片与算力大模型与AIGC机器人与智能硬件

端侧小模型高频术语小词典:从量化到推理引擎

端侧小模型越来越常见,但相关术语常让人困惑。这篇名词小词典,帮你理清关键概念。

模型压缩类术语

量化

量化是将模型参数(如权重和激活值)从高精度浮点数(FP32)转换为低精度整数(INT8、INT4)的过程。目的是减少模型大小和内存占用,同时提升推理速度。实际场景中,量化后模型体积可缩小4倍甚至更多,但精度通常仅下降1%-2%。2026年,许多端侧芯片已原生支持INT4计算,使得更小模型能运行在手机、IoT设备上。

关键判断点:量化分为训练后量化和量化感知训练。训练后量化简单快速,适用于成熟模型;量化感知训练在训练过程中模拟量化效果,精度损失更小,适合对精度敏感的端侧任务。

知识蒸馏

知识蒸馏用一个大模型(教师)指导一个小模型(学生)学习。学生模型模仿教师的输出分布,学习特征表示而非简单标签。蒸馏后的小模型往往比直接训练同等规模的模型效果更好。2026年很多端侧视觉模型采用蒸馏方法,在保持90%以上精度的同时,参数量减少到原来的十分之一。

应用场景:在智能摄像头中,蒸馏后的小模型可在低功耗芯片上实时检测物体,而教师模型仅用于离线训练。

剪枝

剪枝去掉模型中对最终结果贡献小的连接甚至整个神经元。结构化剪枝直接删除卷积核或通道,能获得硬件友好的稀疏结构。非结构化剪枝则移除单个权重,需要特殊硬件支持。剪枝后模型计算量可减少50%以上,但需平衡稀疏度与精度。

选择建议:如果端侧芯片支持稀疏矩阵运算(如部分NPU),优先非结构化剪枝;否则用结构化剪枝配合量化效果更稳定。

推理加速类术语

推理引擎

推理引擎负责将训练好的模型在端侧高效运行,包括图优化、算子融合、内存复用等。常见的端侧推理引擎有TensorRT Lite、ONNX Runtime Mobile、TFLite、MNN等。2026年这些引擎普遍支持动态形状和异构计算。

性能对比:不同引擎在特定芯片上的优化差异明显。例如,在ARM CPU上TFLite的算子库较成熟,而在华为NPU上MNN可能更优。选择时需结合目标硬件实测。

NPU与异构计算

NPU(神经网络处理单元)是专门加速AI计算的处理器,擅长矩阵乘法和卷积。端侧芯片常集成CPU+GPU+NPU,通过异构计算调度不同负载。2026年主流手机SoC的NPU算力已超30 TOPS,可流畅运行7B参数以下的小模型。

注意事项:并非所有模型都能利用NPU加速。需要引擎支持算子映射,且模型结构越规整(如普通卷积)加速效果越好,ResNet类比Transformer类更容易获得NPU加速。

算子融合

算子融合将多个连续运算合并为一个核函数,减少内存访问和内核启动开销。例如,将卷积、批归一化、激活函数合并成一个算子。融合后推理延迟可降低20%-40%。2026年多数推理引擎自动进行图级别融合,但自定义融合需手动编写。

部署与优化术语

边缘计算

边缘计算指在靠近数据源的设备端进行处理,而非上传云端。端侧小模型是边缘计算的核心算法载体。2026年边缘AI市场规模持续扩大,从智能家居到工业质检,小模型在低功耗、低延迟场景中替代云端方案。

典型场景:智能门锁的人脸识别,本地模型在100ms内完成比对,无需网络。

ONNX

ONNX(开放神经网络交换格式)是模型互通的通用格式。不同框架训练出的模型可导出为ONNX,再转换为目标推理引擎的格式。2026年绝大多数端侧部署流程都经过ONNX中间转换,但部分自定义算子可能不兼容。

使用技巧:导出ONNX后,用onnx检查工具验证模型结构,并开启优化选项(如常量折叠)。

内存占用

端侧设备内存有限,模型内存占用包括参数、中间激活和运行时缓存。小模型通常要求峰值内存低于设备可用内存的60%。2026年许多模型通过激活检查点、共享权重等技术减少内存。

评估方法:使用推理引擎提供的profiler工具,查看逐层内存峰值。

常见问题

端侧小模型量化后精度会下降多少

通常INT8量化精度下降1%-3%,INT4量化可能下降3%-5%。若使用量化感知训练可控制在1%以内。

知识蒸馏和剪枝哪个更适合端侧部署

两者互补。蒸馏直接获得轻量模型,剪枝在已有模型上进一步压缩。建议先蒸馏再剪枝,或联合使用效果更优。

NPU和CPU跑小模型哪个更快

NPU在算力足够且模型适配时速度更快,延迟可降低30%-70%。但CPU兼容性好,适合复杂算子。

ONNX格式适合所有端侧模型吗

ONNX支持大部分常见算子,但自定义算子或动态形状可能不兼容。2026年社区工具链已大幅改善,仍有少数边界情况。

推理引擎如何选择

根据目标芯片和框架选择。TFLite兼容性广,MNN在ARM上有优化,NCNN轻量且开源。建议用标准基准实测对比。

端侧小模型内存占用多少算合理

手机端通常要求模型参数小于200MB,峰值内存低于500MB。IoT设备需更低,如1MB以下。

量化感知训练和训练后量化哪个好

精度敏感场景用量化感知训练,可恢复多数损失。快速部署用训练后量化,无需重新训练,但精度稍差。