设计应用

面向边缘计算的YOLOv5s推理优化方法研究

作者:洪泽,高魏华
发布日期:2026-09-28
来源:集成电路应用

引言

近年来,随着物联网和人工智能技术的深度融合,边缘计算因其低延迟、高隐私性和带宽效率的优势,成为推动实时智能应用落地的关键技术。然而,边缘设备的资源受限特性(如有限的计算能力、内存容量和能耗约束)对深度学习模型的部署提出了严峻挑战。在保证模型精度的同时,又能实现高效推理成为了新的关注焦点[1-3]。随着深度学习的发展,卷积层计算密集性、激活函数复杂度及内存访问效率等问题依然是模型部署在边缘设备上的难题。卞紫阳等人(2023)基于RK3588部署了跨模态行人重识别算法[4],刘鹏等人(2024)基于RK3588完成了YOLOv8n模型的适配,性能达到70帧/秒左右[5]。陈志文等人(2024)基于Jetson Xavier NX完成了YOLOv5s的移植,但是帧识别率只有30帧/秒左右[6];孙杰等人(2023)基于Sophon SC5+芯片构架完成了YOLOv5s的移植[7]。

本文以轻量级目标检测的代表YOLOv5s模型为例,基于RK3588芯片平台,完成了面向YOLOv5s模型的端到端优化研究。通过模型量化、激活函数轻量化重构等方法,降低模型的内存占用及计算复杂度[8-11]。进一步地,设计了多线程任务调度机制,充分利用RK3588的三个NPU核心实现并行推理。实验结果表明,优化后的模型推理速度达到80帧/秒,中大型目标检测精度符合轻量级模型预期,为边缘端安防及交通领域提供了高效的解决方案。


本文详细内容请下载:

http://www.chinaaet.com/resource/share/2000007264


投稿邮箱:ICAPP@belling.com.cn


作者信息:

洪泽,高魏华

(中国电子科技集团公司第五十八研究所,江苏无锡214035)

此内容为AET网站原创,未经授权禁止转载。
RK3588 YOLOv5s 边缘端部署 NPU 集成电路应用