边缘AI SoC选型指南:12种组合的权衡与实战
1. 边缘AI场景下SoC选型的底层逻辑边缘AI这个词这两年热得发烫但真正落到硬件选型上很多人第一反应还是“算力越大越好”。我接触过不少做智能摄像头、工业质检盒子、车载DMS系统的团队初期选型时盯着NPU的TOPS数字看结果板子打回来发现功耗压不住、内存带宽喂不饱、工具链跑不通最后项目延期三个月。SoC在边缘AI里从来不是一颗孤立的芯片它是CPU、NPU、GPU、DSP、ISP、内存控制器、各类外设接口在硅片层面的一次“利益分配谈判”。标题里说的“12种组合”本质上就是这12种典型的资源配比方案每一种都对应着一类真实场景的权衡结果。先把这个问题的核心矛盾摆出来。边缘设备和云端服务器最大的区别在于云端可以堆功耗、堆散热、堆空间边缘设备不行。一个装在路灯杆上的AI盒子夏天表面温度能到70度冬天可能零下20度供电可能只有PoE的25瓦还要同时跑视频解码、AI推理、网络回传和本地存储。这种约束条件下SoC内部每一个计算单元的配比都是牵一发动全身的。CPU核心多了NPU面积就得压缩NPU算力上去了内存带宽和功耗墙立刻成为瓶颈ISP管线做深了芯片面积和成本又控制不住。所以“最懂权衡”这四个字不是营销话术是边缘AI芯片设计和使用中最真实的日常。这12种组合大致可以按照三个维度来切分算力密度NPU的TOPS和精度支持、通用计算能力CPU核心数与架构、数据吞吐与多媒体能力内存带宽、ISP、编解码单元。不同的组合方式决定了这颗SoC是适合做低功耗常开感知还是适合做多路视频结构化或者是做高实时性的运动控制加轻量推理。下面我会把这12种组合逐一拆开结合具体的芯片案例和实测数据讲清楚每种组合的适用边界和踩坑点。注意边缘AI选型的第一原则不是“峰值算力”而是“持续算力”。很多芯片标称4TOPS实际跑ResNet-50只能到1.2TOPS因为内存带宽和散热限制了持续输出。选型时必须看持续算力曲线而不是发布会PPT上的峰值数字。2. 12种SoC组合的详细拆解与适用场景2.1 组合一4×A55 1TOPS NPU LPDDR4——低功耗常开感知的甜点区这是目前边缘AI出货量最大的一类组合典型代表是瑞芯微RK3566/RK3568系列和全志T527。4个Cortex-A55小核跑在1.8GHz左右NPU算力0.8到1TOPSINT8搭配32位LPDDR4或LPDDR4X内存带宽大约10到12GB/s。这个配置看起来平平无奇但它解决了一个核心问题7×24小时常开运行时的功耗和成本平衡。我实测过RK3568跑YOLOv5s输入640×640INT8量化单帧推理大约35毫秒NPU占用率70%左右整芯片功耗在2.5到3瓦之间。如果换成YOLOv8n帧率还能再高一些。这个性能水平刚好卡在“能做事”和“不费电”的交叉点上。适合的场景包括智能门禁的人脸检测、零售货架的客流统计、农业大棚的虫情监测、充电桩的异常行为识别。这些场景的共同特点是不需要实时高帧率检测目标相对固定环境温度可控对成本极度敏感。这个组合的坑在哪里内存带宽是隐形天花板。1TOPS的NPU理论算力看着够用但如果你同时跑视频解码比如4路1080p25fps加AI推理LPDDR4的带宽很快就被吃满。我遇到过客户在RK3568上做4路视频分析NPU利用率只有40%但帧率死活上不去最后发现是DDR带宽被ISP和VDEC抢完了。解决办法有两个一是降低视频输入分辨率或帧率二是把推理模型输入尺寸从640降到416或320。实测输入从640降到416带宽占用下降约55%精度损失在可接受范围内mAP下降2到3个百分点。另一个经验是这类芯片的NPU对算子支持有偏好。RK3568的NPU对3×3卷积和深度可分离卷积优化得很好但对某些特殊算子如Deformable Conv、非标准Pooling支持不佳会回退到CPU执行速度直接掉一个数量级。选模型时优先选MobileNet、ShuffleNet、YOLO系列这些“NPU友好”的架构别上来就搞Swin Transformer那是给自己找麻烦。2.2 组合二8×A55 3TOPS NPU LPDDR4X——中端视频结构化的主力往上走一档8个A55核心通常分两个簇每簇4核NPU算力2到3TOPS内存升级到LPDDR4X带宽拉到17GB/s左右。代表芯片有RK3588S降规版、晶晨A311D2、联发科Genio 700。这个组合的核心价值在于能同时处理多路视频的轻量结构化。什么叫轻量结构化就是检测分类简单属性识别不做复杂的ReID或行为分析。比如一个园区闸机口需要同时看4路1080p视频每路做人脸检测口罩识别工服颜色分类。8个A55核心在这里的作用不是跑AI而是处理视频解码后的后处理逻辑、网络协议栈、数据库写入和业务调度。NPU专心做推理CPU专心做逻辑分工明确。实测数据RK3588S跑YOLOv5s在4路1080p输入下每路帧率能到18到22fpsNPU占用率85%左右整板功耗6到8瓦。如果换成单路4K输入帧率能到45fps以上。这个性能水平已经能覆盖大部分中端安防和工业视觉需求。这个组合的选型关键是看NPU的INT8和INT16混合精度支持。有些场景如小目标检测、医疗影像初筛对量化误差敏感纯INT8会掉点严重需要NPU支持混合精度。RK3588的NPU支持INT4/INT8/INT16混合运算实测在PCB缺陷检测场景下INT16模式比INT8的mAP高4到6个百分点代价是算力减半、功耗增加30%。这个取舍要看具体场景的精度底线在哪里。实操心得8核A55的调度策略很关键。默认的Linux CFS调度器在AI负载下容易把任务在核心间反复迁移导致缓存命中率下降。我通常会把NPU推理线程绑核到CPU4-7大簇把网络和存储中断绑到CPU0-3小簇实测端到端延迟降低15%到20%。具体操作是修改/proc/interrupts里的smp_affinity或者用taskset命令绑核。2.3 组合三4×A76 4×A55 6TOPS NPU LPDDR5——高端边缘计算的门槛这是目前国产边缘AI芯片的旗舰配置代表是RK3588完整版、高通QCS8550、华为昇腾310B系列虽然架构不同但定位类似。4个A76大核跑2.4GHz4个A55小核跑1.8GHzNPU算力6TOPSINT8LPDDR5带宽拉到32GB/s以上。这个组合的目标场景是8到16路视频结构化、本地大模型推理、多传感器融合。6TOPS的NPU是什么概念跑YOLOv8m输入640能到120fps以上跑ResNet-50能到800fps以上跑BERT-base能到50fps左右。这意味着你可以在边缘盒子上做实时多路检测跟踪属性识别简单行为分析。我见过一个智慧工地项目用RK3588同时处理12路1080p视频每路做安全帽检测反光衣检测区域入侵检测整机功耗控制在15瓦以内用被动散热就能压住。但这个组合的坑也最多。首先是内存带宽的分配问题。LPDDR5虽然带宽大但NPU、GPU、VPU、CPU都要抢。如果不在驱动层做QoS配置很容易出现NPU等数据、VPU等输出、CPU等中断的“三输”局面。RK3588的解决方案是在DDR控制器里做了优先级仲裁但默认配置不一定适合你的场景。我通常会在设备树里调整NPU的DDR QoS优先级把NPU的读带宽权重调高实测多路推理的帧率稳定性提升明显。其次是散热设计。6TOPS NPU满载功耗大约4到5瓦加上CPU和DDR整芯片功耗能到12到15瓦。如果做无风扇设计散热片热阻必须控制在2°C/W以内否则夏天户外场景必然降频。我见过一个客户把RK3588塞进密闭铝壳夏天中午NPU频率从1GHz降到600MHz推理帧率直接腰斩。后来改成石墨烯导热片外壳散热齿问题才解决。第三是工具链成熟度。RK3588的RKNN工具链虽然迭代很快但某些算子的量化精度仍然不如英伟达的TensorRT。比如Group Conv在INT8量化后精度损失较大需要手动做混合量化。昇腾310B的CANN工具链对PyTorch模型的支持更好但算子覆盖度不如RKNN。选型时要拿自己的模型去实测别信厂商的“支持列表”。2.4 组合四2×A55 0.5TOPS NPU SRAM——MCU级边缘AI的极简方案这个组合严格来说不算传统SoC更像是带NPU的MCU代表是STM32N6、恩智浦i.MX RT700、兆易创新GD32H7系列。2个A55或者Cortex-M55核心NPU算力0.1到0.5TOPS内存用片上SRAM而不是DDR。这个组合解决的是毫秒级响应、微瓦级功耗、极低成本的极端需求。什么场景需要这种配置比如工业电机的异常振动检测需要在1毫秒内完成推理并触发停机比如智能传感器的关键词唤醒需要常年靠纽扣电池供电比如汽车门把手的活体检测需要零延迟响应。这些场景的共同点是数据量小、模型小、实时性要求极高、功耗预算极低。STM32N6的NPU算力是0.6TOPS配1MB SRAM跑一个10KB大小的关键词识别模型推理时间大约200微秒功耗不到10毫瓦。这个性能水平用A55DDR的方案根本做不到因为DDR的唤醒和访问延迟就超过100微秒了。SRAM的确定性访问延迟是这类场景的刚需。这个组合的选型关键是看SRAM容量和NPU的算子支持。SRAM容量决定了你能跑多大的模型通常1MB SRAM只能跑50KB到100KB的模型权重激活值。如果模型再大就得外挂Flash但Flash的访问延迟又上来了。所以这类芯片适合跑TinyML级别的模型比如MobileNetV1的0.25倍宽度版本、DS-CNN、TCN等。别想着在上面跑YOLO那是自找苦吃。常见问题STM32N6的NPU工具链STM32Cube.AI对TensorFlow Lite模型的支持最好对PyTorch模型需要先转ONNX再转TFLite转换过程中容易丢算子。我通常建议直接在TFLite里训练和量化避免转换损失。另外STM32N6的NPU不支持动态Shape模型输入尺寸必须固定这个在模型设计阶段就要确定好。2.5 组合五4×A73 2TOPS NPU LPDDR4——车载与工业的宽温选择4个A73核心或A76降频版NPU算力1.5到2TOPSLPDDR4内存但重点是宽温支持和功能安全。代表芯片有瑞萨RZ/V2M、德州仪器TDA4VM、黑芝麻华山A1000降规版。这个组合的目标场景是车载DMS/OMS、工业机器视觉、户外电力巡检。A73/A76核心在车载场景的优势是单线程性能强。车载应用里有很多单线程的协议栈和控制逻辑A55的单核性能有时候不够用。比如同时处理CAN总线报文、以太网AVB流、USB摄像头数据还要跑AI推理A73的单核性能能保证控制环路的实时性。NPU算力不需要太高因为车载场景的模型通常比较小DMS的视线检测模型只有几MB但对确定性延迟要求极高。这个组合的选型关键是看芯片的AEC-Q100认证等级和功能安全等级。车载前装必须过AEC-Q100 Grade 2-40到105°C工业场景至少Grade 3-40到85°C。另外如果涉及刹车、转向等安全关键功能芯片需要支持ISO 26262 ASIL-B以上。这些认证直接决定了芯片的成本和供货周期选型时要把认证要求放在算力前面。实测数据TDA4VM跑DMS模型驾驶员视线头部姿态手机检测单帧推理8毫秒整芯片功耗5瓦左右在105°C环境温度下不降频。这个性能水平用消费级芯片也能做到但消费级芯片在105°C下早就降频或死机了。宽温芯片的硅片工艺和封装材料都不一样成本通常是消费级的2到3倍。2.6 组合六8×A78 10TOPS NPU LPDDR5——边缘大模型推理的尝试这是2024到2025年新出现的一类组合代表是高通QCS8550、联发科Genio 1200、瑞芯微RK3688传闻。8个A78核心NPU算力8到10TOPSLPDDR5带宽50GB/s以上。这个组合的目标是在边缘设备上跑7B参数以下的量化大模型。10TOPS的NPU跑Llama-2-7BINT4量化大概能到5到8 tokens/秒跑Qwen-1.8BINT8能到15到20 tokens/秒。这个速度做本地语音助手、文档摘要、简单问答已经够用了。但要注意大模型推理的瓶颈不在NPU算力而在内存带宽。7B模型INT4量化后大约3.5GB每次推理都要把全部权重从DDR读一遍50GB/s的带宽意味着每token至少需要70毫秒的纯数据搬运时间。所以实际tokens/秒往往被带宽限制而不是算力限制。这个组合的坑在于功耗和散热。10TOPS NPU满载功耗8到10瓦加上CPU和DDR整芯片功耗能到20瓦以上。边缘设备如果做无风扇设计散热片体积会很大。我见过一个客户把QCS8550塞进一个手掌大的盒子里跑大模型结果连续推理5分钟后频率从2.8GHz降到1.2GHztokens/秒从8降到3。后来加了微型涡轮风扇才稳住。实操心得边缘大模型推理建议用投机采样Speculative Decoding或者KV Cache量化来降低带宽压力。投机采样用小模型如Qwen-0.5B做草稿大模型做验证实测能提升1.5到2倍吞吐。KV Cache从FP16量化到INT8带宽占用减半精度损失很小。这些技术在PC端已经成熟边缘端移植需要看NPU工具链是否支持。2.7 组合七4×A55 4TOPS NPU 无DDR——存算一体的探索这个组合比较特殊NPU算力4TOPS但没有外挂DDR全靠片上大容量SRAM或存算一体架构。代表是后摩智能、知存科技、亿铸科技的一些存算一体芯片。这个组合解决的是能效比问题传统冯诺依曼架构下数据在DDR和NPU之间搬运的功耗占总功耗的60%到80%存算一体把计算单元和存储单元放在一起能效比能提升10到100倍。4TOPS算力配上几十MB的片上SRAM跑YOLOv5s能到60fps以上功耗只有1到2瓦。这个能效比用传统架构根本做不到。但存算一体的坑在于编程模型不成熟。传统NPU用ONNX或TFLite模型就能跑存算一体芯片往往需要专门的编译器把模型映射到存算阵列上算子支持有限调试工具也少。目前这类芯片适合跑固定的、成熟的模型不适合快速迭代的场景。2.8 组合八2×A76 1TOPS NPU 双ISP——智能摄像头的专用方案2个A76核心1TOPS NPU重点是双ISP管线支持双路Sensor输入和硬件级图像融合。代表芯片有安霸CV2、CV5瑞芯微RV1126B。这个组合的目标场景是双目深度感知、多光谱融合、HDR视频分析。双ISP的价值在于一路Sensor做可见光成像一路做红外或近红外成像硬件级融合后输出给NPU做推理。这在人脸识别可见光红外活体检测、夜视监控可见光红外补光、农业检测可见光多光谱场景里是刚需。NPU算力不需要太高因为融合后的图像信息量已经很大了模型可以做得更简单。这个组合的选型关键是看ISP的HDR性能和3D降噪能力。安霸CV5的ISP支持140dB HDR和硬件3D降噪在逆光和低照度场景下的成像质量明显优于普通ISP。但安霸的工具链比较封闭模型部署需要走安霸自己的SDK灵活性不如RKNN。选型时要权衡成像质量和开发效率。2.9 组合九16×A55 20TOPS NPU LPDDR5——边缘服务器的降维打击16个A55核心或8×A768×A55NPU算力20TOPS以上LPDDR5带宽100GB/s以上。代表芯片有华为昇腾310P、寒武纪MLU220、英伟达Jetson Orin NX。这个组合的目标场景是边缘服务器、多路视频全结构化、本地AI训练。20TOPS的NPU跑YOLOv8x能到200fps以上跑ResNet-152能到1500fps以上。这个性能水平已经能覆盖32路以上1080p视频的实时结构化。但功耗也上来了整芯片功耗30到50瓦需要主动散热。这个组合适合部署在机房或机柜里不适合户外无风扇场景。这个组合的选型关键是看软件生态。英伟达Jetson的CUDA生态最成熟PyTorch模型几乎零成本迁移但价格贵、供货周期长。昇腾的CANN生态在快速追赶对国产模型的支持更好但算子覆盖度仍有差距。寒武纪的Neuware生态相对封闭适合有专门算法团队的场景。选型时要把软件迁移成本算进去有时候芯片便宜但迁移成本高总体TCO反而更贵。2.10 组合十4×A35 0.2TOPS NPU BLE——电池供电的微型AI4个Cortex-A35核心或M33NPU算力0.1到0.2TOPS集成BLE和802.15.4无线。代表芯片有芯科MG24、恩智浦RW612。这个组合的目标场景是电池供电的无线AI传感器比如智能门锁的人脸唤醒、穿戴设备的动作识别、农业传感器的病虫害声音识别。A35核心跑在1GHz左右NPU算力虽然小但跑关键词识别、手势识别、异常声音检测这些任务足够了。关键是功耗深度睡眠模式下整芯片功耗不到10微安BLE广播间隔1秒的情况下平均功耗不到100微安一颗纽扣电池能撑一年以上。这个组合的选型关键是看无线协议栈和AI推理的协同比如BLE连接事件和NPU推理的时间调度避免射频和计算同时工作导致峰值功耗过高。2.11 组合十一8×A55 2TOPS NPU 双千兆网口——工业网关的AI升级8个A55核心2TOPS NPU重点是双千兆网口和工业接口CAN、RS485、Modbus。代表芯片有瑞芯微RK3568J、芯驰D9。这个组合的目标场景是工业网关的AI化升级在传统网关功能基础上增加AI推理能力。工业网关原来只做协议转换和数据转发现在需要做本地AI推理比如电机振动分析、PLC时序数据异常检测、工业相机图像初筛。2TOPS的NPU跑时序模型LSTM、TCN或者轻量CNN足够了。双千兆网口可以做网络冗余或数据分流工业接口直接连PLC和传感器。这个组合的选型关键是看工业接口的隔离等级和EMC性能工业现场电磁干扰严重接口隔离不到位的芯片容易死机。2.12 组合十二4×A55 1TOPS NPU 集成DDR——极致成本的AIoT方案4个A55核心1TOPS NPUDDR集成在封装内PoP或SiP。代表芯片有全志V853、瑞芯微RV1106。这个组合的目标场景是极致成本的AIoT设备比如智能玩具、低端IPC、扫码盒子。集成DDR的好处是PCB层数减少、BOM成本降低、体积缩小。坏处是内存容量固定通常128MB到512MB带宽有限通常4到8GB/s无法扩展。这个组合适合跑非常轻量的模型比如人脸检测不是识别、二维码检测、简单分类。选型时要算清楚内存占用模型权重激活值系统内存视频缓冲512MB通常只够跑一路1080p的轻量推理。3. 12种组合的横向对比与选型决策树把上面12种组合放在一起看选型的核心决策变量其实只有三个功耗预算、算力需求、成本约束。这三个变量构成一个不可能三角任何选型都是在三角里找平衡点。组合编号CPU配置NPU算力内存类型典型功耗目标场景成本区间组合一4×A551TOPSLPDDR42-3W低功耗常开感知低组合二8×A553TOPSLPDDR4X6-8W中端视频结构化中组合三4×A764×A556TOPSLPDDR512-15W高端边缘计算高组合四2×A55/M550.5TOPSSRAM100mWMCU级实时AI极低组合五4×A732TOPSLPDDR45W车载/工业宽温高组合六8×A7810TOPSLPDDR520W边缘大模型极高组合七4×A554TOPS无DDR1-2W存算一体探索中组合八2×A761TOPSLPDDR43-4W智能摄像头中组合九16×A5520TOPSLPDDR530-50W边缘服务器极高组合十4×A350.2TOPSSRAM1mW电池供电微型AI低组合十一8×A552TOPSLPDDR45-7W工业网关中组合十二4×A551TOPS集成DDR2-3W极致成本AIoT极低选型决策树可以这样走先看功耗预算如果小于1瓦只能在组合四、七、十里选如果1到5瓦组合一、五、八、十二是候选如果5到15瓦组合二、三、十一可以考虑如果大于15瓦组合六、九是唯一选择。再看算力需求如果模型小于100MB且输入小于416×4161TOPS够用如果模型在100MB到500MB之间需要3到6TOPS如果模型大于500MB或需要跑大模型需要10TOPS以上。最后看成本约束消费级场景优先选组合一、十二工业级选组合二、五、十一车载级选组合五服务器级选组合九。注意这个决策树是简化版实际选型还要考虑工具链成熟度、供货周期、认证要求、开发团队熟悉度等因素。我见过一个团队因为工具链不熟悉选了算力更高的芯片但开发周期多花了三个月总体成本反而更高。4. 实操中的常见问题与排查技巧4.1 NPU利用率上不去帧率死活提不起来这是最常见的问题。NPU利用率低通常有三个原因数据喂不饱、算子回退、内存带宽瓶颈。排查顺序是先用厂商工具看NPU的DMA带宽占用如果DMA带宽低于理论值的60%说明数据喂不饱检查输入预处理是否在CPU上做应该用NPU或GPU做再看算子支持列表如果模型里有NPU不支持的算子会回退到CPU速度掉一个数量级最后看DDR带宽占用如果超过80%说明内存带宽是瓶颈需要降低输入分辨率或模型大小。我常用的排查命令是cat /sys/kernel/debug/rknpu/loadRK3588或npu-smi info昇腾实时看NPU利用率和DDR带宽。如果NPU利用率低于50%但帧率上不去基本可以确定是数据搬运或算子回退的问题。4.2 量化后精度掉点严重INT8量化后mAP掉5到10个点是常态掉20个点以上就不正常了。常见原因有校准集不具代表性、某些层对量化敏感、激活值分布偏移。解决办法校准集要从真实场景里采样至少500到1000张覆盖各种光照和角度对敏感层通常是第一层和最后一层做混合量化保持FP16用KL散度或MSE校准方法代替简单的min-max校准。RKNN工具链支持混合量化可以在配置文件里指定某些层不量化。昇腾的AMCT工具也支持类似功能。实测在PCB缺陷检测场景下混合量化比纯INT8的mAP高6到8个点推理速度只慢15%左右。4.3 多路视频推理时帧率不稳定多路视频场景下帧率波动大通常是内存带宽争抢或CPU调度抖动导致的。解决办法在设备树里配置NPU的DDR QoS优先级把NPU的读带宽权重调高用taskset把NPU推理线程绑到固定核心把视频解码中断绑到另一组核心关闭CPU的自动调频锁定在性能模式。我实测过RK3588跑8路1080p推理默认配置下帧率在12到25fps之间波动做了QoS和绑核后稳定在20到22fps。波动从±50%降到±10%。4.4 芯片发热降频边缘设备无风扇设计下芯片温度超过85°C就会降频。解决办法散热片热阻控制在2°C/W以内用石墨烯导热片代替硅脂外壳做散热齿如果还不行只能降低NPU频率或减少推理路数。我见过最极端的案例是户外AI盒子夏天表面温度75°C芯片结温105°CNPU频率从1GHz降到400MHz帧率从30fps降到8fps。后来把外壳从塑料换成压铸铝问题才解决。4.5 工具链版本不匹配NPU工具链和驱动版本不匹配是新手最容易踩的坑。RKNN Toolkit版本和板端RKNPU驱动版本必须对应否则模型加载失败或推理结果错误。昇腾的CANN版本和固件版本也有严格的对应关系。建议在项目开始时就把工具链版本锁定不要随意升级。我通常会在Docker里固化整个开发环境避免版本漂移。问题现象可能原因排查方法解决方案NPU利用率低数据喂不饱/算子回退看DMA带宽和算子日志预处理移到NPU/混合量化量化掉点严重校准集不具代表性对比FP16和INT8输出混合量化KL校准多路帧率波动带宽争抢/调度抖动看DDR带宽和CPU占用QoS配置绑核芯片发热降频散热设计不足看结温和频率曲线改进散热/降频模型加载失败工具链版本不匹配对比版本号锁定工具链版本5. 边缘AI SoC选型的个人经验总结做了这么多年边缘AI项目我最大的体会是选型不是选最强的是选最合适的。很多团队一上来就看算力天梯图盯着TOPS数字比来比去结果忽略了功耗、带宽、工具链、供货这些真正决定项目成败的因素。我见过太多项目因为选了一颗“算力很强但工具链不熟”的芯片开发周期翻倍也见过因为“贪便宜选了低端芯片”结果模型跑不动被迫换方案。我的建议是先明确场景的硬约束功耗、温度、成本、认证在满足硬约束的芯片里选工具链最成熟的最后再看算力是否够用。算力不够可以优化模型量化、剪枝、蒸馏工具链不熟那是真的没办法。另外内存带宽比NPU算力更容易成为瓶颈选型时一定要看DDR带宽和NPU算力的比值这个比值低于2GB/s per TOPS就要警惕了。最后分享一个小技巧在项目初期用目标芯片的开发板跑一遍自己的模型实测持续推理的帧率、功耗和温度。别信厂商的benchmark那是理想条件下的峰值数据。实测数据才是选型的唯一依据。我通常会在开发板上连续跑24小时看帧率衰减和温度曲线这个数据比任何规格书都可靠。