← 在分诊台打开(可搜索/导航)
一个设备上同时跑检测+分类+OCR怎么搞(多模型并行)
🧩 E5 模型组合方案 · Jetson/RK3588/Hailo
状态:瓶颈是内存不是算力,8GB撑不住3模型
也这样说: 多模型 并发推理 同时跑多个模型 multi-model
可能根因:- 一个设备上需要同时跑多个模型
- 检测+分类+OCR串联或并联
- 内存和算力争抢
解决方案
💡 排坑指南(2条)
Jetson多模型并发内存参考
Orin Nano 8GB:检测+1个小分类器是极限,第3个模型OOM;Orin NX 16GB:2-4摄像头+检测+1-2个次级模型;AGX Orin 32/64GB:8+摄像头+3+并发模型
时效:2026-09
打开 ↗并行vs顺序流水线性能对比
顺序流水线:端到端45ms/22FPS/GPU 85-95%;并行流水线:端到端28ms/35FPS/GPU 92-98%——并行快60%但实现复杂度高3倍
时效:2026-09
打开 ↗🔧 变通方案(1条)
DeepStream+Triton自动调度多模型
NVIDIA DeepStream+Triton Inference Server自动处理批处理和模型并发,无需手动调度CUDA流;AGX Orin双DLA引擎可把次级模型卸载到DLA
时效:2026-09
打开 ↗⚠️ 避坑提醒(1条)
多模型瓶颈是内存不是算力 暂无外链
每个并发模型同时占用weights+engine+activation buffers+CUDA/TensorRT上下文;TOPS够用但RAM先耗尽——你会在跑满算力之前先OOM
时效:2026-09
本页是路由层入口,不存教程正文。每条入口带人工评注。
来自 问题分诊台 · Vertical Hub