← 在分诊台打开(可搜索/导航)

不知道有哪些类别怎么做识别(零样本/开放词汇)

🎯 E1 任务→模型路由 · 手机/服务器
状态:CLIP/YOLO-World可零样本识别但端侧有门槛
也这样说: 零样本 开放词汇 clip yolo-world grounding dino 不知道有哪些类
可能根因:

解决方案

✅ 官方方案(3条)

OpenAI CLIP 官方仓库
用文字描述类别即可识别,不用标注训练;ViT-B/32约151M参数量化后可跑手机,但延迟比MobileNet高5-10倍
时效:2026-09
打开 ↗
YOLO-World 开放词汇检测
CLIP+YOLO融合,输入文字类别直接检测+画框,不用训练;比纯CLIP快,比纯YOLO灵活,但精度低于专训模型
时效:2026-09
打开 ↗
Grounding DINO(文字描述直接检测)
比YOLO-World精度更高,输入"chair . person . dog ."直接检测;但模型约600MB端侧几乎不可能,只适合服务器
时效:2026-09
打开 ↗

🔧 变通方案(1条)

Grounding DINO的正确用法:自动预标注 暂无外链
别拿它做线上检测——用Grounding DINO批量跑未标注图片输出检测框→导出标注结果→人工修正错误框→用修正后数据训YOLO;80%的框是对的,人工只改20%,最终线上跑的是YOLO不是Grounding DINO
时效:2026-09

⚠️ 避坑提醒(3条)

Grounding DINO做实时检测非常慢 暂无外链
Swin-T backbone+Transformer编码器,单图推理200-500ms,比YOLO慢10-20倍;它的正确用法是做自动标注工具不是做实时检测器——批量跑未标注数据输出检测框,人工只做修正,比从头标注快5-10倍
时效:2026-09
Grounding DINO的CUDA算子编译是地狱
sm_120不支持需打patch,CUDA_HOME未设置/nvcc版本不匹配/_C未定义三连报错;端侧别想,服务器部署都要折腾半天
时效:2026-09
打开 ↗
CLIP在手机端不是即插即用 暂无外链
ViT-B/32量化后约50MB,首次加载2-3秒,每张图推理100-200ms;做实时检测不现实,适合离线/低频场景
时效:2026-09

本页是路由层入口,不存教程正文。每条入口带人工评注。
来自 问题分诊台 · Vertical Hub