← 在分诊台打开(可搜索/导航)

说话人识别/声纹识别该用什么(判断"是谁在说话")

🎯 E1 任务→模型路由 · 手机/树莓派
状态:Resemblyzer轻量适合端侧,SpeechBrain精度高但重
也这样说: 声纹 说话人识别 speaker resemblyzer speechbrain pyannote 声纹识别
可能根因:

解决方案

💡 排坑指南(1条)

Resemblyzer(端侧首选)
256维声纹嵌入,推理约50ms,树莓派/手机端可实时跑;精度不如ECAPA-TDNN但速度差4倍,端侧声纹识别首选
时效:2026-09
打开 ↗

⚠️ 避坑提醒(2条)

SpeechBrain模型117.5MB太重
SpeechBrain用ECAPA-TDNN模型约117.5MB,精度高但推理200ms且模型大;树莓派勉强跑手机端吃力,端侧用Resemblyzer替代
时效:2026-09
打开 ↗
pyannote更适合服务器不适合端侧
pyannote说话人分离能力强但工程复杂度高、模型大;做多人会议转录用pyannote(服务器),做声纹锁用Resemblyzer(端侧)
时效:2026-09
打开 ↗

本页是路由层入口,不存教程正文。每条入口带人工评注。
来自 问题分诊台 · Vertical Hub