← 在分诊台打开(可搜索/导航)
端侧语音识别/语音转文字该用什么
🎯 E1 任务→模型路由 · 手机/ESP32/边缘设备
状态:Whisper-tiny精度高但重,Vosk轻量适合端侧
也这样说: 语音识别 asr whisper vosk 语音转文字 端侧语音
可能根因:- 需要离线语音识别
- 端侧设备算力/内存受限
- 实时性要求高
解决方案
✅ 官方方案(1条)
OpenAI Whisper(tiny版)
tiny版39M参数,FP32模型287MB,INT8量化后72MB;CPU 1核256MB内存下WER 15.2%;精度远超传统ASR但模型大,ESP32跑不了,手机/树莓派可以
时效:2026-09
打开 ↗💡 排坑指南(1条)
Vosk(离线轻量ASR)
纯离线无需联网,模型仅50MB,支持Android/iOS/Raspberry Pi;中文识别率不如Whisper但轻量10倍,端侧首选
时效:2026-09
打开 ↗⚠️ 避坑提醒(3条)
Whisper INT8量化WER从5.8%升到7.5%
FP32 WER 5.8%→INT8全量化7.5%,精度下降明显;通过sherpa-onnx部署到Android时ONNX转换+INT8量化阶段常出现识别精度骤降;建议用INT8动态量化(WER 6.9%)而非全量化
时效:2026-09
打开 ↗ESP32-S3跑语音模型内存严重不足
ESP32-S3通用堆仅320KB,原始模型加载需4.2MB动态内存;必须选带PSRAM的ESP32-S3且模型需极限量化到<200KB
时效:2026-09
打开 ↗ESP32 ADC噪声严重影响语音输入
ESP32内置ADC对干扰极敏感,语音采集需外挂I2S麦克风(如INMP441);用内置ADC做语音识别噪声比信号还大
时效:2026-09
打开 ↗
本页是路由层入口,不存教程正文。每条入口带人工评注。
来自 问题分诊台 · Vertical Hub