ASR Awesome
ASR(Automatic Speech Recognition)和 STT(Speech-to-Text)模型、工具与评估资源索引。
基础概念
- STT / Speech-to-Text / ASR / Automatic Speech Recognition / Speech Recognition。
- 常与 VAD、endpointing、标点恢复和 speaker diarization 组成语音处理 pipeline。
- 流式识别重点关注首 token 延迟、partial transcript、稳定性和最终修正。
Models
- modelscope/FunASRGitHubmodelscope/FunASRmodelscope/FunASR · MIT · 参考 · FunAudioLLM/SenseVoice · Multilingual Voice Understanding Model · 模型缓存目录 /.cache/modelscope/hub/iic笔记:FunASR
- MIT,Python,PyTorch;包含 ASR、VAD、标点和说话人相关组件。
- Voxtral
- 支持中文。
- Voxtral Mini 3BHuggingFaceHF:mistralai/Voxtral-Mini-3B-2507支持中文 · mistralai/Voxtral-Mini-3B-2507 · 9.5 GB of GPU RAM in bf16 or fp16 · mistralai/Voxtral-Small-24B-2507 · 55 GB of GPU RAM in bf16 or fp16huggingface.co · huggingface.co/mistralai/Voxtral-Mini-3B-2507笔记:Voxtral
- Voxtral Small 24BHuggingFaceHF:mistralai/Voxtral-Small-24B-2507支持中文 · mistralai/Voxtral-Mini-3B-2507 · 9.5 GB of GPU RAM in bf16 or fp16 · mistralai/Voxtral-Small-24B-2507 · 55 GB of GPU RAM in bf16 or fp16huggingface.co · huggingface.co/mistralai/Voxtral-Small-24B-2507笔记:Voxtral
- Transformers Voxtral 文档HuggingFaceHF:docs/transformershuggingface.co · huggingface.co/docs/transformers/main/en/model_doc/voxtral
- NVIDIA Canary-1B-FlashHuggingFaceHF:nvidia/canary-1b-flashhuggingface.co · huggingface.co/nvidia/canary-1b-flash
- 语言覆盖需按模型卡确认,原有记录注明不含中文。
VAD 与辅助组件
- Silero VADGitHubsnakers4/silero-vad
- FunASR FSMN-VADGitHubmodelscope/FunASRmodelscope/FunASR · MIT · 参考 · FunAudioLLM/SenseVoice · Multilingual Voice Understanding Model · 模型缓存目录 /.cache/modelscope/hub/iic笔记:FunASR
- pyannote-audioGitHubpyannote/pyannote-audio
- speaker diarization、speech activity detection 和 overlapped speech detection。
评估
| 指标 | 全称 | 方向 | 含义 |
|---|---|---|---|
| WER | Word Error Rate | 越低越好 | 词错误率 |
| CER | Character Error Rate | 越低越好 | 字符错误率 |
| PER | Phoneme Error Rate | 越低越好 | 音素错误率 |
| RTFx | Real-Time Factor | 越高越好 | 实时处理能力 |
WER = (S + D + I) / NS:Substitutions;D:Deletions;I:Insertions;N:Total words。
- RTFx 通常表示单位计算时间处理的音频秒数,应和首包延迟、并发、内存一起评估。
- Hugging Face EvaluateHuggingFaceHF:docs/evaluatehuggingface.co · huggingface.co/docs/evaluate/index
- WER MetricHuggingFaceHF Space:evaluate-metric/werhuggingface.co · huggingface.co/spaces/evaluate-metric/wer
- Open ASR LeaderboardHuggingFaceHF Space:hf-audio/open_asr_leaderboardhuggingface.co · huggingface.co/spaces/hf-audio/open_asr_leaderboard
关联信息
反向链接、本文链接的其他页面和外部资料。
反向链接
- AI Model笔记 · ASR / STT
AI Model Awesome 总索引 · LLM 与开放模型 · 图像生成 · 视频生成 · OCR · ASR / STT · TTS · VAD · 音乐生成 · VLM / MLLM / Vision · Agent 与 Coding
- AI Model Awesome笔记 · ASR / STT
按模型能力和使用场景组织的 AI 模型资源索引,保留模型架构、厂商、版本、推理资源、量化、微调和扩散模型历史资料。新增内容优先写入对应专题页面。 · LLM 与开放模型 · 图像生成 · 视频生成 · OCR 与文档理解 · ASR / STT
References
GitHub3 条
- modelscope/FunASRgithub.com/modelscope/FunASR
- pyannote/pyannote-audiogithub.com/pyannote/pyannote-audio
- snakers4/silero-vadgithub.com/snakers4/silero-vad
HuggingFace7 条
- HF Space:evaluate-metric/werhuggingface.co/spaces/evaluate-metric/wer
- HF Space:hf-audio/open_asr_leaderboardhuggingface.co/spaces/hf-audio/open_asr_leaderboard
- HF:docs/evaluatehuggingface.co/docs/evaluate/index
- HF:docs/transformershuggingface.co/docs/transformers/main/en/model_doc/voxtral
- HF:mistralai/Voxtral-Mini-3B-2507huggingface.co/mistralai/Voxtral-Mini-3B-2507
- HF:mistralai/Voxtral-Small-24B-2507huggingface.co/mistralai/Voxtral-Small-24B-2507
- HF:nvidia/canary-1b-flashhuggingface.co/nvidia/canary-1b-flash