Wener Notes

ASR Awesome

约 1 分钟阅读
标签:模型ASRSTT资源精选

ASR(Automatic Speech Recognition)和 STT(Speech-to-Text)模型、工具与评估资源索引。

基础概念

  • STT / Speech-to-Text / ASR / Automatic Speech Recognition / Speech Recognition。
  • 常与 VAD、endpointing、标点恢复和 speaker diarization 组成语音处理 pipeline。
  • 流式识别重点关注首 token 延迟、partial transcript、稳定性和最终修正。

Models

VAD 与辅助组件

评估

指标全称方向含义
WERWord Error Rate越低越好词错误率
CERCharacter Error Rate越低越好字符错误率
PERPhoneme Error Rate越低越好音素错误率
RTFxReal-Time Factor越高越好实时处理能力

关联信息

反向链接、本文链接的其他页面和外部资料。

反向链接

  • AI Model
    笔记 · ASR / STT

    AI Model Awesome 总索引 · LLM 与开放模型 · 图像生成 · 视频生成 · OCR · ASR / STT · TTS · VAD · 音乐生成 · VLM / MLLM / Vision · Agent 与 Coding

  • AI Model Awesome
    笔记 · ASR / STT

    按模型能力和使用场景组织的 AI 模型资源索引,保留模型架构、厂商、版本、推理资源、量化、微调和扩散模型历史资料。新增内容优先写入对应专题页面。 · LLM 与开放模型 · 图像生成 · 视频生成 · OCR 与文档理解 · ASR / STT

References

GitHub3 条
HuggingFace7 条
最近更新commit 42c1983Edit

On this page