小白必看!SenseVoice语音识别零基础入门教程

你是不是经常遇到这样的场景:开会录音需要整理成文字,或者想给视频自动添加字幕,但手动打字太费时间?今天我要介绍的SenseVoice语音识别工具,可能就是你的救星。

SenseVoice是一个基于ONNX量化的多语言语音识别服务,最大的特点就是——处理10秒音频只需要70毫秒,而且支持中文、英文、粤语、日语、韩语等50多种语言。最重要的是,它真的很容易上手,即使你完全不懂编程也能快速学会。

1. 环境准备:安装必要的软件

在开始之前,我们需要先安装一些必要的软件包。别担心,只需要一行命令就能搞定:

pip install funasr-onnx gradio fastapi uvicorn soundfile jieba

这行命令会安装SenseVoice运行所需的所有依赖包。如果你看到"Successfully installed"的提示,说明安装成功了。

2. 快速启动服务

安装好依赖后,启动服务非常简单:

python3 app.py --host 0.0.0.0 --port 7860

运行这个命令后,你会看到一些启动信息。当看到"Application startup complete"时,说明服务已经成功启动了。

现在你可以通过以下地址访问服务:

  • 网页界面:http://localhost:7860
  • API文档:http://localhost:7860/docs
  • 健康检查:http://localhost:7860/health

3. 网页界面使用教程

打开 http://localhost:7860 后,你会看到一个很友好的界面。这里有两种使用方式:

3.1 上传音频文件

点击"Upload"按钮,选择你的音频文件(支持mp3、wav、m4a、flac等常见格式),然后点击"Transcribe"按钮。几秒钟后,右侧就会显示识别结果。

3.2 实时录音识别

点击"Record"按钮,直接对着麦克风说话,说完后点击"Stop",系统会自动识别你说的话。

小技巧:在语言选择中,如果你不确定音频是什么语言,就选"auto",系统会自动检测。

4. API接口调用方法

如果你想要在其他程序中使用这个服务,可以通过API接口来调用:

curl -X POST "http://localhost:7860/api/transcribe" \
  -F "file=@你的音频文件.wav" \
  -F "language=auto" \
  -F "use_itn=true"

这个命令会把你的音频文件发送给服务,然后返回识别结果。

5. Python代码调用示例

如果你会用Python,可以这样调用:

from funasr_onnx import SenseVoiceSmall

# 初始化模型
model = SenseVoiceSmall(
    "/root/ai-models/danieldong/sensevoice-small-onnx-quant",
    batch_size=10,
    quantize=True
)

# 识别音频
result = model(["你的音频文件.wav"], language="auto", use_itn=True)
print(result[0])

这段代码会加载模型并识别指定的音频文件。

6. 支持的语言列表

SenseVoice支持很多语言,常用的有:

语言代码对应语言
auto自动检测
zh中文
en英语
yue粤语
ja日语
ko韩语

7. 常见问题解答

问:我的音频文件格式不支持怎么办? 答:SenseVoice支持mp3、wav、m4a、flac等常见格式。如果你的文件格式不在支持列表中,可以用格式工厂等工具先转换一下。

问:识别结果中的数字显示不正常怎么办? 答:这是ITN(逆文本正则化)功能在起作用,它会自动把"三"转为"3","百分之十"转为"10%"。如果你不需要这个功能,可以在调用时设置use_itn=false

问:服务启动失败怎么办? 答:首先检查是否安装了所有依赖包,可以重新运行安装命令。如果还是不行,检查一下7860端口是否被其他程序占用了。

8. 实用技巧和小建议

  1. 批量处理:如果你有很多音频文件需要处理,可以写一个简单的脚本批量调用API,这样效率更高。

  2. 音质影响:音频质量对识别效果影响很大,尽量使用清晰的录音。如果背景噪音太大,识别准确率会下降。

  3. 分段处理:对于很长的音频,可以考虑分成小段处理,这样即使某段识别出错,也不会影响整个文件。

  4. 语言选择:如果你知道音频的语言,直接指定语言代码(如zh、en)会比用auto检测更准确。

9. 总结

SenseVoice语音识别工具真的很好用,特别是对于新手来说:

  • 安装简单,一行命令搞定
  • 使用方便,有网页界面和API两种方式
  • 识别速度快,10秒音频只要70毫秒
  • 支持语言多,中英日韩都能识别

无论你是想给视频加字幕,还是整理会议记录,或者只是好奇想玩玩语音识别,SenseVoice都是一个很好的选择。最重要的是,它完全免费开源,你可以放心使用。

现在就去试试吧,相信你会被它的便捷和高效惊艳到!


获取更多AI镜像

想探索更多AI镜像和应用场景?访问 CSDN星图镜像广场,提供丰富的预置镜像,覆盖大模型推理、图像生成、视频生成、模型微调等多个领域,支持一键部署。

Logo

腾讯云面向开发者汇聚海量精品云计算使用和开发经验,营造开放的云计算技术生态圈。

更多推荐