SOUND / 语音识别

Whisper

OpenAI Whisper 语音识别模型,支持多语言语音转文字。

186 次下载
大小
~49MB+162.6MB
内存
2GB+
精度
INT8

选择你正在使用的设备,设置指南和文档将相应更新。

快速开始

部署
sudo docker run --rm \
  --name rk3588-whisper \
  --privileged \
  --net=host \
  -e PYTHONUNBUFFERED=1 \
  -e RKNN_LOG_LEVEL=0 \
  -v /proc/device-tree/compatible:/proc/device-tree/compatible \
  ghcr.io/seeed-projects/recomputer-rk-cv/rk3588-whisper:latest \
  python3 web_service.py

REST API

使用 REST API 进行推理。复制以下命令。

Curl
curl -X POST "http://127.0.0.1:8000/api/models/whisper/task" -F "file=@/home/user/audio/long_podcast.wav" -F "language=zh"
Python
import requests
import json
resp = requests.post(
    "http://127.0.0.1:8000/api/models/whisper/predict",
    files={"file": open("/home/user/audio/test_en.wav", "rb")},
    data={"language": "en"},
    timeout=30
)
result = resp.json()
print(json.dumps(result, indent=2, ensure_ascii=False))

模型详情

reComputer RK

快速开始

1. 安装 Docker

在开发板上运行以下命令安装 Docker:

bash
# 下载安装脚本
curl -fsSL https://get.docker.com -o get-docker.sh
# 使用阿里云镜像源安装
sudo sh get-docker.sh --mirror Aliyun
# 启动 Docker 并设置开机自启
sudo systemctl enable docker
sudo systemctl start docker

2. 运行项目(一条命令,双模式预览)

本项目支持通过 Web 浏览器 访问。程序会自动启动一个用于语音识别的 Web 界面。

步骤 A:拉取镜像

bash
sudo docker pull ghcr.io/Seeed-Projects/recomputer-rk-cv/rk3588-whisper:latest
sudo docker pull ghcr.io/Seeed-Projects/recomputer-rk-cv/rk3576-whisper:latest

步骤 B:一键运行

适用于 RK3588:

bash
sudo docker run --rm --privileged --net=host \
    -e PYTHONUNBUFFERED=1 \
    -e RKNN_LOG_LEVEL=0 \
    -v /proc/device-tree/compatible:/proc/device-tree/compatible \
    ghcr.io/seeed-projects/recomputer-rk-cv/rk3588-whisper:latest \
    python3 web_service.py

通过以下地址访问:http://<Board_IP>:8000


适用于 RK3576:

bash
sudo docker run --rm --privileged --net=host \
    -e PYTHONUNBUFFERED=1 \
    -e RKNN_LOG_LEVEL=0 \
    -v /proc/device-tree/compatible:/proc/device-tree/compatible \
    ghcr.io/seeed-projects/recomputer-rk-cv/rk3576-whisper:latest \
    python3 web_service.py

通过以下地址访问:http://<Board_IP>:8000


🔌 API 文档

本项目提供 RESTful 接口用于 ASR 任务,支持音频文件的同步和异步转录。

1. 同步转录接口(短音频)

端点: POST /api/models/whisper/predict

适用于 20 秒以内的音频文件。

请求参数(Multipart/Form-Data):

  • file:(必填)待转录的音频文件(例如 .wav、.mp3)。
  • language:(可选)目标语言代码(例如 en、zh)。如果与当前模型不同,将热切换分词器。

使用示例:

bash
curl -X POST "http://127.0.0.1:8000/api/models/whisper/predict" \
     -F "file=@/home/user/audio/test_en.wav" \
     -F "language=en"

响应格式(JSON):

json
{
  "status": "success",
  "data": {
    "text": "Hello world, this is a test.",
    "language": "en",
    "duration": 3.5,
    "inference_time": 0.8
  }
}

2. 异步转录接口(长音频)

端点: POST /api/models/whisper/task

创建异步任务以处理较长的音频/视频文件。

使用示例:

bash
curl -X POST "http://127.0.0.1:8000/api/models/whisper/task" \
     -F "file=@/home/user/audio/long_podcast.wav" \
     -F "language=zh"

响应格式(JSON):

json
{
  "status": "success",
  "data": {
    "task_id": "29c7b932-a77f-480c-a18b-8a958c7911c3",
    "message": "Task created successfully. Poll /api/models/whisper/task/{task_id} for status."
  }
}

3. 任务状态轮询

端点: GET /api/models/whisper/task/{task_id}

使用示例:

bash
curl "http://127.0.0.1:8000/api/models/whisper/task/29c7b932-a77f-480c-a18b-8a958c7911c3"

4. 系统配置接口(Config)

用于动态切换模型和语言。

获取当前系统状态

  • 端点: GET /api/system/status
  • 响应: {"status": "success", "data": {"model_size": "base", "language": "en", "max_tokens": 12, "rknn_lite_available": true}}

更新系统配置(热切换)

  • 端点: POST /api/system/config
  • 请求参数(Form-Data): model_size=base、language=zh
  • 响应: {"status": "success", "message": "Successfully loaded base model."}

🛠️ 开发者指南(生产环境建议)

代码说明

  • web_service.py:
    • Web API:集成 FastAPI,支持音频上传、异步任务队列和模型热切换。
    • RKNN 推理:封装了编码器和解码器模型的 RKNN 初始化。实现自回归生成循环。
  • py_utils/whisper_utils.py:
    • 音频处理:计算与 OpenAI 实现对齐的 Log-Mel 频谱图。
    • 分词器:处理 BPE 分词和词汇表管理。

修改模型

  1. 将训练并转换后的 .rknn 编码器和解码器模型放入 model/ 目录。
  2. 服务会根据 size 参数(例如 whisper_encoder_base_20s.rknn)自动加载模型。请确保遵循文件命名规范。