FunASR v1.3.26:OpenAI 兼容 API、vLLM 与 llama.cpp 部署

FunASR 工业级语音识别视觉图

FunASR v1.3.26 把同一套开源语音识别能力整理成三个清晰入口:Python 与 OpenAI 兼容 API、面向 GPU 批量吞吐的 vLLM,以及无需 Python 的 llama.cpp / GGUF 运行时。

这不是只有一个 wheel 的发布。Python 包、服务示例、GPU 推理指南和八个平台运行时资产分别面向不同部署场景,并通过同一个 FunASR 生态互相衔接。

先选最适合你的入口

目标推荐入口开始位置
接入现有 OpenAI SDK、Agent 或工作流/v1/audio/transcriptionsOpenAI 兼容 API 示例
GPU 批量转写与高吞吐服务Fun-ASR-Nano + vLLMvLLM 中文指南
CPU、边缘设备或零 Python 部署llama.cpp / GGUFv0.1.9 运行时资产

1. 启动 OpenAI 兼容转写服务

下面的路径与仓库 smoke test 使用同一套服务实现。先固定当前 PyPI 版本,再启动服务:

git clone https://github.com/modelscope/FunASR.git
cd FunASR/examples/openai_api
python -m pip install "funasr==1.3.26" fastapi uvicorn python-multipart
python server.py --model sensevoice --device cuda --port 8000

另开一个终端,用公开样例验证健康检查和转写:

curl -L https://isv-data.oss-cn-hangzhou.aliyuncs.com/ics/MaaS/ASR/test_audio/BAC009S0764W0121.wav -o sample.wav
curl http://localhost:8000/health
curl http://localhost:8000/v1/audio/transcriptions \
  -F file=@sample.wav \
  -F model=sensevoice \
  -F response_format=verbose_json

已有 OpenAI Python 客户端时,只需把 base_url 指向 http://localhost:8000/v1。接口还提供模型列表、Swagger 文档、Postman、OpenAPI、Gradio 和 Kubernetes 示例。

2. 用 vLLM 放大 Fun-ASR-Nano 吞吐

Fun-ASR-Nano 的音频编码器与 adaptor 在 PyTorch 中生成连续音频 embedding,再交给 vLLM 的 Qwen3 解码部分。仓库基准记录 vLLM batch 达到 RTFx 340,并保留与 PyTorch 基线接近的 CER。

维护环境已在单张 H100 上完成真实 checkpoint 验证:vLLM 0.19.1 成功加载,样例音频完成转写并输出 token 时间戳。完整安装、显存、批处理、WebSocket 与服务参数都在 vLLM 指南中。
python -m pip install "vllm==0.19.1"
python -m pip install "funasr>=1.3.26" safetensors tiktoken websockets
# 按 docs/vllm_guide_zh.md 选择离线、流式或服务入口

3. 下载 llama.cpp / GGUF 自包含运行时

runtime-llamacpp-v0.1.9 同时提供 Linux x64/ARM64、macOS ARM64 和 Windows x64 包,其中 Linux 支持 AVX2/Vulkan,Windows 支持 AVX2/Vulkan/CUDA,并提供 funasr-llamacpp-windows-x64-vulkan.zip。每个压缩包都带自包含的 llama-funasr-* 二进制入口。

模型、命令与硬件选择见 llama.cpp / GGUF 专页,发布资产和模型版本保持对应,避免用户在多个 release 中寻找文件。

四个仓库分别解决什么

仓库适合关注的内容
FunASR工具包、服务、OpenAI API、vLLM、llama.cpp 与部署文档
Fun-ASRFun-ASR-Nano / MLT 模型、能力、评测和模型级集成
SenseVoice多语言 ASR、情感、语言和音频事件识别
FunClip由语音识别驱动的视频理解、检索与剪辑

从最适合你的入口跑通一个真实音频。遇到问题可在 GitHub 提交可复现 issue;如果项目对你有用,也欢迎 Star 你实际使用的仓库。

查看 v1.3.26 发布说明