部署合同

vLLM GPU 高吞吐

用 Fun-ASR-Nano 在 NVIDIA GPU 上处理批量文件或提供兼容 OpenAI 的转写接口。

成熟度
社区验证
FunASR
1.3.29
运行时
vLLM 0.19.1 guide
验证日期
2026-07-26

适用边界

先判断它是否适合你的生产约束

适合

  • 批量录音转写
  • 需要提高 LLM 解码吞吐
  • 已有 NVIDIA GPU 服务环境

不适合

  • 纯 CPU 或边缘设备
  • Paraformer 等非自回归模型
  • 尚未完成显存与并发压测的公网服务
模型Fun-ASR-Nano-2512
硬件nvidia-gpu / kubernetes
操作系统Linux
接口Python / HTTP REST / OpenAI-compatible HTTP / WebSocket

运行路径

从安装到已知音频验证

以下命令来自当前验证清单;上线前固定依赖、模型和硬件。

安装

pip install funasr
pip install "vllm==0.19.1"

启动

CUDA_VISIBLE_DEVICES=0 python examples/industrial_data_pretraining/fun_asr_nano/serve_vllm.py --port 8899 --model FunAudioLLM/Fun-ASR-Nano-2512 --gpu-memory-utilization 0.5

健康检查

curl -fsS http://localhost:8899/health

Smoke test

发布前必须通过的最小验证

curl -X POST http://localhost:8899/v1/audio/transcriptions -F file=@audio.wav -F model=fun-asr-nano -F response_format=verbose_json

运行与容量

把可运行推进到可运营

运行检查

  • 固定 FunASR、vLLM、Torch 与 CUDA 组合
  • 预热模型后再采集容量数据
  • 记录队列等待、首结果和最终结果延迟

容量变量

  • 音频时长、语言、声道和 VAD 分段分布
  • 并发、队列等待、预热与模型缓存状态
  • 精确硬件、驱动、运行时和线程配置

故障排查

  • 先核对 NVIDIA 驱动与 vLLM 所带 CUDA
  • 重复输出时记录两次完整结果和精确版本
  • 长音频遗漏时检查 VAD 最大分段时长

安全边界

生产入口默认不信任

已知限制

吞吐和显存占用取决于音频切分、批量、并发、GPU 型号与 vLLM 版本,必须按目标流量复测。

公开基准仅用于复现起点,不替代目标业务负载测试。

证据与反馈

从原始资料核对部署合同