适用边界
先判断它是否适合你的生产约束
适合
- 批量录音转写
- 需要提高 LLM 解码吞吐
- 已有 NVIDIA GPU 服务环境
不适合
- 纯 CPU 或边缘设备
- Paraformer 等非自回归模型
- 尚未完成显存与并发压测的公网服务
| 模型 | Fun-ASR-Nano-2512 |
|---|---|
| 硬件 | nvidia-gpu / kubernetes |
| 操作系统 | Linux |
| 接口 | Python / HTTP REST / OpenAI-compatible HTTP / WebSocket |
运行路径
从安装到已知音频验证
以下命令来自当前验证清单;上线前固定依赖、模型和硬件。
安装
pip install funasr
pip install "vllm==0.19.1"
启动
CUDA_VISIBLE_DEVICES=0 python examples/industrial_data_pretraining/fun_asr_nano/serve_vllm.py --port 8899 --model FunAudioLLM/Fun-ASR-Nano-2512 --gpu-memory-utilization 0.5
健康检查
curl -fsS http://localhost:8899/health
Smoke test
发布前必须通过的最小验证
curl -X POST http://localhost:8899/v1/audio/transcriptions -F file=@audio.wav -F model=fun-asr-nano -F response_format=verbose_json
运行与容量
把可运行推进到可运营
运行检查
- 固定 FunASR、vLLM、Torch 与 CUDA 组合
- 预热模型后再采集容量数据
- 记录队列等待、首结果和最终结果延迟
容量变量
- 音频时长、语言、声道和 VAD 分段分布
- 并发、队列等待、预热与模型缓存状态
- 精确硬件、驱动、运行时和线程配置
故障排查
- 先核对 NVIDIA 驱动与 vLLM 所带 CUDA
- 重复输出时记录两次完整结果和精确版本
- 长音频遗漏时检查 VAD 最大分段时长
安全边界
生产入口默认不信任
- 在 API 网关实现认证、限流和请求大小限制
- 服务端不直接暴露到公网
- 隔离模型缓存和上传临时目录
已知限制
吞吐和显存占用取决于音频切分、批量、并发、GPU 型号与 vLLM 版本,必须按目标流量复测。
公开基准仅用于复现起点,不替代目标业务负载测试。
证据与反馈