社区验证
2026-07-26
vLLM GPU 高吞吐
用 Fun-ASR-Nano 在 NVIDIA GPU 上处理批量文件或提供兼容 OpenAI 的转写接口。
- 硬件
- nvidia-gpu / kubernetes
- 模型
- Fun-ASR-Nano-2512
限制
查看部署合同 吞吐和显存占用取决于音频切分、批量、并发、GPU 型号与 vLLM 版本,必须按目标流量复测。
部署中心
每条路径都列出适用场景、验证版本、启动命令、生产责任和已知限制。
用 Fun-ASR-Nano 在 NVIDIA GPU 上处理批量文件或提供兼容 OpenAI 的转写接口。
吞吐和显存占用取决于音频切分、批量、并发、GPU 型号与 vLLM 版本,必须按目标流量复测。
使用跨平台预编译包或源码构建,在 CPU、桌面 GPU 和边缘设备上运行 FunASR GGUF 模型。
预编译 GPU 包只覆盖标注的后端和架构;其他设备需要从源码构建并实机验证。
把 FunASR 模型作为 `/v1/audio/transcriptions` 私有服务接入现有 SDK、代理和工作流。
示例服务不内置生产认证、租户配额和全套可观测性,这些必须由网关和基础设施补齐。
通过 WebSocket 在线或 2-pass 协议处理麦克风、会议字幕和实时语音流。
真实容量由音频实时比、分块、VAD、连接数和客户端背压共同决定,文件 RTFx 不能替代并发测试。
用 Docker Compose 验证,再用带持久模型缓存、探针和 ClusterIP 的 Kubernetes 模板部署。
CPU 示例不是 CUDA 生产镜像;GPU 驱动、镜像、调度和容量仍需平台团队验证。
在通用 CPU 上用 ONNX Runtime 和 C++ 路径部署离线、在线与 2-pass ASR。
模型转换、算子支持和线程参数受平台影响;必须使用目标 CPU 与真实音频测容量。
把模型能运行推进到可观测、可扩缩、可回滚且边界清晰的生产服务。
清单不能替代目标业务的负载、准确率、故障和安全演练。