部署中心

按业务约束选择运行时

每条路径都列出适用场景、验证版本、启动命令、生产责任和已知限制。

部署路径
7
语言
2
验证日期
2026-07-26
社区验证 2026-07-26

vLLM GPU 高吞吐

用 Fun-ASR-Nano 在 NVIDIA GPU 上处理批量文件或提供兼容 OpenAI 的转写接口。

硬件
nvidia-gpu / kubernetes
模型
Fun-ASR-Nano-2512
限制

吞吐和显存占用取决于音频切分、批量、并发、GPU 型号与 vLLM 版本,必须按目标流量复测。

查看部署合同
生产验证 2026-07-26

llama.cpp / GGUF 独立运行

使用跨平台预编译包或源码构建,在 CPU、桌面 GPU 和边缘设备上运行 FunASR GGUF 模型。

硬件
cpu / desktop-edge-gpu
模型
SenseVoiceSmall-GGUF / Paraformer-GGUF
限制

预编译 GPU 包只覆盖标注的后端和架构;其他设备需要从源码构建并实机验证。

查看部署合同
生产验证 2026-07-26

OpenAI 兼容私有 API

把 FunASR 模型作为 `/v1/audio/transcriptions` 私有服务接入现有 SDK、代理和工作流。

硬件
cpu / nvidia-gpu / kubernetes
模型
sensevoice / paraformer
限制

示例服务不内置生产认证、租户配额和全套可观测性,这些必须由网关和基础设施补齐。

查看部署合同
社区验证 2026-07-26

实时流式与字幕

通过 WebSocket 在线或 2-pass 协议处理麦克风、会议字幕和实时语音流。

硬件
cpu / nvidia-gpu / kubernetes
模型
Paraformer-online / FSMN-VAD
限制

真实容量由音频实时比、分块、VAD、连接数和客户端背压共同决定,文件 RTFx 不能替代并发测试。

查看部署合同
社区验证 2026-07-26

容器与 Kubernetes

用 Docker Compose 验证,再用带持久模型缓存、探针和 ClusterIP 的 Kubernetes 模板部署。

硬件
kubernetes / cpu / nvidia-gpu
模型
sensevoice / paraformer
限制

CPU 示例不是 CUDA 生产镜像;GPU 驱动、镜像、调度和容量仍需平台团队验证。

查看部署合同
社区验证 2026-07-26

ONNX / C++ CPU 运行时

在通用 CPU 上用 ONNX Runtime 和 C++ 路径部署离线、在线与 2-pass ASR。

硬件
cpu
模型
Paraformer / Paraformer-online
限制

模型转换、算子支持和线程参数受平台影响;必须使用目标 CPU 与真实音频测容量。

查看部署合同
生产验证 2026-07-26

生产上线检查

把模型能运行推进到可观测、可扩缩、可回滚且边界清晰的生产服务。

硬件
cpu / nvidia-gpu / desktop-edge-gpu / kubernetes
模型
All supported deployment models
限制

清单不能替代目标业务的负载、准确率、故障和安全演练。

查看部署合同