部署中心

按业务约束选择运行时

每条路径都列出适用场景、验证版本、启动命令、生产责任和已知限制。

部署路径
11
语言
2
验证日期
2026-09-01
社区验证 2026-09-01

MOSS 统一转写与说话人分离

通过 FunASR AutoModel 或 OpenAI 兼容服务接入 OpenMOSS 发布的第三方 Apache-2.0 模型,一次生成长音频转写、时间戳和说话人标签。

硬件
cpu / nvidia-gpu / desktop-edge-gpu / kubernetes
模型
OpenMOSS-Team/MOSS-Transcribe-Diarize (third-party Apache-2.0 model)
限制

这是 OpenMOSS 的第三方模型,不是 FunASR 模型;“无需外部 VAD”不表示模型内部没有分块或分段。vLLM 路径固定 0.27.1,SGLang Omni 路径固定 3f819f9c;升级前必须重跑真实多人长音频。SGLang Omni 的 verbose_json 把说话人编号保留在 segments[].text 的 [Sxx] 前缀,FunASR adapter 会校验该分段能够回溯到 raw_text 后再解析。LocalAI / moss-transcribe.cpp 也是独立第三方重写。

查看部署合同
社区验证 2026-09-07

vLLM 原生 FunASR 服务

使用官方 FunAudioLLM/Fun-ASR-Nano-2512-vllm 固定快照,在 vLLM 0.27.1 上提供中英日转写与热词接口;已通过单张 H100 的独立功能验证。

硬件
nvidia-gpu / kubernetes
模型
FunAudioLLM/Fun-ASR-Nano-2512-vllm (official checkpoint)
限制

当前命令对应官方 a4362c943d48951f98ca2a62181cc028970270c5,2026-09-07 在既有 vLLM 0.27.1+cu129 / Torch 2.13.0+cu129 / Transformers 5.15.0 / CUDA 12.9 环境验证,不是全新安装验证。准备步骤只检查版本和下载本地快照,不重新安装依赖。8 个 HTTP 请求均为功能验证;首次中文未预热,两请求 0.911 s 不代表容量。下方 2026-08-13 benchmark 仍是社区 checkpoint 的历史数据,没有重命名或与新结果比较。#54944 仅更新 main 的文档/测试 registry;审计时 v0.28.0 仍引用社区产物,不代表官方引用已发布。

查看部署合同
生产验证 2026-08-04

SenseVoice TensorRT / Triton

把 SenseVoiceSmall 构建为原生 FP16 TensorRT engine,并通过 Triton 提供可批处理的 GPU 推理服务。

硬件
nvidia-gpu / kubernetes
模型
SenseVoiceSmall
限制

TensorRT plan 不保证跨 GPU 架构或 TensorRT 版本可移植,必须在目标环境重新构建并复测精度、显存和容量。

查看部署合同
生产验证 2026-08-30

llama.cpp / GGUF 独立运行

使用 v0.2.6 的十个预编译包或源码构建,在 CPU、Vulkan、CUDA、Blackwell 和边缘设备上运行 FunASR GGUF 模型。

硬件
cpu / desktop-edge-gpu
模型
SenseVoiceSmall-GGUF / Paraformer-GGUF
限制

v0.2.6 提供专用 sm_120 Blackwell 包,并捆绑官方 cuBLAS 与静态 MSVC 运行时;十平台构建、压缩包和依赖审计不等于真实 Blackwell 硬件验证。RX 9070 XT 的 v0.2.5 正向复测也不代表所有 AMD Windows 0xC0000005 报告均已解决;Android/Mali 不是本版预编译或验证目标。

查看部署合同
生产验证 2026-08-13

SenseVoice 原生 OpenAI 实时服务

用一个无 Python 运行时的 C++ 二进制提供 SenseVoice REST、SSE、SRT/VTT 与 OpenAI Realtime WebSocket 转写。

硬件
cpu / nvidia-gpu
模型
SenseVoiceSmall-GGUF / FSMN-VAD-GGUF
限制

当前官方验证覆盖 Linux 源码构建;服务不内置生产认证、TLS、多租户配额或持久队列,必须由网关和基础设施补齐。

查看部署合同
社区验证 2026-08-13

audio.cpp 原生 Fun-ASR-Nano 与 SenseVoice

用原生 C++ / GGML 在 CPU 或 GPU 上运行 Fun-ASR-Nano 与 SenseVoice Q8,并提供离线 CLI、兼容 OpenAI 的本地接口和 SenseVoice 缓冲流式结果。

硬件
cpu / nvidia-gpu / desktop-edge-gpu
模型
Fun-ASR-Nano-2512 / SenseVoice-Small
限制

SenseVoice 已合并到 audio.cpp main@979e070f,但尚未进入 tagged release;正式包发布前应固定该主线提交,且当前两条路径都不提供词级 timestamps。

查看部署合同
生产验证 2026-07-26

OpenAI 兼容私有 API

把 FunASR 模型作为 `/v1/audio/transcriptions` 私有服务接入现有 SDK、代理和工作流。

硬件
cpu / nvidia-gpu / kubernetes
模型
sensevoice / paraformer
限制

示例服务不内置生产认证、租户配额和全套可观测性,这些必须由网关和基础设施补齐。

查看部署合同
社区验证 2026-08-17

实时流式与字幕

通过 WebSocket 在线或 2-pass 协议处理麦克风、会议字幕和实时语音流。

硬件
cpu / nvidia-gpu / kubernetes
模型
Paraformer-online / FSMN-VAD
限制

真实容量由音频实时比、分块、VAD、连接数和客户端背压共同决定,文件 RTFx 不能替代并发测试。

查看部署合同
社区验证 2026-07-26

容器与 Kubernetes

用 Docker Compose 验证,再用带持久模型缓存、探针和 ClusterIP 的 Kubernetes 模板部署。

硬件
kubernetes / cpu / nvidia-gpu
模型
sensevoice / paraformer
限制

CPU 示例不是 CUDA 生产镜像;GPU 驱动、镜像、调度和容量仍需平台团队验证。

查看部署合同
社区验证 2026-07-26

ONNX / C++ CPU 运行时

在通用 CPU 上用 ONNX Runtime 和 C++ 路径部署离线、在线与 2-pass ASR。

硬件
cpu
模型
Paraformer / Paraformer-online
限制

模型转换、算子支持和线程参数受平台影响;必须使用目标 CPU 与真实音频测容量。

查看部署合同
生产验证 2026-07-26

生产上线检查

把模型能运行推进到可观测、可扩缩、可回滚且边界清晰的生产服务。

硬件
cpu / nvidia-gpu / desktop-edge-gpu / kubernetes
模型
All supported deployment models
限制

清单不能替代目标业务的负载、准确率、故障和安全演练。

查看部署合同