连接 GPU、CPU、边缘设备和 API 客户端的私有部署拓扑

开源语音基础设施

FunASR

可私有化部署的语音智能基础设施。覆盖 GPU 高吞吐、实时流式服务、OpenAI 兼容 API,以及 CPU 与边缘独立运行。

许可
Apache-2.0
接口
OpenAI compatible
验证日期
2026-07-26

部署选择器

从工作负载开始,不从框架名开始

选择业务形态、硬件和首要目标,得到一条有明确限制的推荐路径。

工作负载
硬件
优先目标

完整矩阵

无 JavaScript 也能完成选择

方案 工作负载 硬件 接口 状态
vLLM GPU 高吞吐 batch / private-api nvidia-gpu / kubernetes Python / HTTP REST 社区验证
llama.cpp / GGUF 独立运行 edge / batch cpu / desktop-edge-gpu CLI / local HTTP server 生产验证
OpenAI 兼容私有 API private-api / batch cpu / nvidia-gpu / kubernetes OpenAI-compatible HTTP / OpenAPI 生产验证
实时流式与字幕 realtime cpu / nvidia-gpu / kubernetes WebSocket / Python client 社区验证
容器与 Kubernetes private-api / batch / realtime kubernetes / cpu / nvidia-gpu Docker Compose / Kubernetes ClusterIP 社区验证
ONNX / C++ CPU 运行时 batch / realtime / edge cpu C++ / ONNX Runtime 社区验证
生产上线检查 private-api / batch / realtime / edge cpu / nvidia-gpu / desktop-edge-gpu / kubernetes HTTP / WebSocket 生产验证

可验证接口

先验证服务,再接入客户端

健康、模型身份和真实转写是三个独立检查。

localhost:8000
$ curl -fsS http://localhost:8000/health
{"status":"ok"}

$ curl -fsS http://localhost:8000/v1/models
{"data":[{"id":"sensevoice"}]}

$ curl http://localhost:8000/v1/audio/transcriptions \
  -F file=@meeting.wav -F model=sensevoice

生产边界

运行时负责推理,平台负责暴露方式

FunASR 原生

模型加载、转写接口、时间戳、VAD、流式协议和运行时日志。

网关与平台

TLS、认证、租户配额、限流、审计、上传策略、监控和滚动发布。

上线证据

目标硬件的容量测试、已知音频 smoke test、版本清单和可执行回滚。

下一步

选择一条路径,完成第一次可复现验证