适用边界
先判断它是否适合你的生产约束
适合
- 替换云端转写 API
- 复用 OpenAI SDK 或 HTTP 客户端
- 需要健康检查和模型枚举
不适合
- 需要浏览器直接匿名访问生产服务
- 没有网关但准备暴露公网
- 严格实时逐块字幕
| 模型 | sensevoice / paraformer / paraformer-en / fun-asr-nano |
|---|---|
| 硬件 | cpu / nvidia-gpu / kubernetes |
| 操作系统 | Linux / macOS / Windows |
| 接口 | OpenAI-compatible HTTP / OpenAPI / Python SDK / JavaScript |
运行路径
从安装到已知音频验证
以下命令来自当前验证清单;上线前固定依赖、模型和硬件。
安装
pip install funasr fastapi uvicorn python-multipart
启动
cd examples/openai_api && python server.py --model sensevoice --device cpu --port 8000
健康检查
curl -fsS http://localhost:8000/health
curl -fsS http://localhost:8000/v1/models
Smoke test
发布前必须通过的最小验证
cd examples/openai_api && python smoke_test.py --base-url http://localhost:8000
运行与容量
把可运行推进到可运营
运行检查
- 用 `/health` 做就绪探针
- 用 `/v1/models` 验证加载模型
- 模型缓存使用持久卷并在发布前预热
容量变量
- 音频时长、语言、声道和 VAD 分段分布
- 并发、队列等待、预热与模型缓存状态
- 精确硬件、驱动、运行时和线程配置
故障排查
- 先运行仓库 smoke_test.py
- 核对客户端 base_url 必须包含 `/v1`
- 将模型加载错误与请求格式错误分开排查
安全边界
生产入口默认不信任
- 认证、配额、审计和 TLS 在网关实现
- 限制 MIME、文件大小和请求时长
- 服务仅接受可信反向代理流量
已知限制
示例服务不内置生产认证、租户配额和全套可观测性,这些必须由网关和基础设施补齐。
公开基准仅用于复现起点,不替代目标业务负载测试。
证据与反馈