适用边界
先判断它是否适合你的生产约束
适合
- 需要可重复环境
- 已有容器平台
- 需要滚动发布和持久模型缓存
不适合
- 尚未验证本地模型和接口
- GPU 镜像与集群调度未准备
- 把示例 Compose 直接当作公网生产架构
| 模型 | sensevoice / paraformer / fun-asr-nano |
|---|---|
| 硬件 | kubernetes / cpu / nvidia-gpu |
| 操作系统 | Linux containers / Kubernetes |
| 接口 | Docker Compose / Kubernetes ClusterIP / OpenAI-compatible HTTP |
运行路径
从安装到已知音频验证
以下命令来自当前验证清单;上线前固定依赖、模型和硬件。
安装
cd examples/openai_api && cp .env.example .env
启动
docker compose up --build
健康检查
curl -fsS http://localhost:8000/health
Smoke test
发布前必须通过的最小验证
python examples/openai_api/smoke_test.py --base-url http://localhost:8000
运行与容量
把可运行推进到可运营
运行检查
- 模型缓存使用持久卷
- 就绪探针检查 `/health`
- 部署前完成镜像和模型预热
容量变量
- 音频时长、语言、声道和 VAD 分段分布
- 并发、队列等待、预热与模型缓存状态
- 精确硬件、驱动、运行时和线程配置
故障排查
- 先让 CPU Compose smoke test 通过
- 区分镜像拉取、模型下载和推理错误
- GPU Pod 核对设备插件、驱动和运行时
安全边界
生产入口默认不信任
- 默认使用私有 ClusterIP
- Secret 不写入镜像和仓库
- 入口网关承担 TLS、认证和限流
已知限制
CPU 示例不是 CUDA 生产镜像;GPU 驱动、镜像、调度和容量仍需平台团队验证。
公开基准仅用于复现起点,不替代目标业务负载测试。
证据与反馈