推荐路径
首要限制
查看部署步骤
部署选择器
选择业务形态、硬件和首要目标,得到一条有明确限制的推荐路径。
推荐路径
完整矩阵
| 方案 | 工作负载 | 硬件 | 接口 | 状态 |
|---|---|---|---|---|
| vLLM GPU 高吞吐 | batch / private-api | nvidia-gpu / kubernetes | Python / HTTP REST | 社区验证 |
| llama.cpp / GGUF 独立运行 | edge / batch | cpu / desktop-edge-gpu | CLI / local HTTP server | 生产验证 |
| OpenAI 兼容私有 API | private-api / batch | cpu / nvidia-gpu / kubernetes | OpenAI-compatible HTTP / OpenAPI | 生产验证 |
| 实时流式与字幕 | realtime | cpu / nvidia-gpu / kubernetes | WebSocket / Python client | 社区验证 |
| 容器与 Kubernetes | private-api / batch / realtime | kubernetes / cpu / nvidia-gpu | Docker Compose / Kubernetes ClusterIP | 社区验证 |
| ONNX / C++ CPU 运行时 | batch / realtime / edge | cpu | C++ / ONNX Runtime | 社区验证 |
| 生产上线检查 | private-api / batch / realtime / edge | cpu / nvidia-gpu / desktop-edge-gpu / kubernetes | HTTP / WebSocket | 生产验证 |
可验证接口
健康、模型身份和真实转写是三个独立检查。
$ curl -fsS http://localhost:8000/health
{"status":"ok"}
$ curl -fsS http://localhost:8000/v1/models
{"data":[{"id":"sensevoice"}]}
$ curl http://localhost:8000/v1/audio/transcriptions \
-F file=@meeting.wav -F model=sensevoice
生产边界
模型加载、转写接口、时间戳、VAD、流式协议和运行时日志。
TLS、认证、租户配额、限流、审计、上传策略、监控和滚动发布。
目标硬件的容量测试、已知音频 smoke test、版本清单和可执行回滚。
下一步