适用边界
先判断它是否适合你的生产约束
适合
- CPU 高并发服务
- 嵌入式或本地应用
- 现有 Paraformer 在线链路已经满足质量
不适合
- 需要 LLM 解码和开放式指令
- 未经测试就迁移成熟 CPU 流量到 GPU
- 依赖特定 Python 业务插件
| 模型 | Paraformer / Paraformer-online / SenseVoiceSmall / FSMN-VAD / CT-Transformer punctuation |
|---|---|
| 硬件 | cpu |
| 操作系统 | Linux / macOS / Windows |
| 接口 | C++ / ONNX Runtime / Python ONNX / HTTP / WebSocket |
运行路径
从安装到已知音频验证
以下命令来自当前验证清单;上线前固定依赖、模型和硬件。
安装
cd runtime/onnxruntime && cmake -B build -DCMAKE_BUILD_TYPE=Release
cmake --build build -j
启动
python runtime/python/onnxruntime/demo_sencevoice_small.py
健康检查
test -x runtime/onnxruntime/build/bin/funasr-onnx-offline
Smoke test
发布前必须通过的最小验证
python runtime/python/onnxruntime/demo_paraformer_offline.py
运行与容量
把可运行推进到可运营
运行检查
- 固定 ONNX Runtime 与模型版本
- 分别设置模型、解码和 I/O 线程
- 监控实时比、CPU 饱和度与队列
容量变量
- 音频时长、语言、声道和 VAD 分段分布
- 并发、队列等待、预热与模型缓存状态
- 精确硬件、驱动、运行时和线程配置
故障排查
- 先运行单文件离线示例
- 线程增加不等于吞吐线性增加
- 热词不足先评估确定性文本后处理
安全边界
生产入口默认不信任
- 限制本地文件和网络输入边界
- 服务模式限制请求大小和并发
- 模型目录只读并校验来源
已知限制
模型转换、算子支持和线程参数受平台影响;必须使用目标 CPU 与真实音频测容量。
公开基准仅用于复现起点,不替代目标业务负载测试。
证据与反馈