适用边界
先判断它是否适合你的生产约束
适合
- 不依赖 Python ML 环境
- 桌面应用和离线边缘部署
- 需要 Linux、macOS、Windows 发布包
不适合
- 需要 vLLM 式大批量 GPU 调度
- 未验证目标 GPU 架构的通用预编译 CUDA 包
- 必须使用完整 Python 模型生态的流程
| 模型 | SenseVoiceSmall-GGUF / Paraformer-GGUF / Fun-ASR-Nano-GGUF / FSMN-VAD-GGUF |
|---|---|
| 硬件 | cpu / desktop-edge-gpu |
| 操作系统 | Linux / macOS / Windows |
| 接口 | CLI / local HTTP server |
运行路径
从安装到已知音频验证
以下命令来自当前验证清单;上线前固定依赖、模型和硬件。
安装
cmake -B build -DCMAKE_BUILD_TYPE=Release
cmake --build build -j
启动
./build/bin/llama-funasr-sensevoice -m funasr-gguf/sensevoice-small-q8.gguf --vad funasr-gguf/fsmn-vad.gguf -a sample.wav
健康检查
./build/bin/llama-funasr-sensevoice --help
Smoke test
发布前必须通过的最小验证
./runtime/llama.cpp/tests/run_regression.sh
运行与容量
把可运行推进到可运营
运行检查
- 按发布资产 SHA-256 校验下载
- 模型和二进制使用同一发布清单
- 保留旧二进制和模型目录用于回滚
容量变量
- 音频时长、语言、声道和 VAD 分段分布
- 并发、队列等待、预热与模型缓存状态
- 精确硬件、驱动、运行时和线程配置
故障排查
- CPU 路径先用 q8 模型验证
- CUDA 和 Vulkan 必须匹配本机驱动
- 用仓库回归脚本区分模型问题与构建问题
安全边界
生产入口默认不信任
- 默认只读取本地音频和模型
- HTTP 服务绑定内网地址并限制上传大小
- 不要从不可信地址加载 GGUF
已知限制
预编译 GPU 包只覆盖标注的后端和架构;其他设备需要从源码构建并实机验证。
公开基准仅用于复现起点,不替代目标业务负载测试。
证据与反馈