部署合同

llama.cpp / GGUF 独立运行

使用跨平台预编译包或源码构建,在 CPU、桌面 GPU 和边缘设备上运行 FunASR GGUF 模型。

成熟度
生产验证
FunASR
runtime-llamacpp-v0.1.9
运行时
pinned llama.cpp backend
验证日期
2026-07-26

适用边界

先判断它是否适合你的生产约束

适合

  • 不依赖 Python ML 环境
  • 桌面应用和离线边缘部署
  • 需要 Linux、macOS、Windows 发布包

不适合

  • 需要 vLLM 式大批量 GPU 调度
  • 未验证目标 GPU 架构的通用预编译 CUDA 包
  • 必须使用完整 Python 模型生态的流程
模型SenseVoiceSmall-GGUF / Paraformer-GGUF / Fun-ASR-Nano-GGUF / FSMN-VAD-GGUF
硬件cpu / desktop-edge-gpu
操作系统Linux / macOS / Windows
接口CLI / local HTTP server

运行路径

从安装到已知音频验证

以下命令来自当前验证清单;上线前固定依赖、模型和硬件。

安装

cmake -B build -DCMAKE_BUILD_TYPE=Release
cmake --build build -j

启动

./build/bin/llama-funasr-sensevoice -m funasr-gguf/sensevoice-small-q8.gguf --vad funasr-gguf/fsmn-vad.gguf -a sample.wav

健康检查

./build/bin/llama-funasr-sensevoice --help

Smoke test

发布前必须通过的最小验证

./runtime/llama.cpp/tests/run_regression.sh

运行与容量

把可运行推进到可运营

运行检查

  • 按发布资产 SHA-256 校验下载
  • 模型和二进制使用同一发布清单
  • 保留旧二进制和模型目录用于回滚

容量变量

  • 音频时长、语言、声道和 VAD 分段分布
  • 并发、队列等待、预热与模型缓存状态
  • 精确硬件、驱动、运行时和线程配置

故障排查

  • CPU 路径先用 q8 模型验证
  • CUDA 和 Vulkan 必须匹配本机驱动
  • 用仓库回归脚本区分模型问题与构建问题

安全边界

生产入口默认不信任

已知限制

预编译 GPU 包只覆盖标注的后端和架构;其他设备需要从源码构建并实机验证。

公开基准仅用于复现起点,不替代目标业务负载测试。

证据与反馈

从原始资料核对部署合同