部署合同

llama.cpp / GGUF 独立运行

使用 v0.2.6 的十个预编译包或源码构建,在 CPU、Vulkan、CUDA、Blackwell 和边缘设备上运行 FunASR GGUF 模型。

成熟度
生产验证
FunASR
runtime-llamacpp-v0.2.6
运行时
llama.cpp@c8d43b10
验证日期
2026-08-30

适用边界

先判断它是否适合你的生产约束

适合

  • 不依赖 Python ML 环境
  • 桌面应用和离线边缘部署
  • 需要 Linux、macOS、Windows 的 CPU、Vulkan、CUDA 或 Blackwell 发布包

不适合

  • 需要 vLLM 式大批量 GPU 调度
  • 没有目标硬件复测的 Blackwell 生产部署
  • 必须使用完整 Python 模型生态的流程
模型SenseVoiceSmall-GGUF / Paraformer-GGUF / Fun-ASR-Nano-GGUF / FSMN-VAD-GGUF
硬件cpu / desktop-edge-gpu
操作系统Linux / macOS / Windows
接口CLI / local HTTP server

发布资产

按操作系统和后端下载已校验的预编译包

SHA-256 来自公开 GitHub Release;下载后先核对摘要,再在目标硬件完成 smoke test。

系统 架构 后端 下载 SHA-256
Linux arm64 CPU funasr-llamacpp-linux-arm64.tar.gz 7bca29cfa3c9a08e235a62212ca9e00f6656e59a8f07078966a2bfda1e5aa1f9
Linux x64 CPU funasr-llamacpp-linux-x64.tar.gz 779967de1c528c2be966bcc47f246e7d3e6fcdb748d9491263062f4120f35e52
Linux x64 AVX2 CPU funasr-llamacpp-linux-x64-avx2.tar.gz aaebc5470f846ce915200b35d6e9f9bd0a0d3ed399d39e49bdeb7a1f1782bc70
Linux x64 Vulkan funasr-llamacpp-linux-x64-vulkan.tar.gz f02d41e98e9d4041f0896661007193810f025484d2175958f7c1313d5c90ec46
macOS arm64 CPU funasr-llamacpp-macos-arm64.tar.gz bda59474202b887190f59d25b7b42c714469efae71276072c12fa0a38de68792
Windows x64 CPU funasr-llamacpp-windows-x64.zip f6a73a548413ba9fbaf2145263ea66ec53cbdad1fb11790dbeeee493e339492e
Windows x64 AVX2 CPU funasr-llamacpp-windows-x64-avx2.zip 062cda8fefadd31c3e811227116daccf448a8520f4b0bb168d225c896e65ebbd
Windows x64 Vulkan funasr-llamacpp-windows-x64-vulkan.zip debf8007e55011cad06081e7b8a78972f1b8fe672bc324d41e650d68821f6a6a
Windows x64 CUDA funasr-llamacpp-windows-x64-cuda.zip 148657911fb666b7af6ec43af2e23a0984e3259012b4c39f95631b717feb6840
Windows x64 Blackwell (sm_120) CUDA funasr-llamacpp-windows-x64-cuda-blackwell.zip e32961a753f40888182f352fa551159c5165a6a77718ae4ade316aedfea4b1c2

运行路径

从安装到已知音频验证

以下命令来自当前验证清单;上线前固定依赖、模型和硬件。

安装

curl -fLO https://github.com/modelscope/FunASR/releases/download/runtime-llamacpp-v0.2.6/funasr-llamacpp-linux-x64.tar.gz
echo "779967de1c528c2be966bcc47f246e7d3e6fcdb748d9491263062f4120f35e52  funasr-llamacpp-linux-x64.tar.gz" | sha256sum -c -
mkdir funasr-llamacpp && tar -xzf funasr-llamacpp-linux-x64.tar.gz -C funasr-llamacpp && cd funasr-llamacpp && bash download-funasr-model.sh sensevoice ./funasr-gguf f16

启动

cd funasr-llamacpp && ./llama-funasr-sensevoice -m funasr-gguf/sensevoice-small-f16.gguf --vad funasr-gguf/fsmn-vad.gguf -a sample.wav

健康检查

cd funasr-llamacpp && ./llama-funasr-sensevoice --help

Smoke test

发布前必须通过的最小验证

cd funasr-llamacpp && ./llama-funasr-sensevoice -m funasr-gguf/sensevoice-small-f16.gguf --vad funasr-gguf/fsmn-vad.gguf -a sample.wav | tee transcript.txt && test -s transcript.txt

运行与容量

把可运行推进到可运营

运行检查

  • 按页面列出的 SHA-256 校验十个发布资产
  • 模型和二进制使用同一发布清单
  • 保留旧二进制和模型目录用于回滚

容量变量

  • 音频时长、语言、声道和 VAD 分段分布
  • 并发、队列等待、预热与模型缓存状态
  • 精确硬件、驱动、运行时和线程配置

故障排查

  • CPU 路径先用 q8 模型验证
  • CUDA 和 Vulkan 必须匹配本机驱动
  • 按顺序记录 initializing、resolving buffer type、backend ready、model ready、graph allocated 和 compute starting 的 stderr 边界
  • Windows AMD Vulkan 异常时附上完整压缩包名、GPU、驱动、命令、退出码和最后到达的诊断边界

安全边界

生产入口默认不信任

已知限制

v0.2.6 提供专用 sm_120 Blackwell 包,并捆绑官方 cuBLAS 与静态 MSVC 运行时;十平台构建、压缩包和依赖审计不等于真实 Blackwell 硬件验证。RX 9070 XT 的 v0.2.5 正向复测也不代表所有 AMD Windows 0xC0000005 报告均已解决;Android/Mali 不是本版预编译或验证目标。

公开基准仅用于复现起点,不替代目标业务负载测试。

证据与反馈

从原始资料核对部署合同