FunClip v2.2.0:用 MOSS 做长音频说话人识别与视频剪辑

2026-08-31 · FunClip Release

FunClip 本地视频、字幕识别和智能剪辑界面

FunClip v2.2.0 新增一条可选的 MOSS 路径:把长音频交给 vLLM 服务,FunASR 将模型输出归一化为文本、说话人身份和时间段,FunClip 再生成 SRT 或按 spkS01spkS02 剪辑。

MOSS-Transcribe-Diarize 是 OpenMOSS 维护的第三方模型,不属于 FunASR 或 FunClip。集成固定使用 OpenMOSS-Team/MOSS-Transcribe-Diarize revision e8681d68e7042738ffca8ac8212bc8fcb1131ab8,并明确保留模型归属与支持边界。

数据路径

阶段职责
vLLM加载固定 MOSS revision,通过 /v1/audio/transcriptions 返回带时间与说话人标记的 JSON。
FunASR 1.4.9+解析转写结果并生成统一的 texttimestampsentence_info
FunClip 2.2.0渲染说话人 SRT、按说话人选段,或把时间段交给现有音视频剪辑流程。

1. 启动固定 revision 的 vLLM 服务

python -m venv .venv-moss
. .venv-moss/bin/activate
pip install -U vllm

vllm serve OpenMOSS-Team/MOSS-Transcribe-Diarize \
  --revision e8681d68e7042738ffca8ac8212bc8fcb1131ab8 \
  --served-model-name moss-transcribe-diarize \
  --trust-remote-code --host 127.0.0.1 --port 8898

先用真实音频检查服务契约。当前经过验证的格式是 response_format=json

curl -fsS http://127.0.0.1:8898/v1/audio/transcriptions \
  -F file=@sample.wav \
  -F model=moss-transcribe-diarize \
  -F response_format=json \
  -F max_completion_tokens=8192

2. 启动 FunClip

python -m pip install -U -r requirements.txt
python funclip/launch.py \
  --model moss \
  --moss-backend vllm \
  --moss-base-url http://127.0.0.1:8898/v1 \
  --moss-max-tokens 8192

远端服务需要 bearer token 时,把凭据放进 MOSS_API_KEY 环境变量;FunClip 不要求把 token 写进命令行或仓库。

能力与边界

完整生产部署、健康检查和容量边界见 MOSS 双语部署指南

下载与校验 v2.2.0

FunClip-2.2.0.tar.gz
SHA256 994c5d9cf392b74b36284d526eca8bada1560a3e7825ab7baa9c673a1b4ef216

FunClip-2.2.0.zip
SHA256 4f5a7d33d9ea65467f29b55b15ed5be18e64de7e57e2f9f36fe51a23b40557e7

FunClip v2.2.0 Release 下载归档和 SHA256SUMS,不要从不明镜像复制二进制或凭据。

发布内容对应 commit c205bf32a8b11226ff5e8acb9a3c7a1f00cd3b06。仓库测试结果为 84 passed、1 skipped;H100 + vLLM 两说话人样例返回 S01/S02、有效 SRT,并成功按 S02 剪辑。这个验证证明发布链路可用,不代表所有语言、音频条件或并发规模。

先按部署指南跑通一段真实双人音频,再进入 FunClip 处理自己的视频。

查看 FunClip v2.2.0 发布与下载