项目详情

AutoClip

把长视频变成值得分享的精彩片段——字幕驱动的 AI 高光剪辑与二创工具

zhouxiaoka/autoclip MIT Python + TypeScript + Tauri 8.4k stars v1.3.1

分类:AI 视频 · 自动剪辑 · 二创工具 · ← 返回汇总

项目速览

一句话定位

让 LLM 读字幕找高光,FFmpeg 负责切——剪辑从「拉片」变「审片」

开源 AI 视频剪辑工具:导入视频(本地 / YouTube / B 站)后自动转写字幕,LLM 提取大纲、话题时间线、精彩度评分与片段标题,再用 FFmpeg 切出片段并组合合集,直接导出抖音 / 小红书 / Shorts / B 站预设。桌面应用、Docker Web、CLI / MCP 三种形态共用一条流水线,适合播客、访谈、课程、直播回放等「字幕密集型」长视频的二次创作。

分析对象是字幕文本,不是视频帧 剪辑全部在本地 FFmpeg 完成 模型自选:云端 API 或 Ollama 本地
项目速览

核心数据

8.4k
Stars(14 个月)
1.58k
Forks
v1.3.1
最新版(09-21 发布)
25
Open Issues
8
界面语言(v1.3.1)
7
内容体裁提示词
23
API v1 模块
3
使用形态(桌面/Web/CLI)

数据采集:GitHub API,2026-09-22。语言构成:Python 约 60%、TypeScript 24%,另有 Shell / CSS / Rust(Tauri 桌面壳)。2025-07-08 建仓,截至采集日仍在当日提交。

为什么存在

二创作者的三个痛点

拉片找高光太耗时

一期 2 小时播客 / 直播回放,人工逐段回放找「值得切的 60 秒」,往往比剪辑本身还费时;批量做切片矩阵时人力线性增长。

出片规格琐碎

抖音 / 小红书 / Shorts 要 9:16 竖屏 + 烧字幕 + 标题卡,B 站要横屏——同一素材出四个版本,每一步都是重复劳动。

现有工具各管一段

转写、找点、剪辑、字幕、导出分散在多个工具里,流程拼不起来;商用「AI 一键成片」服务按分钟计费且不可控。

AutoClip 把整条链路收进一条本地流水线:转写 → 语义评分 → 切片 → 合集 → 多平台导出,AI 只负责最费脑的「找点与起标题」,确定性工作交给 FFmpeg。

🔥 核心理念

不啃视觉,只啃语言

视频理解的捷径是把视频压缩成字幕文本:语言里几乎藏着全部叙事信息(话题、观点、笑点、转折),而文本 LLM 又便宜又快。AutoClip 刻意避开昂贵的多模态逐帧分析。

路线 A · 多模态视觉理解(AutoClip 未采用) 视频帧(每秒 / 抽帧) 海量数据 视觉理解 LLM 逐帧分析 贵 · 慢 · 长视频不可行 时间戳 成本随时长爆炸 路线 B · AutoClip:字幕文本驱动 视频 → 字幕文本 SRT 导入或 Whisper 文本 LLM:大纲 + 评分 + 标题 便宜 · 快 · 语义准 FFmpeg 确定性切片 本地 · 可复现 片段 + 合集 多平台导出 代价:纯视觉 / 音乐类视频没有可用字幕文本,该路线不适用(README 明示)。 收益:任何 7B 级本地模型即可跑通全流程,无 GPU 集群、无逐帧 API 费用。
被放弃的路线(贵/慢) AutoClip 主路线(语义层) 确定性工具层
核心机制

五步流水线

① 导入素材→ ② 字幕 / 转写→ ③ AI 分析评分→ ④ 切片与合集→ ⑤ 发布导出
  • ① 导入:本地文件、YouTube / B 站链接(yt-dlp 下载),可同时附带现成 SRT
  • ② 字幕:无字幕时用 faster-whisper 本地转写;已有 SRT 直接导入,更准更快
  • ③ 分析:LLM 从字幕提取大纲、话题时间线、精彩度评分(默认阈值 0.7)、片段标题
  • ④ 剪辑:按时间线自动切片、组合推荐合集,界面里可手动调整顺序
  • ⑤ 导出:抖音 / 小红书 / Shorts 9:16 竖屏与 B 站横屏预设,支持烧录字幕与标题卡
  • 失败语义:v1.3.0 起任何一步失败都带阶段标签(SUBTITLE / ANALYZE / EXPORT)与一句可执行的修复提示
🔥 系统架构

一套核心,三种形态

接入层 · ACCESS 桌面应用 Tauri 壳 · 内置 Python+FFmpeg Web 界面 React · Docker Compose 部署 CLI autoclip run / export / doctor MCP 客户端 Cursor / Claude 直接调用 服务层 · SERVICE FastAPI(api/v1 · 23 模块) projects / clips / collections / youtube / bilibili … 任务调度 Celery + Redis(Web)/ 线程池(桌面·CLI) 实时进度 WebSocket / progress 端点 核心层 · CORE(backend/) pipeline · 五步流水线 导入→字幕→分析→切片→导出 prompt · 7 类内容提示词 business / knowledge / speech … llm_manager 6 家提供商 eval 出片回归 基础设施 · FOUNDATION SQLite(WAL) 项目 / 任务 / 设置 FFmpeg 切片 / 字幕烧录 yt-dlp YouTube / B 站下载 faster-whisper 本地语音转写 LLM 提供商 云端 4 家 + 本地 2 家
业务代码(自研) 服务组件 外部依赖(确定性工具) 质量工程亮点
代码库画像

个人项目,工业纪律

  • Python 60% / TS 24%:后端 1.87MB + 前端 752KB;Rust 26KB 是 Tauri 桌面壳
  • backend/api/v1 · 23 个端点模块:projects / clips / collections / youtube / bilibili / speech_recognition / subtitle_editor / websocket / enhanced_retry …
  • 个人业余维护:约 3 位贡献者(含匿名),CHANGELOG 逐条对齐 issue 编号
  • 文档密度高:安装指南、Docker、CLI/MCP、多模型配置、FAQ、隐私说明、i18n 维护手册各一份
发版节奏
版本日期主题
v1.3.109-21八语界面 + 崩溃诊断 + 桌面更新
v1.3.009-20CLI / MCP / 本地模型 / 失败语义
v1.2.109-06止血版:Docker 路径真正能跑通
v1.2.006-03Windows 安装包 + 环境变量配置
v1.1.006-03多提供商设置页

观察:14 个月内 5 个正式版本 + 高频未发布修复,2026-09 单月连发三版——单人项目里罕见的发布纪律(配套 bump_version / release_notes 自动化脚本)。

核心机制

按内容体裁分七套提示词

同一个「找高光」任务,访谈和知识课的精彩标准完全不同。AutoClip 在 backend/prompt/ 下按体裁分目录维护提示词,大纲抽取与评分侧重随体裁切换。

business

商业访谈:观点交锋、数据结论

content_review

内容测评:对比结论、槽点

entertainment

娱乐节目:笑点、名场面

experience

体验分享:真实感受、转折

knowledge

知识课程:核心概念、干货密度

opinion

观点输出:立场、论证链

speech

演讲口播:金句、情绪高点

v1.3.0 工程化

按时长分档(短/中/长),替换提示词里写死的 90 秒规则

质量工程

「失败要像失败」+ 评分纪律

出片质量四条军规(v1.3.0)
  • 时长分档:短 / 中 / 长视频用不同片段长度规则,不再一刀切 90 秒
  • 时间线对齐字幕边界并去重,切片不切在半句话上
  • 评分数量不匹配不整块丢:低于阈值时保底 top-K,长视频偶发超时不毁整条
  • eval 回归:python -m backend.eval 用合成用例锁住出片质量
失败必须带说明书
  • 带阶段报错:SUBTITLE / ANALYZE / EXPORT 三阶段定位,附「去哪个设置项、装什么」的可执行提示
  • 消灭假成功:不再出现 Completed · 0 切片 或永远 processing
  • LLM 单块失败继续:只有全部失败才报错
  • 修过的硬骨头:SQLite StaticPool 多线程互相回滚(改默认池 + WAL)、浏览器整页翻译导致 React removeChild 崩溃、系统代理劫持 localhost 模型请求
核心机制

模型自选:云端四家 + 本地两家

提供商接入方式要点
通义千问API Key设置页有「中国站 / 国际站」开关,国际站走 OpenAI 兼容模式按实例隔离
OpenAI 兼容Key + 自定义 Base URL一条通道接 DeepSeek / 智谱 / OpenRouter / vLLM,自建服务可不填 Key
GeminiAPI KeyGoogle 官方接口
硅基流动API Key国内推理平台预设
Ollama本地 localhost:11434预设模型 qwen2.5:7b,自动列出服务端模型,无需 Key
LM Studio本地 localhost:1234Local Server 模式,设置页直选服务实际提供的模型

隐私边界:剪辑全程本地;用云端模型时字幕文本会发送给所选服务商;主动发布上传时视频才发送到目标平台。

使用形态

同一流水线,三种入口

桌面应用

macOS Apple Silicon(.dmg)· Windows x64(setup.exe)

  • Tauri 壳内自带便携 Python + FFmpeg,零环境配置
  • v1.3.1 起支持启动每日检查更新与手动检查
Docker / Web

docker compose up -d --build

  • FastAPI(8000) + React(3000) + Celery worker + Redis
  • 设置页可直接保存 LLM 配置,api 与 worker 按 mtime 热重载
CLI / MCP

pip install -e . · Python 3.10+

  • 不需要 Redis,本地线程跑完整流水线
  • --json 输出给脚本和 Agent 消费

三种形态共用数据目录与同一个 SQLite——桌面上看了一半的项目,CLI 里 autoclip list 直接接着导出。

自动化接入

把流水线开放给 Agent

# 一条命令出片(本地模型,零 API 费用)
ollama pull qwen2.5:7b
autoclip doctor --provider ollama
autoclip run talk.mp4 --provider ollama --json

# 按平台预设导出 + 启动 MCP 服务
autoclip export PROJECT_ID --preset shorts
autoclip mcp

MCP 配置:command = venv 内 autoclip 绝对路径,args = ["mcp"]。官方还附带 Agent skill(skills/autoclip/SKILL.md)。

MCP server 工具面(stdio)
  • clip_video:一步完成剪辑
  • start_clip_job / get_job_status:异步任务提交与轮询
  • get_project / list_projects:项目与结果查询
  • list_providers / check_environment:模型与环境自检
  • export_clip:按预设导出成片

场景:Cursor / Claude 里说「把这条播客切成 5 条 Shorts」,Agent 直接调用同一条流水线,无人值守批量出片。

快速上手

五分钟跑通第一条链路

# Docker 路线(服务器)
git clone https://github.com/zhouxiaoka/autoclip.git
cd autoclip
cp env.example .env        # 编辑 LLM_PROVIDER / API Key
mkdir -p data logs uploads
docker compose up -d --build
# → http://localhost:3000 界面 / :8000/docs API
  • 桌面版:Release 下载安装包 → 设置页选模型 → 测试连接 → 导入视频
  • 无字幕视频:pip install faster-whisper,首次转写自动下载语音模型
  • 已有 SRT:导入时附带,省转写时间且更准
  • 没出片段?:把评分阈值从 0.7 降到 0.5(FAQ 第一招)
  • 自检:autoclip doctor 一条命令体检模型 / FFmpeg / 环境
在线体验

亲手调一次高光评分阈值

左侧是一条模拟播客的逐句评分时间轴,右侧实时跑 AutoClip 的核心切片规则:阈值过滤 → 间距合并 → 最短时长 → top-K 保底。拖动滑块看切片数量与合集时长如何变化——README FAQ 里「阈值从 0.7 降到 0.5」到底意味着什么,玩一遍就懂。

▶ 打开高光切片模拟器

切片决策逻辑 1:1 复刻 v1.3.0 出片规则(阈值 / 合并 / top-K 保底),Python 全真值表 + node 对拍双验证。

适用场景

适合谁,不适合谁

适合(README 明示)
  • 播客 / 访谈创作者:一小时节目切成金句矩阵,语义评分恰好是强项
  • 知识课程 UP 主:按大纲与话题时间线切片,标题自动生成
  • 直播回放运营:批量 CLI 流水线 + MCP 无人值守出片
  • 隐私敏感场景:Ollama 本地模型 + 本地 FFmpeg,数据不出机器
  • 想学 LLM 工程化的人:eval 回归 + 失败语义是少见的教学样本
不适合(边界明确)
  • 纯视觉内容:Vlog、旅拍、开箱——没有密集字幕可分析,效果有限
  • 音乐 / MV:高光在旋律与画面,不在文本
  • 追求帧级精确卡点:切片对齐的是字幕句边界,不是音乐节拍
  • 商用 SLO 要求:个人业余维护,issue 响应不保证时效
潜力评估

未来空间

风险
  • 巴士因子 = 1:个人业余维护,明确声明「回复时间不固定,无一对一部署服务」
  • 字幕天花板:路线选型决定了视觉类内容永远不在射程内
  • 评分主观性:高光标准由 LLM 判断,不同模型 / 提示词结果差异大
  • 二创版权边界:切他人视频分发需自行确认授权
加分项
  • 赛道刚需:长视频 → 垂直切片是内容工业的固定工序,8.4k stars 验证需求
  • 架构克制:字幕路线让 7B 本地模型可用,成本结构碾压多模态方案
  • MCP 先手:视频剪辑工具里最早一批开放 Agent 调用
  • 工程可信:eval 回归、失败语义、诚实的 CHANGELOG,长期演化有轨道

评分 8.5:定位聪明(用最便宜的智能解决最贵的工序)、执行纪律好(单人项目做出工业级可靠性)、形态完整(桌面/Web/CLI/MCP 四入口)。扣分在单人维护的持续性风险与字幕路线的天花板。看点:体裁提示词库能否社区化、MCP 生态爆发后能否成为 Agent 剪辑的标准后端。


上一个
json-render
下一个
Project NOMAD
1 / 17