项目详情
AutoClip
把长视频变成值得分享的精彩片段——字幕驱动的 AI 高光剪辑与二创工具
分类:AI 视频 · 自动剪辑 · 二创工具 · ← 返回汇总
项目速览
一句话定位
让 LLM 读字幕找高光,FFmpeg 负责切——剪辑从「拉片」变「审片」
开源 AI 视频剪辑工具:导入视频(本地 / YouTube / B 站)后自动转写字幕,LLM 提取大纲、话题时间线、精彩度评分与片段标题,再用 FFmpeg 切出片段并组合合集,直接导出抖音 / 小红书 / Shorts / B 站预设。桌面应用、Docker Web、CLI / MCP 三种形态共用一条流水线,适合播客、访谈、课程、直播回放等「字幕密集型」长视频的二次创作。
分析对象是字幕文本,不是视频帧
剪辑全部在本地 FFmpeg 完成
模型自选:云端 API 或 Ollama 本地
项目速览
核心数据
数据采集:GitHub API,2026-09-22。语言构成:Python 约 60%、TypeScript 24%,另有 Shell / CSS / Rust(Tauri 桌面壳)。2025-07-08 建仓,截至采集日仍在当日提交。
为什么存在
二创作者的三个痛点
拉片找高光太耗时
一期 2 小时播客 / 直播回放,人工逐段回放找「值得切的 60 秒」,往往比剪辑本身还费时;批量做切片矩阵时人力线性增长。
出片规格琐碎
抖音 / 小红书 / Shorts 要 9:16 竖屏 + 烧字幕 + 标题卡,B 站要横屏——同一素材出四个版本,每一步都是重复劳动。
现有工具各管一段
转写、找点、剪辑、字幕、导出分散在多个工具里,流程拼不起来;商用「AI 一键成片」服务按分钟计费且不可控。
AutoClip 把整条链路收进一条本地流水线:转写 → 语义评分 → 切片 → 合集 → 多平台导出,AI 只负责最费脑的「找点与起标题」,确定性工作交给 FFmpeg。
🔥 核心理念
不啃视觉,只啃语言
视频理解的捷径是把视频压缩成字幕文本:语言里几乎藏着全部叙事信息(话题、观点、笑点、转折),而文本 LLM 又便宜又快。AutoClip 刻意避开昂贵的多模态逐帧分析。
被放弃的路线(贵/慢)
AutoClip 主路线(语义层)
确定性工具层
核心机制
五步流水线
① 导入素材→
② 字幕 / 转写→
③ AI 分析评分→
④ 切片与合集→
⑤ 发布导出
- ① 导入:本地文件、YouTube / B 站链接(yt-dlp 下载),可同时附带现成 SRT
- ② 字幕:无字幕时用 faster-whisper 本地转写;已有 SRT 直接导入,更准更快
- ③ 分析:LLM 从字幕提取大纲、话题时间线、精彩度评分(默认阈值 0.7)、片段标题
- ④ 剪辑:按时间线自动切片、组合推荐合集,界面里可手动调整顺序
- ⑤ 导出:抖音 / 小红书 / Shorts 9:16 竖屏与 B 站横屏预设,支持烧录字幕与标题卡
- 失败语义:v1.3.0 起任何一步失败都带阶段标签(SUBTITLE / ANALYZE / EXPORT)与一句可执行的修复提示
🔥 系统架构
一套核心,三种形态
业务代码(自研)
服务组件
外部依赖(确定性工具)
质量工程亮点
代码库画像
个人项目,工业纪律
- Python 60% / TS 24%:后端 1.87MB + 前端 752KB;Rust 26KB 是 Tauri 桌面壳
- backend/api/v1 · 23 个端点模块:projects / clips / collections / youtube / bilibili / speech_recognition / subtitle_editor / websocket / enhanced_retry …
- 个人业余维护:约 3 位贡献者(含匿名),CHANGELOG 逐条对齐 issue 编号
- 文档密度高:安装指南、Docker、CLI/MCP、多模型配置、FAQ、隐私说明、i18n 维护手册各一份
发版节奏
| 版本 | 日期 | 主题 |
v1.3.1 | 09-21 | 八语界面 + 崩溃诊断 + 桌面更新 |
v1.3.0 | 09-20 | CLI / MCP / 本地模型 / 失败语义 |
v1.2.1 | 09-06 | 止血版:Docker 路径真正能跑通 |
v1.2.0 | 06-03 | Windows 安装包 + 环境变量配置 |
v1.1.0 | 06-03 | 多提供商设置页 |
观察:14 个月内 5 个正式版本 + 高频未发布修复,2026-09 单月连发三版——单人项目里罕见的发布纪律(配套 bump_version / release_notes 自动化脚本)。
核心机制
按内容体裁分七套提示词
同一个「找高光」任务,访谈和知识课的精彩标准完全不同。AutoClip 在 backend/prompt/ 下按体裁分目录维护提示词,大纲抽取与评分侧重随体裁切换。
content_review
内容测评:对比结论、槽点
v1.3.0 工程化
按时长分档(短/中/长),替换提示词里写死的 90 秒规则
质量工程
「失败要像失败」+ 评分纪律
出片质量四条军规(v1.3.0)
- 时长分档:短 / 中 / 长视频用不同片段长度规则,不再一刀切 90 秒
- 时间线对齐字幕边界并去重,切片不切在半句话上
- 评分数量不匹配不整块丢:低于阈值时保底 top-K,长视频偶发超时不毁整条
- eval 回归:python -m backend.eval 用合成用例锁住出片质量
失败必须带说明书
- 带阶段报错:SUBTITLE / ANALYZE / EXPORT 三阶段定位,附「去哪个设置项、装什么」的可执行提示
- 消灭假成功:不再出现 Completed · 0 切片 或永远 processing
- LLM 单块失败继续:只有全部失败才报错
- 修过的硬骨头:SQLite StaticPool 多线程互相回滚(改默认池 + WAL)、浏览器整页翻译导致 React removeChild 崩溃、系统代理劫持 localhost 模型请求
核心机制
模型自选:云端四家 + 本地两家
| 提供商 | 接入方式 | 要点 |
通义千问 | API Key | 设置页有「中国站 / 国际站」开关,国际站走 OpenAI 兼容模式按实例隔离 |
OpenAI 兼容 | Key + 自定义 Base URL | 一条通道接 DeepSeek / 智谱 / OpenRouter / vLLM,自建服务可不填 Key |
Gemini | API Key | Google 官方接口 |
硅基流动 | API Key | 国内推理平台预设 |
Ollama | 本地 localhost:11434 | 预设模型 qwen2.5:7b,自动列出服务端模型,无需 Key |
LM Studio | 本地 localhost:1234 | Local Server 模式,设置页直选服务实际提供的模型 |
隐私边界:剪辑全程本地;用云端模型时字幕文本会发送给所选服务商;主动发布上传时视频才发送到目标平台。
使用形态
同一流水线,三种入口
桌面应用
macOS Apple Silicon(.dmg)· Windows x64(setup.exe)
- Tauri 壳内自带便携 Python + FFmpeg,零环境配置
- v1.3.1 起支持启动每日检查更新与手动检查
Docker / Web
docker compose up -d --build
- FastAPI(8000) + React(3000) + Celery worker + Redis
- 设置页可直接保存 LLM 配置,api 与 worker 按 mtime 热重载
CLI / MCP
pip install -e . · Python 3.10+
- 不需要 Redis,本地线程跑完整流水线
- --json 输出给脚本和 Agent 消费
三种形态共用数据目录与同一个 SQLite——桌面上看了一半的项目,CLI 里 autoclip list 直接接着导出。
自动化接入
把流水线开放给 Agent
# 一条命令出片(本地模型,零 API 费用)
ollama pull qwen2.5:7b
autoclip doctor --provider ollama
autoclip run talk.mp4 --provider ollama --json
# 按平台预设导出 + 启动 MCP 服务
autoclip export PROJECT_ID --preset shorts
autoclip mcp
MCP 配置:command = venv 内 autoclip 绝对路径,args = ["mcp"]。官方还附带 Agent skill(skills/autoclip/SKILL.md)。
MCP server 工具面(stdio)
- clip_video:一步完成剪辑
- start_clip_job / get_job_status:异步任务提交与轮询
- get_project / list_projects:项目与结果查询
- list_providers / check_environment:模型与环境自检
- export_clip:按预设导出成片
场景:Cursor / Claude 里说「把这条播客切成 5 条 Shorts」,Agent 直接调用同一条流水线,无人值守批量出片。
快速上手
五分钟跑通第一条链路
# Docker 路线(服务器)
git clone https://github.com/zhouxiaoka/autoclip.git
cd autoclip
cp env.example .env # 编辑 LLM_PROVIDER / API Key
mkdir -p data logs uploads
docker compose up -d --build
# → http://localhost:3000 界面 / :8000/docs API
- 桌面版:Release 下载安装包 → 设置页选模型 → 测试连接 → 导入视频
- 无字幕视频:pip install faster-whisper,首次转写自动下载语音模型
- 已有 SRT:导入时附带,省转写时间且更准
- 没出片段?:把评分阈值从 0.7 降到 0.5(FAQ 第一招)
- 自检:autoclip doctor 一条命令体检模型 / FFmpeg / 环境
在线体验
亲手调一次高光评分阈值
左侧是一条模拟播客的逐句评分时间轴,右侧实时跑 AutoClip 的核心切片规则:阈值过滤 → 间距合并 → 最短时长 → top-K 保底。拖动滑块看切片数量与合集时长如何变化——README FAQ 里「阈值从 0.7 降到 0.5」到底意味着什么,玩一遍就懂。
▶ 打开高光切片模拟器
切片决策逻辑 1:1 复刻 v1.3.0 出片规则(阈值 / 合并 / top-K 保底),Python 全真值表 + node 对拍双验证。
适用场景
适合谁,不适合谁
适合(README 明示)
- 播客 / 访谈创作者:一小时节目切成金句矩阵,语义评分恰好是强项
- 知识课程 UP 主:按大纲与话题时间线切片,标题自动生成
- 直播回放运营:批量 CLI 流水线 + MCP 无人值守出片
- 隐私敏感场景:Ollama 本地模型 + 本地 FFmpeg,数据不出机器
- 想学 LLM 工程化的人:eval 回归 + 失败语义是少见的教学样本
不适合(边界明确)
- 纯视觉内容:Vlog、旅拍、开箱——没有密集字幕可分析,效果有限
- 音乐 / MV:高光在旋律与画面,不在文本
- 追求帧级精确卡点:切片对齐的是字幕句边界,不是音乐节拍
- 商用 SLO 要求:个人业余维护,issue 响应不保证时效
潜力评估
未来空间
风险
- 巴士因子 = 1:个人业余维护,明确声明「回复时间不固定,无一对一部署服务」
- 字幕天花板:路线选型决定了视觉类内容永远不在射程内
- 评分主观性:高光标准由 LLM 判断,不同模型 / 提示词结果差异大
- 二创版权边界:切他人视频分发需自行确认授权
加分项
- 赛道刚需:长视频 → 垂直切片是内容工业的固定工序,8.4k stars 验证需求
- 架构克制:字幕路线让 7B 本地模型可用,成本结构碾压多模态方案
- MCP 先手:视频剪辑工具里最早一批开放 Agent 调用
- 工程可信:eval 回归、失败语义、诚实的 CHANGELOG,长期演化有轨道
评分 8.5:定位聪明(用最便宜的智能解决最贵的工序)、执行纪律好(单人项目做出工业级可靠性)、形态完整(桌面/Web/CLI/MCP 四入口)。扣分在单人维护的持续性风险与字幕路线的天花板。看点:体裁提示词库能否社区化、MCP 生态爆发后能否成为 Agent 剪辑的标准后端。