长视频智能高光提取

LiveClip 是一款 macOS 桌面工具,从长视频中自动识别并提取高光片段。结合音频分析(能量检测、频谱变化)、视频分析(场景切换检测)和语音转文字(STT),再通过关键词匹配或 LLM 评分,定位值得剪出来的内容。

音频能量分析 视频场景检测 语音转文字 LLM 语义评分
LiveClip — 高光检测
LiveClip 应用主界面截图

六大核心能力,一站式高光定位

从音频、视频、文字三路信号中精准定位高光时刻

音频能量检测

RMS 能量检测 + 频谱变化追踪,通过音量突变和频谱分布变化,定位视频中的"高潮区"。能量阈值可调(默认 0.3),有效过滤背景噪音干扰。

01

视频场景检测

帧间直方图差异检测场景切换,捕捉镜头变化密集的区域。直方图阈值可调(默认 0.15),识别画面转场、运动爆发等视觉高能时刻。

02

STT 语音转文字

插件式架构,支持 FunASR Paraformer(中文推荐)和 faster-whisper(多语言)。Apple Silicon 上 bf16 半精度推理,内存占用仅约 500MB。

03

智能高光评分

默认关键词命中评分,也可接入 Deepseek LLM 进行语义分析。从内容价值、情绪张力、独立完整性四个维度评分,比简单关键词匹配更准确。

04

多模态融合

音频、视频、文字三路信号融合引擎。重叠度超 30% 的片段自动合并,置信度按时长加权,跨模态交叉验证的片段额外加权 10%。

05

硬件加速检测

启动时自动检测 Mac 硬件能力:VideoToolbox 视频编解码、MPS AI 计算加速。管线根据检测结果自动选择最优设备,最大化利用 Apple Silicon 性能。

06

直观的操作界面

PySide6 + Qt6 QML 构建的原生 macOS 界面,四个标签页覆盖完整工作流

LiveClip 主界面 - 视频加载与分析

主界面 — 视频加载与分析

InputPanel 标签页:拖拽或选择视频文件,一键启动三阶段分析流程(音频波形 → STT 文字 → 高光评分),底部日志面板实时显示进度

语音识别结果

Transcript 标签页

逐段查看语音识别结果,每条包含时间戳和置信度

高光片段列表

Highlights 标签页

查看评分后的高光片段,支持排序筛选和导出

导出设置

导出设置

配置导出参数,一键导出高光片段为独立视频

三阶段管线 + 多模态融合

从原始视频到高光片段,全流程自动化

视频文件
音频提取
STT 语音转文字
高光评分
片段时间戳
导出
1

音频分析

RMS 能量检测 + 频谱变化追踪,定位音视频中的"高潮区",通过能量阈值过滤背景噪音

2

视频场景检测

帧间直方图差异检测场景切换,捕捉镜头变化密集的区域,识别画面转场与运动爆发

3

STT 语音转文字

接入 FunASR Paraformer 或 faster-whisper,将音频转为带时间戳的逐段文字

4

高光评分

关键词命中(默认)或接入 Deepseek LLM 语义分析,从四个维度评价内容价值

5

多模态融合

将音频、视频、文字三路信号融合,去重排序,跨模态交叉验证额外加权

GUI 图形界面 + CLI 命令行

双模式灵活使用,满足不同场景需求

GUI 图形界面

提供四个标签页覆盖完整工作流:

  • InputPanel:加载视频、运行分析、查看进度
  • Transcript:逐段查看语音识别结果,含时间戳和置信度
  • Highlights:查看评分后的高光片段,支持排序筛选和导出
  • Hardware:查看当前 Mac 的硬件加速能力(VideoToolbox、MPS)
# 启动界面
./launch.sh

# 直接加载视频
./launch.sh ~/Downloads/video.mp4

CLI 命令行

支持直接检测高光、导出片段、JSON 输出等高级功能:

# 直接检测高光
python cli.py video.mp4

# 导出前 10 个高光片段为独立视频文件
python cli.py video.mp4 --export-dir ./clips --top-k 10

# JSON 格式输出
python cli.py video.mp4 --json
参数 说明 默认值
--top-k N返回前 N 个高光全部
--min-sec N最小片段时长5s
--max-sec N最大片段时长180s
--energy-thresh N音频能量阈值0.3
--hist-thresh N视频直方图阈值0.15
--jsonJSON 格式输出
--export-dir DIR导出高光片段

多模态智能,高效高光检测

三路信号融合分析,磁盘缓存加速二次运行

3 路

信号源

音频 + 视频 + 文字多模态融合

500MB

模型内存

FunASR bf16 半精度推理

4 维

LLM 评分维度

内容价值、情绪张力、独立完整性

+10%

交叉验证加权

跨模态联合检测额外加权

三阶段管线 + 插件式架构

模块化设计,层层缓存,跨模态融合

三阶段管线

分析流程分为三个阶段,每阶段结果缓存到磁盘(~/.liveclip/cache/<video_hash>/),重复运行秒出结果:

原始视频
[阶段 1] 音频波形
[阶段 2] STT 文字
[阶段 3] 高光评分

多模态融合引擎

音频检测(能量峰值/频谱突变)和视频检测(场景切换)各自产出一组候选片段,在 scene_detector.py 中合并去重。重叠度超过 30% 的片段自动融合,置信度按时长加权,跨模态交叉验证的片段额外加权 10%。

插件式 STT 后端

采用插件式架构,通过抽象基类定义统一接口,轻松切换不同的语音识别引擎。FunASR Paraformer 为中文默认推荐,在 Apple Silicon 上支持 bf16 半精度推理。faster-whisper 提供多语言支持。

LLM 评分(可选)

设置 DEEPSEEK_API_KEY 环境变量后可开启 LLM 评分模式。Deepseek 会对每段转录文字进行语义分析,从内容价值、情绪张力、独立完整性四个维度评分。相比关键词匹配,LLM 能理解上下文语义,但需要网络请求。

核心技术一览

Python 生态 + AI 模型 + macOS 原生界面

PySide6 + Qt6 QML

原生 macOS 界面框架,流畅的跨平台 UI 体验

FunASR Paraformer

中文语音识别首选,bf16 半精度推理

faster-whisper

多语言语音识别,CTranslate2 加速

OpenCV + ffmpeg

视频场景检测 + 硬件编解码导出

librosa + numpy

音频信号处理,能量和频谱分析

Deepseek LLM

OpenAI 兼容 API,四维语义评分

MPS + VideoToolbox

Apple Silicon 硬件加速,自动适配

PyInstaller

可选打包为独立 .app,无需 Python 环境

关于 LiveClip 的常见疑问

高光检测、模型选择、性能优化等常见问题解答

LiveClip 是什么?

LiveClip 是一款 macOS 桌面工具,从长视频中自动识别并提取高光片段。它结合音频分析(能量检测、频谱变化)、视频分析(场景切换检测)和语音转文字(STT),再通过关键词匹配或 LLM 评分,定位值得剪出来的内容。适合从长视频中快速提取精彩片段。

如何启动?

克隆仓库后运行 ./launch.sh 即可。首次运行会自动创建虚拟环境、安装依赖(约 2GB,包含 PyTorch 和 FunASR),并下载 ffmpeg。后续启动秒开。

FunASR 和 faster-whisper 怎么选?

中文内容推荐 FunASR Paraformer,识别准确率更高,且在 Apple Silicon 上支持 bf16 半精度推理,内存占用约 500MB。多语言内容(英文、日文等)使用 faster-whisper。首次运行会自动下载模型(约 500MB),之后缓存复用。

处理长视频慢怎么办?

音频分析使用 librosa,处理长视频(>2 小时)时首次加载较慢是正常的。LiveClip 采用多级磁盘缓存策略,每阶段结果缓存到 ~/.liveclip/cache/,重复运行同一视频时秒出结果。Apple Silicon Mac 上 MPS 加速会提升 AI 计算速度。

LLM 评分模式怎么开启?

设置 DEEPSEEK_API_KEY 环境变量后,高光评分会自动切换到 LLM 模式。Deepseek 会对转录文字进行语义分析,从内容价值、情绪张力、独立完整性等维度综合评价。需要网络连接,相比关键词模式更准确但较慢。

支持哪些平台和视频格式?

LiveClip 专为 macOS 设计,支持 Apple Silicon 和 Intel Mac。支持 ffmpeg 能处理的所有视频格式(MP4、MOV、MKV、AVI 等)。CLI 导出依赖 ffmpeg 的 VideoToolbox 编码(macOS 默认支持)。

开始智能提取高光片段

开源免费,基于 Python + AI 模型,macOS 原生桌面体验

访问开源仓库 返回作品列表