LiveClip 是一款 macOS 桌面工具,从长视频中自动识别并提取高光片段。结合音频分析(能量检测、频谱变化)、视频分析(场景切换检测)和语音转文字(STT),再通过关键词匹配或 LLM 评分,定位值得剪出来的内容。
从音频、视频、文字三路信号中精准定位高光时刻
RMS 能量检测 + 频谱变化追踪,通过音量突变和频谱分布变化,定位视频中的"高潮区"。能量阈值可调(默认 0.3),有效过滤背景噪音干扰。
帧间直方图差异检测场景切换,捕捉镜头变化密集的区域。直方图阈值可调(默认 0.15),识别画面转场、运动爆发等视觉高能时刻。
插件式架构,支持 FunASR Paraformer(中文推荐)和 faster-whisper(多语言)。Apple Silicon 上 bf16 半精度推理,内存占用仅约 500MB。
默认关键词命中评分,也可接入 Deepseek LLM 进行语义分析。从内容价值、情绪张力、独立完整性四个维度评分,比简单关键词匹配更准确。
音频、视频、文字三路信号融合引擎。重叠度超 30% 的片段自动合并,置信度按时长加权,跨模态交叉验证的片段额外加权 10%。
启动时自动检测 Mac 硬件能力:VideoToolbox 视频编解码、MPS AI 计算加速。管线根据检测结果自动选择最优设备,最大化利用 Apple Silicon 性能。
PySide6 + Qt6 QML 构建的原生 macOS 界面,四个标签页覆盖完整工作流
InputPanel 标签页:拖拽或选择视频文件,一键启动三阶段分析流程(音频波形 → STT 文字 → 高光评分),底部日志面板实时显示进度
逐段查看语音识别结果,每条包含时间戳和置信度
查看评分后的高光片段,支持排序筛选和导出
配置导出参数,一键导出高光片段为独立视频
从原始视频到高光片段,全流程自动化
RMS 能量检测 + 频谱变化追踪,定位音视频中的"高潮区",通过能量阈值过滤背景噪音
帧间直方图差异检测场景切换,捕捉镜头变化密集的区域,识别画面转场与运动爆发
接入 FunASR Paraformer 或 faster-whisper,将音频转为带时间戳的逐段文字
关键词命中(默认)或接入 Deepseek LLM 语义分析,从四个维度评价内容价值
将音频、视频、文字三路信号融合,去重排序,跨模态交叉验证额外加权
双模式灵活使用,满足不同场景需求
提供四个标签页覆盖完整工作流:
支持直接检测高光、导出片段、JSON 输出等高级功能:
| 参数 | 说明 | 默认值 |
|---|---|---|
--top-k N | 返回前 N 个高光 | 全部 |
--min-sec N | 最小片段时长 | 5s |
--max-sec N | 最大片段时长 | 180s |
--energy-thresh N | 音频能量阈值 | 0.3 |
--hist-thresh N | 视频直方图阈值 | 0.15 |
--json | JSON 格式输出 | — |
--export-dir DIR | 导出高光片段 | — |
三路信号融合分析,磁盘缓存加速二次运行
音频 + 视频 + 文字多模态融合
FunASR bf16 半精度推理
内容价值、情绪张力、独立完整性
跨模态联合检测额外加权
模块化设计,层层缓存,跨模态融合
分析流程分为三个阶段,每阶段结果缓存到磁盘(~/.liveclip/cache/<video_hash>/),重复运行秒出结果:
音频检测(能量峰值/频谱突变)和视频检测(场景切换)各自产出一组候选片段,在 scene_detector.py 中合并去重。重叠度超过 30% 的片段自动融合,置信度按时长加权,跨模态交叉验证的片段额外加权 10%。
采用插件式架构,通过抽象基类定义统一接口,轻松切换不同的语音识别引擎。FunASR Paraformer 为中文默认推荐,在 Apple Silicon 上支持 bf16 半精度推理。faster-whisper 提供多语言支持。
设置 DEEPSEEK_API_KEY 环境变量后可开启 LLM 评分模式。Deepseek 会对每段转录文字进行语义分析,从内容价值、情绪张力、独立完整性四个维度评分。相比关键词匹配,LLM 能理解上下文语义,但需要网络请求。
Python 生态 + AI 模型 + macOS 原生界面
原生 macOS 界面框架,流畅的跨平台 UI 体验
中文语音识别首选,bf16 半精度推理
多语言语音识别,CTranslate2 加速
视频场景检测 + 硬件编解码导出
音频信号处理,能量和频谱分析
OpenAI 兼容 API,四维语义评分
Apple Silicon 硬件加速,自动适配
可选打包为独立 .app,无需 Python 环境
高光检测、模型选择、性能优化等常见问题解答
LiveClip 是一款 macOS 桌面工具,从长视频中自动识别并提取高光片段。它结合音频分析(能量检测、频谱变化)、视频分析(场景切换检测)和语音转文字(STT),再通过关键词匹配或 LLM 评分,定位值得剪出来的内容。适合从长视频中快速提取精彩片段。
克隆仓库后运行 ./launch.sh 即可。首次运行会自动创建虚拟环境、安装依赖(约 2GB,包含 PyTorch 和 FunASR),并下载 ffmpeg。后续启动秒开。
中文内容推荐 FunASR Paraformer,识别准确率更高,且在 Apple Silicon 上支持 bf16 半精度推理,内存占用约 500MB。多语言内容(英文、日文等)使用 faster-whisper。首次运行会自动下载模型(约 500MB),之后缓存复用。
音频分析使用 librosa,处理长视频(>2 小时)时首次加载较慢是正常的。LiveClip 采用多级磁盘缓存策略,每阶段结果缓存到 ~/.liveclip/cache/,重复运行同一视频时秒出结果。Apple Silicon Mac 上 MPS 加速会提升 AI 计算速度。
设置 DEEPSEEK_API_KEY 环境变量后,高光评分会自动切换到 LLM 模式。Deepseek 会对转录文字进行语义分析,从内容价值、情绪张力、独立完整性等维度综合评价。需要网络连接,相比关键词模式更准确但较慢。
LiveClip 专为 macOS 设计,支持 Apple Silicon 和 Intel Mac。支持 ffmpeg 能处理的所有视频格式(MP4、MOV、MKV、AVI 等)。CLI 导出依赖 ffmpeg 的 VideoToolbox 编码(macOS 默认支持)。