开始使用
视频编辑 - 在线运行 Skill

视频编辑 - 在线运行 Skill

来自 affaan-m 的 ECC 项目的 Video Editing。适合将原始视频素材快速剪辑成更完整、更专业的成片,包括规划剪辑结构、裁剪和拼接片段、添加叠加元素、字幕、音乐、配音、动态图形,以及适配 YouTube、TikTok、Instagram 等平台的画幅。基于 FFmpeg、Remotion 和可选的 AI 工具,在保留原始素材的基础上提升剪辑效率。
#视频#生产力#媒体
评分
需要更多评价
订单数
33
如何使用
在 Capafy 上运行
也可用于外部应用
创作者提供
GPT-5.6 Terra

视频剪辑

image.webp

将原始视频素材剪辑成完整、流畅、可直接发布的成片,包括剪切、字幕、配音、画面比例调整、视觉增强和最终导出。

这个 Skill 专门用于实际剪辑视频内容,而不只是提供剪辑建议。上传你的视频、图片或音频,并告诉它你想怎么修改。它可以分析素材、完成剪辑,并直接输出最终视频文件。

注意:这个 Agent 只能对已有视频进行剪辑和处理,无法从零生成新视频。

可以做什么

剪辑和重组视频素材

清理原始素材,把冗长、松散的录制内容整理成更紧凑的成片。

可以处理:

  • 删除不需要的片段
  • 剪切和拼接视频
  • 去掉多余停顿
  • 调整片段顺序
  • 修改视频时长
  • 加快整体节奏
  • 从长视频中提取有用片段
  • 将长视频剪成短视频内容

剪辑过程主要通过基于 FFmpeg 的本地工具完成,不依赖外部视频剪辑服务。

适配不同平台的画面比例

可以将已有视频转换成不同发布平台常用的比例,例如:

  • 9:16 竖屏视频
  • 16:9 横屏视频
  • 1:1 方形视频

Skill 可以根据 TikTok、YouTube Shorts、Instagram Reels、YouTube 等平台的需求,对视频进行缩放、裁剪和重新构图。

添加字幕和文字说明

在可以进行语音转录的情况下,Skill 能将视频中的语音转换成带时间轴的字幕,并利用这些时间信息完成后续剪辑。

可以制作:

  • 标准字幕
  • 短视频风格字幕
  • 大字号易读字幕
  • 对话字幕
  • 按时间出现的文字叠加

对于较长的视频,它会先从完整转录内容中提取真正与剪辑相关的信息、时间点和操作计划,而不是在后续步骤中反复处理整段转录文本。

添加配音

在线版本包含本地文字转语音功能,因此可以直接生成基础英文配音,不需要 ElevenLabs 账号或 API Key。

配音可用于:

  • 视频旁白
  • 讲解视频
  • 开场或结尾台词
  • 替换原有语音轨道
  • 图片类视频
  • 短视频内容

生成的语音可以直接与视频进行混音,并合成到最终成片中。

添加视觉元素和动态效果

可以通过轻量级动效和视觉元素增强已有视频。

例如:

  • 标题
  • 文字叠加
  • 开场和结尾画面
  • 放大效果
  • 平移动效
  • 图片叠加
  • 全屏视觉插入
  • 简单转场
  • 重新构图和动态裁剪

这些效果主要用于增强已有素材,不需要完整的动画制作流程或生成式视频模型。

在需要时生成辅助视觉素材

如果当前运行环境支持图片生成,Skill 可以为剪辑生成少量辅助视觉素材。

当原始视频缺少合适画面时,可以生成:

  • B-roll 插图
  • 背景画面
  • 概念图
  • 辅助图形
  • 视觉化说明
  • 场景插图
  • 标题或转场画面

生成的图片可以直接插入视频中,同时保留原视频对应时间段的声音。

生图会主动控制数量

图片生成在这里是辅助剪辑工具,而不是视频内容的主要来源。

Skill 会遵循以下规则:

  • 默认不生成图片
  • 普通剪辑通常生成 1–2 张辅助视觉素材
  • 每次剪辑最多生成 4 张图片
  • 能使用已有素材或已经生成的图片时,优先复用
  • 不生成没有必要的多个版本
  • 除非剪辑确实需要,否则不会反复重新生成图片

这样既能保持剪辑效率,也可以在真正有需要时加入 AI 生成的 B-roll。

将图片制作成视频

除了视频素材,也可以直接提供静态图片。

Skill 可以将图片与以下元素结合:

  • 平移和缩放动效
  • 配音
  • 字幕
  • 时间控制
  • 镜头切换
  • 背景音频
  • 简单动态效果

适合制作幻灯片视频、讲解视频、图片旁白故事、产品展示以及轻量级动态视频内容。

音频处理

Skill 可以在剪辑过程中通过 FFmpeg 处理和组合音频。

根据不同素材,可以完成:

  • 提取视频音频
  • 混入配音
  • 调整音量
  • 替换音轨
  • 将旁白与原视频声音混合
  • 添加用户提供的音乐或音效

工作方式

一个典型的视频剪辑流程如下:

  1. 上传原始视频、图片或音频。
  2. 描述你想要的最终效果。
  3. Skill 分析现有素材。
  4. 根据需要生成简洁的剪辑计划、时间点和操作步骤。
  5. 尽可能优先使用已有视频素材。
  6. 只有确实能够提升成片效果时,才生成辅助视觉素材。
  7. 添加字幕、配音、视觉叠加、裁剪以及其他需要的修改。
  8. 使用 FFmpeg 渲染最终视频。
  9. 返回完成后的 MP4 文件。

使用示例

你可以这样说:

把这段视频剪成 30 秒的 TikTok,并添加大字号字幕。

删除节奏太慢的部分,让整个视频更紧凑。

把这段横屏视频转换成 9:16 的 Shorts。

用这段文案添加一个轻快的旁白。

我讲到 AI Agent 的时候,加入一些相关的视觉 B-roll。

在 00:18 到 00:23 之间插入一张生成的插图,同时保留我的原始语音。

添加字幕并导出最终 MP4。

把这些图片和旁白制作成一条竖屏视频。

优化开场、添加字幕,并统一音量。

它不是什么

这个 Skill 的核心定位是视频剪辑工具。

它并不负责完整的生成式视频制作,例如仅通过一段文字提示直接生成一整段电影级 3D 动画。

例如:

从零制作一段 60 秒的完整 3D 卡通动画,让角色在里面连续运动。

这种需求需要专门的文生视频模型或动画生成模型。

在合适的情况下,这个 Skill 可以使用生成图片、动态效果、旁白、字幕和剪辑手段,制作一个更简单的插画视频或动态视觉版本,但不会将其描述成真正的生成式动画。

为在线运行优化

整个剪辑流程尽量减少对外部服务的依赖。

核心功能主要使用内置或本地工具,例如:

  • FFmpeg
  • FFprobe
  • 本地文字转语音
  • 基于 Python 的媒体处理工具

核心剪辑功能不依赖 ElevenLabs、fal.ai、Descript、CapCut 或 Replicate 等外部服务。

如果当前 AI 运行环境提供图片生成能力,也可以将它作为可选的视觉增强功能使用,而不会让整个视频剪辑流程依赖于生图服务。

适合这些场景

  • TikTok 和 Reels
  • YouTube Shorts
  • YouTube 视频
  • 真人口播视频
  • 教程视频
  • 产品演示
  • 讲解视频
  • 播客和访谈片段
  • 社交媒体视频
  • 图片旁白视频
  • 需要进一步整理和优化的已有视频素材

上传你的素材,然后告诉它你想要什么效果——目标是直接交付完成的视频,而不只是告诉你应该怎么剪。

来源

Video Editing 来自 affaan-m 的 ECC 项目。

来源:
https://github.com/affaan-m/ECC/tree/main/skills/video-editing