
视频编辑 - 在线运行 Skill
视频剪辑
将原始视频素材剪辑成完整、流畅、可直接发布的成片,包括剪切、字幕、配音、画面比例调整、视觉增强和最终导出。
这个 Skill 专门用于实际剪辑视频内容,而不只是提供剪辑建议。上传你的视频、图片或音频,并告诉它你想怎么修改。它可以分析素材、完成剪辑,并直接输出最终视频文件。
注意:这个 Agent 只能对已有视频进行剪辑和处理,无法从零生成新视频。
可以做什么
剪辑和重组视频素材
清理原始素材,把冗长、松散的录制内容整理成更紧凑的成片。
可以处理:
- 删除不需要的片段
- 剪切和拼接视频
- 去掉多余停顿
- 调整片段顺序
- 修改视频时长
- 加快整体节奏
- 从长视频中提取有用片段
- 将长视频剪成短视频内容
剪辑过程主要通过基于 FFmpeg 的本地工具完成,不依赖外部视频剪辑服务。
适配不同平台的画面比例
可以将已有视频转换成不同发布平台常用的比例,例如:
- 9:16 竖屏视频
- 16:9 横屏视频
- 1:1 方形视频
Skill 可以根据 TikTok、YouTube Shorts、Instagram Reels、YouTube 等平台的需求,对视频进行缩放、裁剪和重新构图。
添加字幕和文字说明
在可以进行语音转录的情况下,Skill 能将视频中的语音转换成带时间轴的字幕,并利用这些时间信息完成后续剪辑。
可以制作:
- 标准字幕
- 短视频风格字幕
- 大字号易读字幕
- 对话字幕
- 按时间出现的文字叠加
对于较长的视频,它会先从完整转录内容中提取真正与剪辑相关的信息、时间点和操作计划,而不是在后续步骤中反复处理整段转录文本。
添加配音
在线版本包含本地文字转语音功能,因此可以直接生成基础英文配音,不需要 ElevenLabs 账号或 API Key。
配音可用于:
- 视频旁白
- 讲解视频
- 开场或结尾台词
- 替换原有语音轨道
- 图片类视频
- 短视频内容
生成的语音可以直接与视频进行混音,并合成到最终成片中。
添加视觉元素和动态效果
可以通过轻量级动效和视觉元素增强已有视频。
例如:
- 标题
- 文字叠加
- 开场和结尾画面
- 放大效果
- 平移动效
- 图片叠加
- 全屏视觉插入
- 简单转场
- 重新构图和动态裁剪
这些效果主要用于增强已有素材,不需要完整的动画制作流程或生成式视频模型。
在需要时生成辅助视觉素材
如果当前运行环境支持图片生成,Skill 可以为剪辑生成少量辅助视觉素材。
当原始视频缺少合适画面时,可以生成:
- B-roll 插图
- 背景画面
- 概念图
- 辅助图形
- 视觉化说明
- 场景插图
- 标题或转场画面
生成的图片可以直接插入视频中,同时保留原视频对应时间段的声音。
生图会主动控制数量
图片生成在这里是辅助剪辑工具,而不是视频内容的主要来源。
Skill 会遵循以下规则:
- 默认不生成图片
- 普通剪辑通常生成 1–2 张辅助视觉素材
- 每次剪辑最多生成 4 张图片
- 能使用已有素材或已经生成的图片时,优先复用
- 不生成没有必要的多个版本
- 除非剪辑确实需要,否则不会反复重新生成图片
这样既能保持剪辑效率,也可以在真正有需要时加入 AI 生成的 B-roll。
将图片制作成视频
除了视频素材,也可以直接提供静态图片。
Skill 可以将图片与以下元素结合:
- 平移和缩放动效
- 配音
- 字幕
- 时间控制
- 镜头切换
- 背景音频
- 简单动态效果
适合制作幻灯片视频、讲解视频、图片旁白故事、产品展示以及轻量级动态视频内容。
音频处理
Skill 可以在剪辑过程中通过 FFmpeg 处理和组合音频。
根据不同素材,可以完成:
- 提取视频音频
- 混入配音
- 调整音量
- 替换音轨
- 将旁白与原视频声音混合
- 添加用户提供的音乐或音效
工作方式
一个典型的视频剪辑流程如下:
- 上传原始视频、图片或音频。
- 描述你想要的最终效果。
- Skill 分析现有素材。
- 根据需要生成简洁的剪辑计划、时间点和操作步骤。
- 尽可能优先使用已有视频素材。
- 只有确实能够提升成片效果时,才生成辅助视觉素材。
- 添加字幕、配音、视觉叠加、裁剪以及其他需要的修改。
- 使用 FFmpeg 渲染最终视频。
- 返回完成后的 MP4 文件。
使用示例
你可以这样说:
把这段视频剪成 30 秒的 TikTok,并添加大字号字幕。
删除节奏太慢的部分,让整个视频更紧凑。
把这段横屏视频转换成 9:16 的 Shorts。
用这段文案添加一个轻快的旁白。
我讲到 AI Agent 的时候,加入一些相关的视觉 B-roll。
在 00:18 到 00:23 之间插入一张生成的插图,同时保留我的原始语音。
添加字幕并导出最终 MP4。
把这些图片和旁白制作成一条竖屏视频。
优化开场、添加字幕,并统一音量。
它不是什么
这个 Skill 的核心定位是视频剪辑工具。
它并不负责完整的生成式视频制作,例如仅通过一段文字提示直接生成一整段电影级 3D 动画。
例如:
从零制作一段 60 秒的完整 3D 卡通动画,让角色在里面连续运动。
这种需求需要专门的文生视频模型或动画生成模型。
在合适的情况下,这个 Skill 可以使用生成图片、动态效果、旁白、字幕和剪辑手段,制作一个更简单的插画视频或动态视觉版本,但不会将其描述成真正的生成式动画。
为在线运行优化
整个剪辑流程尽量减少对外部服务的依赖。
核心功能主要使用内置或本地工具,例如:
- FFmpeg
- FFprobe
- 本地文字转语音
- 基于 Python 的媒体处理工具
核心剪辑功能不依赖 ElevenLabs、fal.ai、Descript、CapCut 或 Replicate 等外部服务。
如果当前 AI 运行环境提供图片生成能力,也可以将它作为可选的视觉增强功能使用,而不会让整个视频剪辑流程依赖于生图服务。
适合这些场景
- TikTok 和 Reels
- YouTube Shorts
- YouTube 视频
- 真人口播视频
- 教程视频
- 产品演示
- 讲解视频
- 播客和访谈片段
- 社交媒体视频
- 图片旁白视频
- 需要进一步整理和优化的已有视频素材
上传你的素材,然后告诉它你想要什么效果——目标是直接交付完成的视频,而不只是告诉你应该怎么剪。
来源
Video Editing 来自 affaan-m 的 ECC 项目。
来源:
https://github.com/affaan-m/ECC/tree/main/skills/video-editing


