ChatCut + Codex 剪视频教程:从插件安装到完成一次口播粗剪
基于 ChatCut 官方文档与公开插件仓库,讲清 ChatCut 是什么,并用一段自有口播素材演示安全工作流:安装并验证插件、先读素材和转写、确认删减方案、生成字幕、核对时间线,最后经人工批准再导出。
ChatCut 是一套网页端 AI 视频剪辑 Agent。用户可以用自然语言说明剪辑目标,由 Agent 读取素材、分析语音转写并修改一条仍可继续编辑的多轨时间线。ChatCut 还提供面向 ChatGPT/Codex 桌面端的官方插件,让 Codex 能通过 MCP 连接编辑器、编排剪辑步骤并核对执行结果。
本教程不做功能百科,而是完成一个具体任务:把一段 30~90 秒、由你本人拍摄并拥有使用权的中文口播视频,保守地删掉明显口头禅和过长停顿,生成字幕,人工复核时间线,然后再决定是否导出。
本文核对日期:2026 年 7 月 12 日。ChatCut 仍在快速更新,插件入口、套餐和界面可能变化;安装时以 ChatCut 官方安装说明 与桌面端实际反馈为准。
一、ChatCut 是什么,能做什么
按照 ChatCut 官方说明,ChatCut 不是只输出剪辑建议的聊天机器人,而是能够操作项目素材、轨道和时间线的视频编辑 Agent。它目前主要通过语音转写理解视频内容,尤其适合口播、访谈和播客等以语言信息为主的素材。
ChatCut 当前可以完成的主要工作包括:
| 能力 | 可以完成什么 | 使用时要注意什么 |
|---|---|---|
| 口播与访谈粗剪 | 根据转写查找口头禅、重复表达、失误和过长停顿,形成候选剪点并修改时间线 | 删除前仍应由用户确认,避免改变原意或破坏自然节奏 |
| 长视频切短 | 从播客、访谈或长口播中寻找重点片段,整理成短视频时间线 | “最精彩片段”属于主观判断,提示词要写清受众、时长和保留信息 |
| 文本式剪辑 | 通过阅读和编辑转写内容定位视频片段,不必只靠拖动播放头寻找内容 | 转写错误会影响判断,人物名、品牌名和专业词必须人工校对 |
| 自动字幕 | 根据当前时间线生成字幕并调整断句 | 字幕生成后仍需检查错字、遮挡和已经删除的内容是否残留 |
| 动态图形与素材编排 | 把动态图形、图片、视频和声音放到多轨时间线上 | 不应在用户没有要求时自动增加装饰素材 |
| AI 图片、视频、配乐与旁白 | 在编辑器中调用生成能力补充画面或声音 | 可能消耗账户额度,还涉及肖像、声音、版权和真实性风险 |
| 版本与导出 | 保存项目版本,并按所选分辨率、帧率和格式导出 | 导出应放在人工复核之后,不能把“已提交导出”当成“文件已成功生成” |
它目前也有明确边界:官方文档将内容理解描述为“基于转写”,并把视觉分析标注为后续能力。因此,第一次使用更适合选择结构清楚的口播样片,而不是要求它只凭画面理解完成无对白旅行混剪。
使用 Codex 操作 ChatCut 时,实际由三个层次共同完成任务:
- Codex 负责理解任务与编排步骤:先读项目、找素材、请求转写,再提出删减方案。
- ChatCut 负责真实剪辑状态:修改的是项目、轨道和时间线项目,不是一段无法回退的聊天答案。
- 用户保留最终判断:可以在播放器和时间线上检查结果,保存版本;导出应当是明确批准后的独立动作。
这也是它与“一键生成成片”工具的区别:速度来自 Agent,但编辑权并没有完全交出去。需要注意,ChatCut 官网关于自主能力、生成模型和效率的表述属于产品方说明;本文没有把宣传数据当成独立测评结论。
二、开始前准备:把风险缩小到一个可控样本
准备以下内容:
- Windows 或 macOS 上的 ChatGPT/Codex 桌面应用;官方说明不支持在 Web 或移动端安装该插件。
- 一个 ChatCut 账户,用于 OAuth 登录。
- 一段 30~90 秒的 MP4 或 MOV 口播样片。必须是你拥有版权、肖像权和声音使用权的素材。
- 一份不超过三句的剪辑目标,例如:“保留原意,去掉明显的‘嗯、然后、就是说’,停顿超过 1.2 秒再考虑缩短,不加音乐和 B-roll。”
第一次不要使用客户未公开素材、涉密项目视频、未成年人素材或没有授权的他人脸部和声音。ChatCut 的使用政策同样要求用户对素材权利、隐私和公开发布负责。
本教程的停止条件
出现以下任一情况就停止,不要让 Agent 继续“试试看”:
- 找不到桌面应用内置的 Codex CLI,却准备改用网上随便安装的独立 CLI;
- OAuth 登录页域名或授权范围与官方说明不一致;
- 插件无法读到项目、素材或转写,却开始凭空声称已剪完;
- 剪辑改变原意,或删掉的内容超过你确认的候选范围;
- 没有看到可核对的时间线或渲染画面,就准备导出或发布。
三、安装 ChatCut 插件:先让 Codex 说明动作,再授权执行
最省事的方式是在 ChatGPT/Codex 桌面端新建普通对话,粘贴下面这段提示词。它基于官方安装入口增加了安全边界:
请读取 https://chatcut.io/chatgpt 的官方安装说明,为当前 ChatGPT/Codex 桌面应用安装 ChatCut 插件。
要求:
1. 只使用桌面应用自带的 bundled Codex CLI,不安装 npm、Homebrew 或其他独立 Codex CLI。
2. 先识别当前操作系统和内置 CLI 路径,并运行 --version 验证。
3. 在执行 marketplace add、plugin add 或 mcp login 前,先把将执行的命令和影响告诉我,等我确认。
4. 只从 https://github.com/ChatCut-Inc/agent-plugin.git 的 main 分支添加官方插件。
5. 安装后检查插件是否 installed 且 enabled,并检查 chatcut MCP 与 node_repl 是否可用。
6. 不上传素材,不创建项目,不调用生成式视频、图片或音乐能力。
7. 完成后提醒我必须新建一个对话,不能在当前安装对话里直接剪视频。
官方手动流程的核心命令如下。<内置 codex 路径> 是桌面应用实际找到的可执行文件,不能机械照抄成普通 codex:
& "<内置 codex 路径>" --version
& "<内置 codex 路径>" plugin marketplace add https://github.com/ChatCut-Inc/agent-plugin.git --ref main
& "<内置 codex 路径>" plugin marketplace list
& "<内置 codex 路径>" plugin list --marketplace <marketplace-name>
& "<内置 codex 路径>" plugin add chatcut@<marketplace-name>
& "<内置 codex 路径>" mcp login chatcut
安装后的核验命令:
& "<内置 codex 路径>" plugin list --marketplace <marketplace-name> --json
& "<内置 codex 路径>" mcp get chatcut --json
& "<内置 codex 路径>" mcp get node_repl --json
合格结果不是“命令没报错”这么简单,而是插件状态为已安装、已启用,ChatCut MCP 已注册,node_repl 可用。安装完成后必须彻底新建一个对话,因为安装线程不会自动获得刚加入的 MCP 工具。
本文制作时实际验证了桌面版内置 Codex CLI 的plugin marketplace与mcp login/get/list命令入口,退出码为 0;没有实际安装插件、执行 OAuth 登录或改动用户配置。
四、新建剪辑任务:先读项目,禁止直接“自动成片”
在全新的 Codex 对话中,先上传或明确选择你的自有样片,再发出项目初始化提示词:
使用已安装的 ChatCut 插件处理我提供的口播样片。
项目名:口播粗剪练习-01
目标:保留原意和自然语气,只处理明显口头禅与过长停顿。
边界:暂时不要加音乐、B-roll、转场、动态图形,不生成任何付费素材,不导出,不发布。
第一步只做检查:
1. 读取当前 ChatCut 项目、素材和时间线的真实状态;不要猜测素材 ID、轨道或时码。
2. 如果素材尚未导入,告诉我应该在界面的哪个位置上传,不要声称已上传。
3. 请求语音转写并等待完成。
4. 基于转写列出候选删减项:原文、起止时码、删减理由、可能影响。
5. 不修改时间线,等我逐项确认。
这段提示词最重要的不是措辞,而是顺序:先读取状态,再转写,再提案,最后才修改。ChatCut 官方插件技能也要求先读取项目并使用真实 ID;口播工作流应先处理 A-roll 语音主线,再考虑字幕、配乐和装饰层。

*图:ChatCut 官方 Editor Overview。剪辑是否发生,应在项目结构、播放器和时间线上共同核对。*
五、审查候选删减:不要把“更紧凑”变成“没有人味”
Agent 返回候选清单后,逐条判断:
| 检查项 | 可以删 | 应保留 |
|---|---|---|
| 口头禅 | 与语义无关且删除后语句仍自然 | 承担转折、强调或思考节奏 |
| 停顿 | 明显失误造成的长空白 | 句间正常呼吸和情绪停顿 |
| 重复 | 完全重复且后一遍更完整 | 为听众理解而有意复述 |
| 语气 | 不影响人物表达的杂音 | 构成个人风格的自然语气 |
确认时不要只回复“可以”。用可审计的指令限定范围:
我只批准候选项 2、4、5。
请在修改前保存当前版本;然后只应用这三项,不处理其他位置,不改变句子顺序,不补 B-roll、音乐、转场或动态图形。修改后:
1. 重新读取时间线,报告实际发生变化的片段和新时长;
2. 检查相邻片段是否重叠、断句或出现突兀跳切;
3. 提供编辑后时间线的可见画面或渲染截图作为第二种证据;
4. 如果无法提供视觉证据,明确说“未完成视觉核验”,不要宣称剪辑已验证。
这里采用“双证据”验收:一份是时间线/轨道的结构数据,一份是播放器或渲染后的可见结果。只看源素材截图不能证明编辑已经作用到时间线上。
六、确认粗剪后再生成字幕
先完整播放一遍粗剪。确认没有吞字、错序、音画中断,再让 Agent 增加字幕:
粗剪内容已经人工确认。现在只添加简体中文字幕,不做其他编辑。
要求:
- 字幕内容以当前剪辑后的转写为准,不恢复已经删除的句子;
- 优先保证断句自然、人物姓名和产品名正确;
- 每行不要过长,避免遮挡人物面部和画面核心信息;
- 完成后抽查开头、中段、结尾各一处,并报告发现和修正的错字;
- 仍然不要导出。
如果出现专有名词错误,直接给替换映射,例如“Chat Cat → ChatCut”,不要要求 Agent 重做整个转写。字幕属于时间线中的一层,仍需在播放器中逐段检查,而不是看到“任务完成”就通过。
七、最后一道门:人工批准后才导出
只有下面四项全部通过,才进入导出:
- 内容原意没有变化;
- 片段衔接、声音和字幕已经人工播放检查;
- 项目中没有未经授权的生成素材或第三方素材;
- 画幅、分辨率、帧率和文件用途已经明确。
然后发出独立的导出提示词:
我已人工确认当前时间线,可以导出。
请先复述导出参数,等我再次确认后再提交:
- 类型:视频
- 编码/容器:H.264 / MP4
- 分辨率:1080p
- 帧率:与源素材一致;如果无法确定,先报告,不要猜测
- 范围:当前已确认时间线
提交后持续跟踪导出状态,返回成功或失败的真实结果。不要自动发布到任何平台。
ChatCut 官方编辑器文档称可导出最高 1080p、60fps,并支持视频、音频或动态图形;实际可选项仍应以当前账户和导出窗口为准。

*图:ChatCut 官方 Editor Overview 的导出窗口。参数可见不等于导出已经成功,仍需等待任务结果。*
八、常见失败与排查顺序
1. 安装后当前对话找不到 ChatCut 工具
先新建对话,而不是重复安装。官方说明明确指出,安装线程不会动态获得新工具。新对话仍不可用,再检查插件 enabled、ChatCut MCP 和 node_repl 状态。
2. mcp login chatcut 没完成
检查是否打开了真实 OAuth 页面、是否登录了正确账户。不要把 API Key、Cookie 或登录回调地址复制到文章、群聊或工单中。授权失败时回到 mcp get chatcut --json 查看注册状态,而不是反复添加 marketplace。
3. 转写一直没有结果
确认素材确实包含清晰人声、上传已完成,并让 Agent 查询转写任务进度。不要因为一次状态查询仍为处理中,就立即判定任务卡死;也不要在没有转写证据时让 Agent 凭印象删词。
4. 剪完后语句突兀
最常见原因是删得太狠或切点压到相邻音节。回退到保存版本,只恢复有问题的候选项,再保留更长的呼吸边界。错误做法是为了遮住跳切,未经同意自动叠加 B-roll。
5. Agent 说“已完成”,但看不到变化
要求它重新读取项目结构,并给出时间线可见证据。没有结构变化和可见结果这两类证据,就把状态记为“未验证”,不要进入导出。
6. 一开始就让它“做成一条爆款视频”
这种提示词缺少目标受众、保留信息、删减边界、画幅和验收标准,Agent 只能替你猜。更可靠的做法是把任务拆成:读取 → 转写 → 候选剪点 → 人工确认 → 粗剪 → 可见核验 → 字幕 → 最终批准 → 导出。
九、可以复制给自己 AI Agent 的完整任务块
你要使用 ChatCut 插件协助我完成一段自有口播视频的保守粗剪。
最终成果:一条保留原意、删去已确认口头禅和长停顿、带简体中文字幕的可编辑时间线。默认不导出。
执行规则:
1. 先读取项目、素材、转写和时间线真实状态,不猜 ID、时码或完成状态。
2. 素材未上传时,只给具体上传指引;未经我确认不上传其他文件。
3. 先完成转写,再按“原文 / 时码 / 原因 / 风险”列候选删减项;此时不得修改时间线。
4. 只应用我明确批准的候选项。不要顺手加音乐、B-roll、转场、动态图形或生成式素材。
5. 修改后同时提供项目结构证据与时间线/渲染可见证据;缺一项就标记为未验证。
6. 发现片段重叠、断句、吞字或语义改变时停止,回报问题,不要强行修补。
7. 粗剪经我人工播放确认后,才添加字幕并抽查首、中、尾。
8. 导出是独立阶段。只有我明确说“批准导出”后,才复述参数并再次等待确认;绝不自动发布。
9. 所有未执行的动作明确写“未执行”,所有失败保留真实错误。
开始时先复述:当前输入、目标、边界、需要我确认的第一项决定。
ChatCut 的真正价值,不是替你消灭剪辑软件,而是把“读素材、提剪点、改时间线、做验证”变成可以委派的工作流。第一次使用时,最值得建立的习惯也不是追求一步成片,而是让每次修改都能回答三个问题:改了什么、依据是什么、我怎样亲眼确认。
相关官方入口:ChatCut 插件页|官方安装说明|官方插件仓库|编辑器说明|使用政策
用 AI Agent 做可持续迭代的网页原型:React、SQLite 与项目规范入门
面向刚开始使用编码 Agent 的产品、设计与项目人员:从一个真实长期维护原型的经验和教训出发,用 React、Express 与 SQLite 做出可运行的需求评审台账,并用事实源文档、项目级技能和验证清单约束后续修改。
让 AI Agent 先读懂代码再动手:CodeGraph 与代码知识图谱实战
从 Token 消耗、调用链和影响范围出发,拆解 CodeGraph 的本地图谱原理,对比 Serena、Graphify 等工具,并以 Windows + Codex 为主线说明跨平台、多 Agent 的安全接入、验证、测量与风险控制流程。
用 AI Agent 从零生成网页原型:静态 HTML、Vue、React 怎么选,才能少返工、少烧 Token
先分清页面组件化与数据边界两条轴线,再比较静态 HTML、Vue、React、Mock、MSW 与 SQLite 的首次和长期 Token 成本,按原型生命周期选择更少返工的架构。