YouTube 视频转口播稿:用 Whisper 和 Buda 跑完整流程

在 Buda AI Marketplace 安装 buda-youtube-to-script,用 Whisper 把 YouTube 视频转成逐字稿和可继续修改的口播脚本。

Buda Team
返回博客
YouTube 视频转口播稿:用 Whisper 和 Buda 跑完整流程

看到一条值得研究的 YouTube 视频很容易,把它变成真正能继续创作的材料却很麻烦。

在写自己的文章或口播稿之前,通常还要下载视频、提取音频、运行 Whisper 转写、定位关键段落,再根据新的受众和角度重新组织内容。真正需要判断的部分可能只花十分钟,前后的文件处理却会拖很久。

Buda 可以把这串动作变成一个由 Agent 执行的完整任务。在 Buda AI Marketplace 安装 buda-youtube-to-script Skill,把支持的视频链接发给 Agent,它就能下载媒体、调用 Whisper、套用口播稿模板,并把工作文件保存在同一个项目里。

这并不意味着可以换种说法搬运别人的视频。它提供的是一套可核对的创作材料,让人从难搜索的视频直接进入选材、查证和原创表达。

从 YouTube 视频到口播稿的完整流程

这个 Skill 保存的不是一句 Prompt,而是一条固定工作路径:

  1. 使用内置的 yt-dlp 辅助程序下载源视频和 MP3 音频。
  2. 调用 Whisper 把音频转成文字。
  3. 读取转写稿,套用结构化口播模板。
  4. 生成开场 hook、内容时间线、完整口播和标题选项。
  5. 把源视频、MP3、转写稿和最终脚本保存为持久文件。

用 Whisper 和 Buda AI 把 YouTube 视频转成口播稿的完整流程

Prompt 可以描述目标,但不会自动保证下载、转写、模板、文件命名和结果交付每次都按同一顺序完成。Skill 把方法保存下来,Agent 才能稳定重复执行。

第一步:先确认来源和使用目的

先确认你有权处理这条视频。视频公开可看,不等于可以直接复刻原作者的表达。

在 Agent 开始前,先决定你需要什么:

  • 便于研究的逐字稿
  • 内部摘要
  • 一段新的短视频口播稿
  • 基于部分事实写成的文章
  • 回应或评论视频的研究笔记

同时说明受众、输出语言、创作角度和目标时长。Skill 默认生成英文、60–90 秒的短视频口播稿,但你可以明确要求中文、其他长度或特定观点。

一条有效的指令可以这样写:

把这条视频整理成一段 60 秒中文口播稿,受众是中小企业老板。保留核心事实,重点解释它会怎样影响实际经营。

URL 告诉 Agent 从哪里开始,创作要求决定它最后应该写出什么。

第二步:从 Buda AI Marketplace 安装 Skill

打开 Buda AI 的 Marketplace,搜索 buda-youtube-to-script,把它安装到负责内容工作的 Agent。

这个 Skill 已经把下载程序、Whisper 转写和口播模板放在一起,不需要再安装另一个下载 Skill,也不用每次重新解释完整步骤。

安装后,Agent 收到视频 URL 和脚本要求,就能识别并执行这条工作流。

你可以在 Buda AI Marketplace 中查看并安装 Skills。

第三步:发送 URL,同时给出创作要求

只发 URL,可以触发默认流程;URL 加一份清楚的 brief,结果会更好。

建议同时说明:

  • 写给谁看
  • 使用什么语言
  • 发布到哪个平台
  • 大概多长
  • 你想增加什么角度
  • 哪些事实或表述必须重点核对

随后,Agent 会自己推进操作:准备项目目录、下载源媒体、提取 MP3、调用 Whisper、读取转写稿,并写出新的口播脚本。

人可以在 Agent Session 里看到执行过程,不必守着多个工具,在每一步结束后手工搬文件。

第四步:分别审核四类文件

一条可靠的内容工作流,应该把来源依据和重新创作分开保存。

YouTube 视频转口播稿产生的四类文件与人工审核边界

Skill 默认保留四类结果:

  • 源视频:保留视觉上下文,随时回到原始画面。
  • MP3 音频:方便回听发音、语气和前后语境。
  • Whisper 转写稿:提供可搜索的文字依据,用来定位观点、人名和数字。
  • 口播脚本:提供开场、内容推进、完整口播和标题选项,方便继续修改。

不要把它们合并成一个文件。转写稿是来源证据,口播稿是重新组织后的解释。两者都保留,查错和改稿才有依据。

Whisper 转写稿不等于可发布的脚本

Whisper 解决的是语音识别。它不会替你判断某个观点是否可靠、读者需要什么背景,或者你应该加入什么原创判断。

逐字稿通常包含重复、停顿、口头填充词和识别错误。人名、数字、产品名和引语必须回到源视频核对。真正能录制的脚本还需要新结构:为什么读者要听下去,哪些内容可以压缩,哪些背景必须补充,最后的结论是否属于你。

发布或录制前,至少检查:

  • 人名、数字和专有名词是否正确
  • 是否保留了原作者的真实意思
  • 哪些表达仍然过于接近原视频
  • 哪些事实需要第二个来源佐证
  • 你增加了什么经验、判断或解释
  • 开场和时长是否适合目标平台

Agent 接走重复执行,人仍然对版权、准确性、取舍和最终表达负责。

哪些场景最适合这条工作流

当视频是长期内容来源,而不是偶尔处理一次时,这个 Skill 最有价值:

  • 把产品演示整理成短视频脚本
  • 把访谈变成可搜索的研究材料
  • 从 Webinar 或演讲中提取方法
  • 根据公开发布会准备评论内容
  • 在获得授权后,把视频本地化给另一类受众
  • 建立可搜索的视频逐字稿资料库

如果视频需要登录、禁止下载、音质差到无法可靠识别,或你没有相应使用权,Agent 应该停止,并请你提供有权处理的文件或更换来源。

从一次成功运行,变成可重复的内容系统

第一层收益是快:一个 URL 变成有组织的来源材料和可编辑脚本。

更重要的是连续性。源视频、转写稿、模板和脚本可以留在 Agent 的同一个项目里,审核记录也不会散落。下一次再处理视频,不必重新拼接工具和指令。

这就是“让 AI 回答一次”和“管理一条 Agent 工作流”的区别。稳定步骤交给机器执行,重要判断留给对结果负责的人。

常见问题

Buda 能自动把 YouTube 视频变成口播稿吗?

可以。安装 buda-youtube-to-script 后,Buda Agent 可以下载受支持的视频、提取音频、用 Whisper 转写,再根据模板生成口播稿。发布前仍需人工检查版权、事实和原创性。

这个 Skill 只能处理 YouTube 吗?

它面向 YouTube 及下载程序支持的其他视频 URL。登录、地区限制、私密视频和下载保护可能导致处理失败。

Skill 会生成哪些文件?

默认保留源视频、MP3 音频、Whisper 转写稿和最终口播脚本。

可以生成中文或其他语言吗?

可以。默认输出英文,但可以在指令中指定其他语言。人名、术语和本地化表达仍需人工审核。

Whisper 逐字稿可以直接发布吗?

不可以。逐字稿只是识别出来的语音。可发布脚本还需要事实核查、内容取舍、重新组织、原创判断和版权检查。

打开 Buda AI Marketplace,搜索 buda-youtube-to-script,把它安装到自己的 Agent。发送视频 URL 时,同时说明受众、角度、语言和时长,然后把源内容和新脚本放在一起审核,再开始录制。