YouTube 视频转口播稿:用 Whisper 和 Buda 跑完整流程
在 Buda AI Marketplace 安装 buda-youtube-to-script,用 Whisper 把 YouTube 视频转成逐字稿和可继续修改的口播脚本。

看到一条值得研究的 YouTube 视频很容易,把它变成真正能继续创作的材料却很麻烦。
在写自己的文章或口播稿之前,通常还要下载视频、提取音频、运行 Whisper 转写、定位关键段落,再根据新的受众和角度重新组织内容。真正需要判断的部分可能只花十分钟,前后的文件处理却会拖很久。
Buda 可以把这串动作变成一个由 Agent 执行的完整任务。在 Buda AI Marketplace 安装 buda-youtube-to-script Skill,把支持的视频链接发给 Agent,它就能下载媒体、调用 Whisper、套用口播稿模板,并把工作文件保存在同一个项目里。
这并不意味着可以换种说法搬运别人的视频。它提供的是一套可核对的创作材料,让人从难搜索的视频直接进入选材、查证和原创表达。
从 YouTube 视频到口播稿的完整流程
这个 Skill 保存的不是一句 Prompt,而是一条固定工作路径:
- 使用内置的
yt-dlp辅助程序下载源视频和 MP3 音频。 - 调用 Whisper 把音频转成文字。
- 读取转写稿,套用结构化口播模板。
- 生成开场 hook、内容时间线、完整口播和标题选项。
- 把源视频、MP3、转写稿和最终脚本保存为持久文件。

Prompt 可以描述目标,但不会自动保证下载、转写、模板、文件命名和结果交付每次都按同一顺序完成。Skill 把方法保存下来,Agent 才能稳定重复执行。
第一步:先确认来源和使用目的
先确认你有权处理这条视频。视频公开可看,不等于可以直接复刻原作者的表达。
在 Agent 开始前,先决定你需要什么:
- 便于研究的逐字稿
- 内部摘要
- 一段新的短视频口播稿
- 基于部分事实写成的文章
- 回应或评论视频的研究笔记
同时说明受众、输出语言、创作角度和目标时长。Skill 默认生成英文、60–90 秒的短视频口播稿,但你可以明确要求中文、其他长度或特定观点。
一条有效的指令可以这样写:
把这条视频整理成一段 60 秒中文口播稿,受众是中小企业老板。保留核心事实,重点解释它会怎样影响实际经营。
URL 告诉 Agent 从哪里开始,创作要求决定它最后应该写出什么。
第二步:从 Buda AI Marketplace 安装 Skill
打开 Buda AI 的 Marketplace,搜索 buda-youtube-to-script,把它安装到负责内容工作的 Agent。
这个 Skill 已经把下载程序、Whisper 转写和口播模板放在一起,不需要再安装另一个下载 Skill,也不用每次重新解释完整步骤。
安装后,Agent 收到视频 URL 和脚本要求,就能识别并执行这条工作流。
你可以在 Buda AI Marketplace 中查看并安装 Skills。
第三步:发送 URL,同时给出创作要求
只发 URL,可以触发默认流程;URL 加一份清楚的 brief,结果会更好。
建议同时说明:
- 写给谁看
- 使用什么语言
- 发布到哪个平台
- 大概多长
- 你想增加什么角度
- 哪些事实或表述必须重点核对
随后,Agent 会自己推进操作:准备项目目录、下载源媒体、提取 MP3、调用 Whisper、读取转写稿,并写出新的口播脚本。
人可以在 Agent Session 里看到执行过程,不必守着多个工具,在每一步结束后手工搬文件。
第四步:分别审核四类文件
一条可靠的内容工作流,应该把来源依据和重新创作分开保存。

Skill 默认保留四类结果:
- 源视频:保留视觉上下文,随时回到原始画面。
- MP3 音频:方便回听发音、语气和前后语境。
- Whisper 转写稿:提供可搜索的文字依据,用来定位观点、人名和数字。
- 口播脚本:提供开场、内容推进、完整口播和标题选项,方便继续修改。
不要把它们合并成一个文件。转写稿是来源证据,口播稿是重新组织后的解释。两者都保留,查错和改稿才有依据。
Whisper 转写稿不等于可发布的脚本
Whisper 解决的是语音识别。它不会替你判断某个观点是否可靠、读者需要什么背景,或者你应该加入什么原创判断。
逐字稿通常包含重复、停顿、口头填充词和识别错误。人名、数字、产品名和引语必须回到源视频核对。真正能录制的脚本还需要新结构:为什么读者要听下去,哪些内容可以压缩,哪些背景必须补充,最后的结论是否属于你。
发布或录制前,至少检查:
- 人名、数字和专有名词是否正确
- 是否保留了原作者的真实意思
- 哪些表达仍然过于接近原视频
- 哪些事实需要第二个来源佐证
- 你增加了什么经验、判断或解释
- 开场和时长是否适合目标平台
Agent 接走重复执行,人仍然对版权、准确性、取舍和最终表达负责。
哪些场景最适合这条工作流
当视频是长期内容来源,而不是偶尔处理一次时,这个 Skill 最有价值:
- 把产品演示整理成短视频脚本
- 把访谈变成可搜索的研究材料
- 从 Webinar 或演讲中提取方法
- 根据公开发布会准备评论内容
- 在获得授权后,把视频本地化给另一类受众
- 建立可搜索的视频逐字稿资料库
如果视频需要登录、禁止下载、音质差到无法可靠识别,或你没有相应使用权,Agent 应该停止,并请你提供有权处理的文件或更换来源。
从一次成功运行,变成可重复的内容系统
第一层收益是快:一个 URL 变成有组织的来源材料和可编辑脚本。
更重要的是连续性。源视频、转写稿、模板和脚本可以留在 Agent 的同一个项目里,审核记录也不会散落。下一次再处理视频,不必重新拼接工具和指令。
这就是“让 AI 回答一次”和“管理一条 Agent 工作流”的区别。稳定步骤交给机器执行,重要判断留给对结果负责的人。
常见问题
Buda 能自动把 YouTube 视频变成口播稿吗?
可以。安装 buda-youtube-to-script 后,Buda Agent 可以下载受支持的视频、提取音频、用 Whisper 转写,再根据模板生成口播稿。发布前仍需人工检查版权、事实和原创性。
这个 Skill 只能处理 YouTube 吗?
它面向 YouTube 及下载程序支持的其他视频 URL。登录、地区限制、私密视频和下载保护可能导致处理失败。
Skill 会生成哪些文件?
默认保留源视频、MP3 音频、Whisper 转写稿和最终口播脚本。
可以生成中文或其他语言吗?
可以。默认输出英文,但可以在指令中指定其他语言。人名、术语和本地化表达仍需人工审核。
Whisper 逐字稿可以直接发布吗?
不可以。逐字稿只是识别出来的语音。可发布脚本还需要事实核查、内容取舍、重新组织、原创判断和版权检查。
打开 Buda AI Marketplace,搜索 buda-youtube-to-script,把它安装到自己的 Agent。发送视频 URL 时,同时说明受众、角度、语言和时长,然后把源内容和新脚本放在一起审核,再开始录制。