YouTube 影片轉口播稿:用 Whisper 和 Buda 跑完整流程
在 Buda AI Marketplace 安裝 buda-youtube-to-script,用 Whisper 把 YouTube 影片轉成逐字稿與可繼續修改的口播腳本。

看到一支值得研究的 YouTube 影片很容易,把它變成真正能繼續創作的材料卻很麻煩。
在寫自己的文章或口播稿之前,通常還要下載影片、擷取音訊、執行 Whisper 轉寫、定位關鍵段落,再依新的受眾與角度重新組織內容。真正需要判斷的部分可能只花十分鐘,前後的檔案處理卻會拖很久。
Buda 可以把這串動作變成一個由 Agent 執行的完整任務。在 Buda AI Marketplace 安裝 buda-youtube-to-script Skill,把支援的影片連結交給 Agent,它就能下載媒體、呼叫 Whisper、套用口播稿模板,並把工作檔案保存在同一個專案裡。
這並不代表可以換種說法搬運別人的影片。它提供的是一套可核對的創作材料,讓人從難搜尋的影片直接進入選材、查證與原創表達。
從 YouTube 影片到口播稿的完整流程
這個 Skill 保存的不是一句 Prompt,而是一條固定工作路徑:
- 使用內建的
yt-dlp輔助程式下載來源影片與 MP3 音訊。 - 呼叫 Whisper 把音訊轉成文字。
- 讀取轉寫稿,套用結構化口播模板。
- 產生開場 hook、內容時間線、完整口播與標題選項。
- 把來源影片、MP3、轉寫稿與最終腳本保存為持久檔案。

Prompt 可以描述目標,但不會自動保證下載、轉寫、模板、檔案命名和結果交付每次都照同一順序完成。Skill 把方法保存下來,Agent 才能穩定重複執行。
第一步:先確認來源與使用目的
先確認你有權處理這支影片。影片公開可看,不等於可以直接複製原作者的表達。
在 Agent 開始前,先決定你需要什麼:研究逐字稿、內部摘要、新的短影音口播稿、根據部分事實寫成的文章,或回應影片的研究筆記。
同時說明受眾、輸出語言、創作角度與目標長度。Skill 預設產生英文、60–90 秒的短影音口播稿,但你可以明確要求繁體中文、其他長度或特定觀點。
例如:
把這支影片整理成一段 60 秒繁體中文口播稿,受眾是中小企業經營者。保留核心事實,重點解釋它會怎樣影響實際營運。
URL 告訴 Agent 從哪裡開始,創作要求決定它最後應該寫出什麼。
第二步:從 Buda AI Marketplace 安裝 Skill
打開 Buda AI 的 Marketplace,搜尋 buda-youtube-to-script,把它安裝到負責內容工作的 Agent。
這個 Skill 已經把下載程式、Whisper 轉寫與口播模板放在一起,不需要再安裝另一個下載 Skill,也不用每次重新解釋完整步驟。
安裝後,Agent 收到影片 URL 與腳本要求,就能辨識並執行這條工作流。
你可以在 Buda AI Marketplace 中查看並安裝 Skills。
第三步:傳送 URL,同時給出創作要求
只傳 URL 可以觸發預設流程;URL 加上一份清楚的 brief,結果會更好。
建議同時說明受眾、輸出語言、發布平台、預計長度、要加入的角度,以及哪些事實必須特別核對。
接著,Agent 會自行準備專案目錄、下載來源媒體、擷取 MP3、呼叫 Whisper、讀取轉寫稿,並寫出新的口播腳本。
人可以在 Agent Session 裡看到執行過程,不必守著多個工具,在每一步結束後手動搬檔案。
第四步:分別審核四類檔案
可靠的內容工作流,應該把來源依據和重新創作分開保存。

Skill 預設保留四類結果:
- 來源影片:保留視覺脈絡,隨時回到原始畫面。
- MP3 音訊:方便重聽發音、語氣和前後語境。
- Whisper 轉寫稿:提供可搜尋的文字依據,用來定位觀點、人名與數字。
- 口播腳本:提供開場、內容推進、完整口播與標題選項,方便繼續修改。
不要把它們合併成一個檔案。轉寫稿是來源證據,口播稿是重新組織後的解釋。兩者都保留,查錯與改稿才有依據。
Whisper 轉寫稿不等於可發布的腳本
Whisper 解決的是語音辨識。它不會替你判斷某個觀點是否可靠、讀者需要什麼背景,或你應該加入什麼原創判斷。
逐字稿通常包含重複、停頓、口頭填充詞和辨識錯誤。人名、數字、產品名稱與引言必須回到來源影片核對。真正能錄製的腳本還需要新結構:為什麼觀眾要聽下去、哪些內容可以壓縮、哪些背景必須補充,以及最後的結論是否屬於你。
發布或錄製前,至少檢查:
- 人名、數字與專有名詞是否正確
- 是否保留原作者的真實意思
- 哪些表達仍過於接近原影片
- 哪些事實需要第二個來源佐證
- 你增加了什麼經驗、判斷或解釋
- 開場與長度是否適合目標平台
Agent 接手重複執行,人仍然對版權、準確性、取捨與最終表達負責。
哪些情境最適合這條工作流
當影片是長期內容來源,而不是偶爾處理一次時,這個 Skill 最有價值:
- 把產品示範整理成短影音腳本
- 把訪談變成可搜尋的研究材料
- 從 Webinar 或演講中擷取方法
- 根據公開發布會準備評論內容
- 在取得授權後,把影片在地化給另一類受眾
- 建立可搜尋的影片逐字稿資料庫
如果影片需要登入、禁止下載、音質差到無法可靠辨識,或你沒有相應使用權,Agent 應該停止,請你提供有權處理的檔案或更換來源。
從一次成功執行,變成可重複的內容系統
第一層收益是快:一個 URL 變成有組織的來源材料和可編輯腳本。
更重要的是連續性。來源影片、轉寫稿、模板與腳本可以留在 Agent 的同一個專案裡,審核記錄也不會散落。下一次再處理影片,不必重新拼接工具與指令。
這就是「讓 AI 回答一次」和「管理一條 Agent 工作流」的差別。穩定步驟交給機器執行,重要判斷留給對結果負責的人。
常見問題
Buda 能自動把 YouTube 影片變成口播稿嗎?
可以。安裝 buda-youtube-to-script 後,Buda Agent 可以下載受支援的影片、擷取音訊、用 Whisper 轉寫,再根據模板產生口播稿。發布前仍需人工檢查版權、事實與原創性。
這個 Skill 只能處理 YouTube 嗎?
它面向 YouTube 與下載程式支援的其他影片 URL。登入、地區限制、私密影片與下載保護可能導致處理失敗。
Skill 會產生哪些檔案?
預設保留來源影片、MP3 音訊、Whisper 轉寫稿與最終口播腳本。
可以產生繁體中文或其他語言嗎?
可以。預設輸出英文,但可以在指令中指定其他語言。人名、術語與在地化表達仍需人工審核。
Whisper 逐字稿可以直接發布嗎?
不可以。逐字稿只是辨識出的語音。可發布腳本還需要事實查核、內容取捨、重新組織、原創判斷與版權檢查。
打開 Buda AI Marketplace,搜尋 buda-youtube-to-script,把它安裝到自己的 Agent。傳送影片 URL 時,同時說明受眾、角度、語言與長度,再把來源內容和新腳本放在一起審核後開始錄製。