用 ChatGPT、MCP 與 Canva
共同完成一支可交付的 MV
從需求討論、音訊與歌詞對齊,到 Canva 編輯、人工修飾及客戶自行接手。
先定義輸出,不先選工具
這次到底要做出什麼?
最終成品不是一支 AI 自動生成的影片,而是一份客戶能繼續修改的照片輪播 MV 專案。
可編輯的 Canva MV
- 照片、音訊、字幕三層清楚
- 字幕採原生文字元件
- 客戶可自行換照片與改字
- 可輸出 MP4,也可分享範本
關鍵決策
為什麼選 Canva,而不是剪映?
不是因為 Canva 的剪輯能力比剪映強。
是因為這次要驗證「外部 AI 能否透過 MCP 參與真實製作」,而不是只使用剪映內建的 AI。端到端工作流
從聊天到客戶交付
角色不是重疊,而是接力
ChatGPT 與 MCP 分別做了什麼?
真實執行紀錄
這支 MV 是怎麼一步步完成的?
確認成品規格
先確認是照片輪播、指定音訊、正式歌詞、逐句字幕,以及客戶日後可修改的 Canva 專案。
比較 Canva 與剪映
剪映更像專業剪輯器;Canva 更適合本次 MCP 協作、線上分享與客戶接手。
讀取素材並建立專案
轉入 ChatGPT Work,在指定工作資料夾整理音訊、歌詞、照片、輸出與交付檔案,保留可追溯來源。
語音辨識與歌詞對齊
先用辨識結果取得可靠時間區間,再以正式歌詞取代辨識錯字,建立 46 句逐句時間軸。
輸出可交換資料
產生 SRT、CSV、JSON 與智慧型導讀報表,讓字幕不只存在 Canva 裡。
進入 Canva 建立與調整字幕
ChatGPT 決定要改什麼,MCP 執行點擊、輸入、選取、套用效果、檢查與儲存。
播放檢查與反覆修正
人類指出後段字幕消失、重複、位置不佳或換句過早,AI 再逐一修正與檢查。
備份、人工修飾與交付
建立版本副本,人類完成少量位置微調,再用 Template link 讓客戶建立自己的可編輯副本。
高品質來自修正,不是一次生成
遇到哪些問題?怎麼解?
字幕辨識文字不準
保留辨識的時間區間,以正式歌詞替換文字。
後段字幕重複或消失
以 46 句標準清單逐句計數,檢查每句是否存在且只出現於正確區間。
字幕層變得太複雜
回到三層模型:音訊、照片、原生文字。取消額外遮罩與不必要字軌。
灰底透明、破碎或難修改
不新增灰色矩形,直接使用 Canva 文字元件的 Effects → Background。
換句太早
把「唱完才消失」列為人工驗收規則,時間對齊略提前可以,但不能提早結束。
Canva 原生辨識不必負責所有事情。它可以提供時間參考;ChatGPT 以正式歌詞與既有時間軸做更好的匹配;人類則決定「聽起來和看起來是否正確」。
從作品變成可交付服務
如何讓客戶自行存檔與編修?
Master Design
母版只由製作者管理,用於後續改版與再次交付。
Template link
不是開放原檔共同編輯,而是讓客戶建立自己的副本。
Editable Copy
客戶可以替換照片、修改文字、微調時間並輸出影片。
- ShareClick Share in the top-right corner.
- See allOpen all sharing options.
- Template linkCreate and copy the template link.
- Use this templateThe client creates an independent editable copy.
不要使用 Anyone with the link → Can edit:那會讓客戶直接改到同一份設計,不符合母版管理原則。
不是只有影片
這次 ChatGPT 實際產出了什麼?
查看內嵌的原始 SRT 摘要
1 00:00:16,140 --> 00:00:19,580 我們從老台南走來 2 00:00:19,800 --> 00:00:23,460 一件一件說著光彩 ... 45 00:03:55,720 --> 00:03:59,200 我們從老台南走來 46 00:03:59,200 --> 00:04:04,760 把真心留在現在
下次可以直接沿用
可重複的製作檢查表
完成 0 / 8