臺南市旅館商業同業公會會員大會合照
完整工作流教學

用 ChatGPT、MCP 與 Canva
共同完成一支可交付的 MV

從需求討論、音訊與歌詞對齊,到 Canva 編輯、人工修飾及客戶自行接手。

46 句字幕 4:17 影片長度 33 張素材 3 個核心圖層
01

先定義輸出,不先選工具

這次到底要做出什麼?

最終成品不是一支 AI 自動生成的影片,而是一份客戶能繼續修改的照片輪播 MV 專案。

輸入 A照片輪播素材活動照片可隨時替換
輸入 B指定音訊保留客戶提供的完整歌曲
輸入 C正式歌詞文字正確,時間依演唱對齊
最終輸出

可編輯的 Canva MV

  • 照片、音訊、字幕三層清楚
  • 字幕採原生文字元件
  • 客戶可自行換照片與改字
  • 可輸出 MP4,也可分享範本
產品規格先於工具: 照片可以換、音訊不可換、歌詞內容必須正確、字幕要跟唱歌同步、最後交付必須可編輯。
02

關鍵決策

為什麼選 Canva,而不是剪映?

不是因為 Canva 的剪輯能力比剪映強。

是因為這次要驗證「外部 AI 能否透過 MCP 參與真實製作」,而不是只使用剪映內建的 AI。
比較面向 剪映 Canva(本案選擇)
影片剪輯較完整、成熟足以完成照片輪播 MV
AI 來源主要使用平台內建 AIChatGPT 可在平台外思考與協調
MCP 協作目前不是本案的主要入口可讓 AI 實際進入編輯流程
客戶修改需要理解影片剪輯時間軸換照片、改文字較直覺
交付方式偏成品或專案檔Template link 建立個人副本
研究價值把 MV 做出來驗證人、AI、MCP 的協作模型
剪映內建 AI人在工具裡使用工具提供的能力
ChatGPT + MCP + Canva外部 AI 參與理解、執行、檢查與修正
03

端到端工作流

從聊天到客戶交付

思考層 ChatGPT 理解目標、比對資料、決定下一步
工具層 Work 處理檔案,MCP 把操作送進 Canva
治理層 人類檢查意義、節奏、視覺與交付風險
04

角色不是重疊,而是接力

ChatGPT 與 MCP 分別做了什麼?

語音層指定音檔,維持完整長度與內容
照片層輪播素材,可以由客戶自行替換
文字層46 個原生文字元件,逐句進出,沒有額外遮罩軌
05

真實執行紀錄

這支 MV 是怎麼一步步完成的?

顯示:
01
Chat人類

確認成品規格

先確認是照片輪播、指定音訊、正式歌詞、逐句字幕,以及客戶日後可修改的 Canva 專案。

產出:明確的輸入、輸出、不可變條件與可變條件。這一步避免直接打開剪輯工具後才重新決定方向。
02
Chat人類

比較 Canva 與剪映

剪映更像專業剪輯器;Canva 更適合本次 MCP 協作、線上分享與客戶接手。

決策:Canva 是本案的呈現與交付端。選擇它不是功能競賽,而是工作流設計。
03
Work

讀取素材並建立專案

轉入 ChatGPT Work,在指定工作資料夾整理音訊、歌詞、照片、輸出與交付檔案,保留可追溯來源。

產出:固定資料夾結構、照片索引、音訊來源、歌詞原文及版本化交付目錄。
04
WorkChatGPT

語音辨識與歌詞對齊

先用辨識結果取得可靠時間區間,再以正式歌詞取代辨識錯字,建立 46 句逐句時間軸。

關鍵方法:辨識模型負責「時間」,正式歌詞負責「文字」。附近人聲與既有時間軸共同作為比對線索,不要求卡拉 OK 等級的逐字對齊。
05
Work

輸出可交換資料

產生 SRT、CSV、JSON 與智慧型導讀報表,讓字幕不只存在 Canva 裡。

產出:46 句 SRT、時間軸資料、匹配信心、七段敘事結構、素材索引及人工檢查優先度。
06
MCPChatGPT

進入 Canva 建立與調整字幕

ChatGPT 決定要改什麼,MCP 執行點擊、輸入、選取、套用效果、檢查與儲存。

實際操作:檢查字幕數量、修正缺漏與重複、維持單一字幕軌、使用原生文字背景效果、固定字級與底部距離。
07
人類MCP

播放檢查與反覆修正

人類指出後段字幕消失、重複、位置不佳或換句過早,AI 再逐一修正與檢查。

驗收規則:上一句必須唱完才消失;下一句才接續出現。最佳顯示兩行,必要時三行,但時間軸仍維持單一字幕層。
08
MCP人類

備份、人工修飾與交付

建立版本副本,人類完成少量位置微調,再用 Template link 讓客戶建立自己的可編輯副本。

成果:母版不動、人工調整版獨立保存、客戶副本互不干擾。客戶可以換照片、改字幕並自行輸出。
06

高品質來自修正,不是一次生成

遇到哪些問題?怎麼解?

Canva 編輯畫面中字幕重複的實際截圖
實際除錯畫面:後段曾出現大量重複字幕,必須回到文字內容與時間區間重新匹配。
01

字幕辨識文字不準

保留辨識的時間區間,以正式歌詞替換文字。

02

後段字幕重複或消失

以 46 句標準清單逐句計數,檢查每句是否存在且只出現於正確區間。

03

字幕層變得太複雜

回到三層模型:音訊、照片、原生文字。取消額外遮罩與不必要字軌。

04

灰底透明、破碎或難修改

不新增灰色矩形,直接使用 Canva 文字元件的 Effects → Background。

05

換句太早

把「唱完才消失」列為人工驗收規則,時間對齊略提前可以,但不能提早結束。

這次最重要的工程經驗

Canva 原生辨識不必負責所有事情。它可以提供時間參考;ChatGPT 以正式歌詞與既有時間軸做更好的匹配;人類則決定「聽起來和看起來是否正確」。

07

從作品變成可交付服務

如何讓客戶自行存檔與編修?

你保留

Master Design

母版只由製作者管理,用於後續改版與再次交付。

Canva 分享

Template link

不是開放原檔共同編輯,而是讓客戶建立自己的副本。

客戶取得

Editable Copy

客戶可以替換照片、修改文字、微調時間並輸出影片。

  1. ShareClick Share in the top-right corner.
  2. See allOpen all sharing options.
  3. Template linkCreate and copy the template link.
  4. Use this templateThe client creates an independent editable copy.

不要使用 Anyone with the link → Can edit:那會讓客戶直接改到同一份設計,不符合母版管理原則。

08

不是只有影片

這次 ChatGPT 實際產出了什麼?

查看內嵌的原始 SRT 摘要
1
00:00:16,140 --> 00:00:19,580
我們從老台南走來

2
00:00:19,800 --> 00:00:23,460
一件一件說著光彩

...

45
00:03:55,720 --> 00:03:59,200
我們從老台南走來

46
00:03:59,200 --> 00:04:04,760
把真心留在現在
智慧型導讀報表預覽
AI 除了操作 Canva,也把字幕與製作知識整理成可稽核、可重用的資料資產。

下次可以直接沿用

可重複的製作檢查表

完成 0 / 8