AI 生成影片指令的品質,會直接影響人物一致性、動作自然度、運鏡方式、光影與畫面敘事。最實用的寫法不是堆疊形容詞,而是依序交代「主體、動作、場景、時間、鏡頭、風格、限制條件」。無論使用 Sora、Google Veo、Runway、Kling AI、Adobe Firefly 或 MyEdit,都可以先套用以下公式:主體描述+具體動作+場景環境+攝影機運動+光線色調+影片規格+排除項目。
AI 生成影片指令的核心結構
一段容易被 AI 理解的 Prompt,應該像精簡版分鏡腳本,而不是只有「幫我做一支很有質感的影片」。AI 無法準確判斷「好看、專業、高級」分別代表什麼,因此必須把抽象要求轉換成可觀察的影像元素。
主體描述
先說明畫面的主要人物、動物、商品或物件,包括外觀、服裝、材質、年齡層與所在位置。
例如:「一名約 30 歲的亞洲女性咖啡師,穿著深綠色圍裙,站在木質吧台後方。」這種描述比「一位漂亮的咖啡師」更容易產生穩定結果。
撰寫 AI 生成真人影片指令 時,應描述髮型、服裝、表情、姿勢與動作,但不宜一次加入過多細節。若平台支援圖片參考,使用獲得授權的角色圖片,通常比純文字更容易維持人物一致性。
動作與時間順序
動作必須具體,而且最好按照發生順序撰寫。例如:「她先低頭將熱水緩慢倒入濾杯,接著抬頭看向鏡頭並自然微笑。」這比「咖啡師正在工作」更清楚。
如果同一個鏡頭同時要求人物奔跑、轉身、拿取商品、說話與操作設備,容易出現手指變形、物件穿透及動作跳接。建議每個短片只設定一至兩個主要動作,再透過剪輯組合完整情節。
場景與背景
背景描述可包含地點、時間、天氣、空間材質與氣氛,例如:「清晨的台北巷弄咖啡店,窗外下著小雨,室內有溫暖的鎢絲燈光,玻璃窗上帶有細微水珠。」
避免同時要求互相衝突的環境,例如正午陽光、深夜街景及室內自然光同時存在。背景越複雜,AI 越可能忽略主體或製造不合理物件。
鏡頭與運鏡
明確的攝影語言能提高影片的專業感,常用指令包括:
- 特寫鏡頭(Close-up):強調表情、商品或局部細節。
- 中景(Medium Shot):呈現人物上半身與動作。
- 廣角全景(Wide Shot):交代場景及人物位置。
- 推軌(Dolly In):攝影機向主體靠近。
- 後拉(Dolly Out):攝影機逐漸遠離主體。
- 橫搖(Pan):攝影機由左向右或由右向左轉動。
- 垂直搖攝(Tilt):鏡頭向上或向下移動。
- 跟拍(Tracking Shot):攝影機跟隨移動中的主體。
- 環繞運鏡(Orbit Shot):攝影機繞著主體移動。
- 手持鏡頭(Handheld):產生紀錄片式的輕微晃動。
- 空拍鏡頭(Aerial Shot):從高處呈現完整環境。
- 固定鏡頭(Locked-off Shot):攝影機不移動,適合產品展示。
一個短片不宜塞入太多運鏡。若只生成 5 至 10 秒的影片,使用一種主要運鏡通常比較穩定。
光影、色彩與風格
將「有電影感」拆解成具體條件,例如柔和側光、低對比、淺景深、冷暖色彩對比、自然膚色、35mm 電影鏡頭質感。若是商業商品影片,可改用乾淨棚拍背景、柔光箱照明、清晰材質及緩慢旋轉展示。
若使用知名導演或藝術家的姓名模仿風格,可能涉及平台政策與權利爭議。較安全的方式是描述可觀察特徵,例如「對稱構圖、低飽和色彩、緩慢運鏡」,而不是直接要求模仿特定在世創作者。
五個實用的 AI 生成影片提示詞框架
框架一:電影敘事影片
公式為「角色+事件+地點+時間氣氛+攝影角度+運鏡+光影+規格」。
範例指令:
「一名穿著黃色雨衣的年輕女性走過清晨的台北老街,細雨落在石板路上,路旁店家剛開始營業。攝影機以中景從人物右後方緩慢跟拍,接著微幅推近她的側臉。自然陰天光線、低飽和色彩、寫實電影質感、動作平順、16:9、8 秒,不要字幕、浮水印或背景人物變形。」
框架二:商品廣告影片
公式為「商品外觀+擺放場景+移動方式+材質細節+燈光+廣告風格」。
範例指令:
「一只霧面黑色保溫瓶放在深灰色石材平台中央,瓶身緩慢旋轉,水珠沿著表面滑落。攝影機由標誌特寫平順後拉至完整商品,柔和輪廓光勾勒瓶身曲線,乾淨高級的商業棚拍風格,4K 質感、9:16、6 秒,不要額外文字與多餘物件。」
AI 容易自行改變商標與包裝文字,因此正式廣告應先產生無文字畫面,再用威力導演、Canva、剪映或其他剪輯軟體加入正確品牌資訊。
框架三:AI 生成真人影片
公式為「人物特徵+單一動作+表情變化+背景+鏡頭+自然度限制」。
範例指令:
「一名約 35 歲的亞洲男性講師,短黑髮,穿著淺藍色襯衫,站在明亮簡潔的辦公室內。他面向鏡頭自然說明產品,右手做一次簡單指示動作,神情親切且專業。固定中景鏡頭、自然窗光、真實膚色、嘴部與頭部動作協調、9:16、8 秒,避免手指變形、臉部閃爍與背景跳動。」
製作 AI 生成真人影片 前,應確認真人肖像、聲音及素材使用權。不要冒用公眾人物或未經同意者製作誤導性內容;涉及廣告、新聞或教育用途時,也應清楚揭露 AI 合成性質。
框架四:圖片轉動態影片
公式為「保留原圖元素+允許移動的部分+攝影機動作+禁止改動內容」。
範例指令:
「保留參考圖片中的人物臉部、服裝、建築位置與整體構圖。讓人物頭髮被微風吹動,樹葉輕微搖晃,遠處雲層緩慢移動。攝影機平順向前推進,維持自然透視與寫實光線,不新增人物,不改變五官,不扭曲建築,不產生突然縮放。」
搜尋 AI 圖片生成影片無限制 時要特別注意,主流服務通常受到點數、生成次數、排隊速度、解析度或商用授權限制,真正完全無限制的服務並不常見。所謂 AI 圖片生成影片免費,也可能只提供試用額度、低解析度輸出或帶浮水印版本。
框架五:社群短影音
公式為「前三秒重點+主要畫面+快速但單純的動作+直式比例+預留文字區」。
範例指令:
「一杯冰咖啡在透明玻璃杯中快速形成,冰塊落下後咖啡與牛奶產生清楚分層。前兩秒以液體流動特寫吸引注意,接著鏡頭緩慢後拉呈現完整杯身。明亮自然光、清爽夏日色調、9:16、6 秒,畫面上方保留乾淨空間供後製標題使用,不要直接生成文字。」
六款 AI 影片生成器比較
以下整理依據各服務公開功能定位。模型、免費額度、開放地區、輸出長度與商用條款可能隨時調整,使用前應以官方方案頁面及授權條款為準。
平台功能分析表
| AI 影片生成器 | 主要輸入方式 | 適合用途 | 主要特色 | 使用時注意事項 |
|---|---|---|---|---|
| OpenAI Sora | 文字、圖片等支援方式依目前版本為準 | 敘事短片、概念視覺、分鏡實驗 | 擅長理解場景關係與自然語言描述 | 開放資格、方案及功能會依地區與帳號調整 |
| Google Veo | 文字、圖片,入口可能包括 Gemini、Flow 或相關 Google 服務 | 電影感畫面、廣告概念、影音創作 | 重視提示詞控制、鏡頭語言與影音生成能力 | 模型版本、音訊能力及使用入口並不完全相同 |
| Runway | 文字轉影片、圖片轉影片及編輯工具 | 社群影片、視覺特效、影像延伸 | 工作流程完整,適合生成後繼續編修 | 免費方案通常受點數、輸出或功能限制 |
| Kling AI | 文字轉影片、圖片轉影片 | 人物動作、運鏡、短片製作 | 可使用參考圖片控制畫面 | 生成速度、可用模型與額度依方案而異 |
| Adobe Firefly | 文字轉影片、圖片轉影片及 Adobe 工作流程 | 商業設計、素材製作、Adobe 使用者 | 可與 Adobe 創作工具搭配 | 仍須確認生成點數及個別素材的使用條款 |
| MyEdit | 文字或圖片生成影片、線上影音工具 | 新手短片、快速產生社群素材 | 中文介面直覺,可搭配威力導演後製 | 免費使用通常有次數、點數或輸出限制 |
若目標是找 AI 生成影片推薦,可先按照工作流程選擇:重視電影敘事可比較 Sora 與 Veo;需要生成、特效及剪輯整合可考慮 Runway;偏好圖片轉影片可測試 Kling AI;已使用 Adobe 軟體者可優先評估 Firefly;想要中文介面與簡化操作,可使用 MyEdit。
ChatGPT 搭配 AI 影片生成器教學
ChatGPT 的主要用途是整理創意、生成腳本、拆分鏡頭與優化 Prompt。是否能直接產生影片,則取決於帳號可用功能與所連接的影片模型,不能將文字對話功能直接等同於所有影片生成服務。
步驟一:要求 ChatGPT 整理需求
可以輸入:
「請把以下想法改寫成可供 AI 影片生成器 使用的繁體中文與英文 Prompt:一名女性在雨天走進咖啡店。請補充人物、場景、鏡頭、運鏡、光線、動作順序、影片比例與排除項目,影片長度設定為 8 秒,只安排一個主要鏡頭。」
英文 Prompt 並非一定比較好,但部分模型的訓練資料與官方範例以英文為主。最實際的方法是分別測試繁體中文與英文版本,再比較人物、動作及構圖的穩定性。
步驟二:拆成多個鏡頭
不要要求 AI 一次完成 30 秒、包含大量劇情轉折的影片。可先讓 ChatGPT 將腳本拆為:
- 咖啡店外觀與雨景。
- 人物推門進入。
- 咖啡製作特寫。
- 人物端起咖啡微笑。
每段分別生成,再使用威力導演、Canva、剪映或其他軟體剪輯。這種做法比單次長影片更容易控制角色、節奏與錯誤畫面。
步驟三:貼入生成平台
在 Sora、Veo、Runway、Kling AI、Firefly 或 MyEdit 選擇文字轉影片功能,貼上整理後的 Prompt,再設定橫式 16:9、直式 9:16 或方形 1:1。
如果使用圖片轉影片,先上傳合法且清晰的參考圖,再說明哪些內容必須保持不變,以及哪些元素可以移動。
步驟四:逐項修正
第一輪結果不理想時,不要整段重寫。應先判斷問題屬於人物、動作、背景、鏡頭還是光線,再只修改一項變數。例如人物走路異常,可將「快速穿越擁擠街道」改成「以自然速度沿直線向前走,雙手自然擺動,固定全身鏡頭」。
步驟五:剪輯與輸出
生成影片後,應檢查手指、牙齒、嘴型、文字、倒影、陰影、物件接觸與畫面邊緣。最後再加入字幕、旁白、音效、品牌標誌與轉場,避免要求模型一次完成所有後製工作。
免費 AI 文字與圖片生成影片怎麼選
「免費」通常代表有限點數、有限次數、較慢排隊、較低解析度或輸出浮水印。搜尋 AI 文字自動生成影片免費 或 AI 文字生成影片免費 時,不應只看是否能註冊,還要檢查下載權限、影片解析度、浮水印與商用授權。
免費方案檢查清單
- 每月或每日提供多少生成點數。
- 一次可生成幾秒影片。
- 失敗生成是否照樣扣除點數。
- 免費輸出是否包含浮水印。
- 是否可以下載高解析度檔案。
- 是否允許商業使用。
- 上傳圖片是否會被用於模型訓練。
- 刪除帳號後素材如何處理。
- 是否支援台灣地區及繁體中文介面。
- 是否需要綁定信用卡才能開始試用。
Canva、MyEdit、Adobe Firefly、Runway、Kling AI,以及 Google 或 OpenAI 的部分影音服務,都可能依不同時期提供試用方式,但額度與資格經常調整。實際使用時應以官方頁面顯示為準,不宜把過去的免費秒數視為永久方案。
AI 生成影片常見崩壞原因
指令包含太多事件
短短數秒內要求角色換衣服、跨越多個場景、與多人互動並展示商品,會增加時間與空間錯亂的機率。解決方式是拆分鏡頭,每段只保留一個主要事件。
人物描述前後不一致
第一段使用「短髮女性」,下一段變成「長髮女孩」,AI 不一定知道兩者是同一角色。多鏡頭影片應建立固定人物資料,包括年齡層、髮型、服裝、配件與色彩,並在每個 Prompt 重複使用。
缺乏鏡頭主體
「繁忙的市場中有很多人正在活動」沒有指出觀眾應該看誰。可改成「鏡頭始終跟隨穿紅色外套的女性,背景人群保持輕微失焦」。
過度依賴否定詞
否定提示詞可以排除字幕、浮水印、畸形手部與突然跳接,但無法保證完全避免問題。正向描述仍應優先,例如先寫「雙手自然握住杯身」,再補充「避免多餘手指」。
要求 AI 直接生成正確文字
目前影片模型可能產生拼字錯誤、文字變形或前後不一致。需要價格、品牌名稱、活動日期與字幕時,應在後製軟體中加入,確保資訊正確。
提升生成品質的實務原則
建立固定 Prompt 模板
將每次使用的結構固定為「主體、動作、場景、鏡頭、光影、規格、限制」,能更快找出問題。若每次都改變全部內容,就難以判斷是哪一項設定造成改善或退步。
一次只測試一個變數
先固定角色與背景,再分別比較固定鏡頭、推軌及跟拍;或固定鏡頭,只測試自然光、棚拍光與霓虹光。這種方式比隨機重抽更節省生成點數。
保留版本紀錄
記錄使用平台、模型版本、Prompt、影片比例、生成日期與結果。AI 模型可能更新,同一個指令在不同時間不一定產生相同結果,因此保留紀錄有助於建立可重複的工作流程。
查閱官方文件
平台功能與方案變動快速,重要資訊應以 OpenAI、Google DeepMind、Runway、Kling AI、Adobe、Canva、MyEdit 等官方說明、方案頁面與服務條款為優先。第三方教學適合學習操作,但涉及費用、授權及隱私時,仍應回到官方資料核對。
結論
有效的 AI 生成影片教學 不在於提供一條保證成功的萬用咒語,而是建立可測試、可修改的提示詞結構。先交代主體與單一動作,再加入場景、鏡頭、光線、比例及排除項目;複雜故事則拆成多段生成,最後透過剪輯完成。
選擇工具時,也不必只追求最熱門的 AI 影片生成器。Sora、Veo、Runway、Kling AI、Adobe Firefly 與 MyEdit 各有不同定位,應依照文字轉影片、圖片轉影片、人物一致性、後製整合、預算及授權需求比較。免費方案適合測試,但正式商用前必須確認肖像、音樂、素材、品牌及輸出影片的使用權。
常見問題
1. AI 生成影片指令一定要用英文嗎?
不一定。許多平台可以理解繁體中文,但部分模型對英文攝影術語的反應可能更穩定。建議先用繁體中文整理需求,再產生英文版本進行比較。
2. 最簡單的 AI 生成影片提示詞公式是什麼?
可使用「主體+動作+場景+鏡頭+光線+風格+影片規格+排除項目」。每一項都應具體,但不要加入互相衝突的要求。
3. ChatGPT 可以直接生成 AI 影片嗎?
取決於帳號、地區、方案及當時可用功能。ChatGPT 至少可以協助產生腳本、分鏡與 Prompt,但實際影片可能需要搭配 Sora 或其他影片生成平台。
4. 如何減少 AI 真人的手指與臉部變形?
降低人物數量與動作複雜度,使用清楚的中景或固定鏡頭,避免手部快速遮擋臉部。也可加入「自然手部結構、臉部保持一致、避免閃爍」等限制,但仍需人工檢查。
5. 圖片轉影片時如何維持原本人物?
使用清晰且具有合法權利的參考圖,明確要求保留五官、髮型、服裝與構圖,只讓頭髮、衣物或背景產生輕微動態。動作幅度越大,人物改變的風險通常越高。
6. 有真正無限使用的免費 AI 圖片生成影片工具嗎?
主流雲端服務通常會限制點數、次數、速度、解析度或下載權限。看到「無限制」宣傳時,應進一步確認公平使用政策、排隊機制、浮水印及商業授權。
7. AI 影片可以直接商用嗎?
必須查看平台方案與授權條款,也要確認上傳圖片、人物肖像、音樂、商標及其他素材的權利。可以下載影片,不代表所有內容都能不受限制地商用。
8. 為什麼 AI 生成的影片會出現亂碼?
影片模型對精確文字與連續字形的控制仍可能不穩定。品牌名稱、價格、字幕及活動日期,最好在影片生成完成後使用剪輯或設計軟體加入。
9. 一次生成多長的影片比較穩定?
短鏡頭通常較容易維持人物、物件與動作一致。實際長度依平台而異,但複雜內容建議拆成數秒一段,再透過剪輯組合。
10. Sora、Veo、Runway 與 Kling AI 該怎麼選?
重視敘事與自然語言理解,可比較 Sora 與 Veo;需要完整生成及編輯流程,可評估 Runway;偏重圖片轉影片與人物動作,可測試 Kling AI。最終仍應以實際素材、預算、開放資格及商用條款進行小規模測試。