為什麼要先產「關鍵幀」而不是直接生影片?因為圖片便宜、快、可以反覆重生確認;等畫面對了,再拿去當影片的第一幀。而寫關鍵幀提示詞,我們用一個固定的七段結構——填空一樣把它填滿。
七個欄位
| 段落 | 寫什麼 |
|---|---|
| Subject 主體 | 誰/什麼,可引用參考圖(the person in image 1) |
| Action 動作 | 此刻的姿勢或動作 |
| Environment 場景 | 地點與時間 |
| Lighting 光線 | 方向、色溫、強度 |
| Camera 鏡頭 | 焦段、景別、角度、光圈 |
| Style 風格 | 色調、質感、參考美學 |
| Quality 品質 | 解析度與品質標籤 |
一個實例
把「少女騎單車沿河岸」這句話,攤開成七段:
7-SEGMENT PROMPT
[Subject] A 20-year-old woman with black hair, referencing image 1
[Action] riding a vintage bicycle, hair lifting in the wind
[Environment] riverside path at golden hour, a bridge in the distance
[Lighting] warm backlight, lens flare, soft bounce fill
[Camera] tracking shot, eye level, 24mm
[Style] cinematic, golden-hour grading, soft film grain
[Quality] 2K, photorealistic, sharp focus on the face合起來讀就是一段自然、資訊完整的英文提示詞。模型拿到後,每個維度都有明確指示,不需要亂猜。
為什麼一律用英文?
三個主要生成模型的訓練資料以英文為主,英文提示詞的穩定度明顯較高。你用中文跟導演對話沒問題——它會在內部幫你翻成英文、組成七段式。
兩個常被忽略的欄位
光線是質感的關鍵。同一個場景,warm directional sunset light from camera right(右側暖色夕陽側光)和 flat overhead fluorescent(頂部平光日光燈)會是天差地別的兩張圖。
品質標籤別漏。加上 2K, photorealistic, sharp focus on eyes 這類尾標,能明顯拉高細節與對焦準確度。預設用 2K 就好——1080p 的影片不需要 4K 來源,還能省下約六成成本。
善用反向提示詞
把常見的崩壞寫進 negative prompt,能減少重生次數:
NEGATIVE PROMPT
distorted hands, extra fingers, extra limbs, deformed face, mangled text, watermark關鍵幀對了,影片就成功一半。下一步是讓主角在每個鏡頭都長得一樣——那是〈角色一致性〉的主題。
動手做做看
把這篇的思路,直接拿去生成一支影片。
