「原生音訊」聽起來像一個開關——打開,影片就有聲音了。但空白的環境音跟設計過的音場,差別非常大。這篇講清楚平台上聲音可以動的四個地方,各自負責什麼、什麼時候該用哪一個。
聲音有四個地方可以動
| 你想要什麼 | 在哪裡做 |
|---|---|
| 畫面裡「本來就會有」的聲音(環境音、動作音效) | 直接寫進提示詞那個框——跟畫面一起描述就好 |
| 這支片到底要不要有聲音 | 生成頁的「音效」開關:有聲 / 靜音 |
| 用你自己的音樂或錄好的聲音 | 上傳音訊,再選「聲音參考」或「當作配樂」 |
| 讓角色講一句指定的台詞 | 專案鏡頭編輯器裡的「台詞配音」 |
把「distant waves, a gull」這種寫實環境音寫進提示詞時,模型不只是配上聲音——連帶會微妙地影響畫面的氛圍。這是最容易被忽略、CP 值卻最高的一句:哪怕只寫「soft room tone, a single door click」,都值得加。
最基本:把聲音寫進提示詞
不用找什麼特別的欄位——你描述畫面的那個框,就是描述聲音的地方。原則很單純:這個場景裡,如果你真的站在那裡,會聽到什麼?海邊有浪聲跟海鳥、廚房有油鍋滋滋聲、雨夜有雨滴打在鐵皮屋頂。具體到「什麼材質、什麼距離」,比籠統寫「有環境音」有用得多。
An old bookstore at night, rain visible through the window. Camera slowly pushes in past the shelves toward a reading lamp. Soft room tone, gentle rain on the window, one distant roll of thunder.要不要有聲音:一個開關
生成頁上有一個「音效」開關,兩個選項:有聲(預設)跟靜音。要做那種純畫面、之後自己配樂的素材,就切靜音;其他情況維持有聲即可。
平台目前沒有讓你單獨描述配樂的欄位(例如另外填一句「溫暖的鋼琴、充滿希望」)。聲音的方向就是靠提示詞裡的描述帶出來;想要精確指定某一段音樂,正確做法是下一節——直接上傳你要的音軌。
用自己的聲音:上傳音訊
手上已經有配好的音樂、錄好的旁白、或品牌既有的音軌?上傳音訊之後有兩種用法,差很多:
| 模式 | 模型會做什麼 |
|---|---|
| 聲音參考 | 依這段聲音重新演繹——角色會照著它對口型 |
| 當作配樂 | 不演繹,直接把這段聲音鋪成成片的音軌 |
想讓角色對嘴,用聲音參考;只是想配一段背景音樂,用當作配樂。聲音參考有 15 秒上限——超過會被拒絕,這時候改用當作配樂,或把台詞縮短。
Seedance 不允許第一幀跟參考音訊並用。你加了參考音訊之後,平台會自動把第一幀/尾幀改成「參考圖片」模式來相容——介面上會有提示。如果生成結果的畫面控制感覺變鬆了,這通常就是原因。
讓角色講指定台詞:台詞配音
如果你要的是「這個角色要講這一句」,專案的鏡頭編輯器裡有「台詞配音」:輸入台詞,再選填一句聲音描述(例如「低沉沙啞的中年男聲」),平台會生成一段 AI 語音並綁到這顆鏡頭,產生鏡頭時一併送給模型。這比在提示詞裡描述語氣精確得多,但會另外計點。
台詞預估超過 15 秒時,聲音參考模式會被拒絕。介面會提醒你——這時候縮短台詞,或改用「當作配樂」把整段鋪上去。
常用的聲音描述詞
- 環境音:
soft room tone、distant traffic、crowd murmur、rain on a tin roof——列出具體聲音,比寫「有音效」有用 - 動作音效:
footsteps on gravel、a light clink of chopsticks on the bowl rim——跟著畫面裡真的會發生的動作走 - 情緒定調:
tense, low pulse、calm and unhurried——這類詞會連帶影響畫面氛圍,不只是聲音
聲音常常是提示詞裡最後才被想到、卻最先被觀眾感受到的一段。下次寫提示詞,記得多寫一句「這裡聽得到什麼」——即使只有一句話,也會是報酬率最高的那一句。想讓整支片跟著音樂節奏走,那是另一個層次的事,見〈卡點剪輯〉。
