SeedStar · 學院
廣告製作

口播帶貨提示詞:怎麼讓 AI 主播「看起來像真人」

眨眼太準時、皮膚太乾淨、口條太順——這些都是 AI 主播的破綻。四個真實感約束,把口播畫面從「一眼假」救回來。

口播帶貨提示詞:怎麼讓 AI 主播「看起來像真人」

口播帶貨的鉤子、痛點、賣點、CTA 都寫對了,畫面卻還是有種說不出的假——多半不是腳本的問題,而是漏了幾個容易被忽略的真實感約束:眨眼的節奏、皮膚的質地、說話的呼吸感、鏡頭的手感。這篇只做一件事:把「AI 主播」變回「看起來像會呼吸的人」。

一眼被認出是 AI 的三個訊號

人腦對「臉」的辨識異常敏銳,任何規律到不自然的細節都會被標記成異常——這就是恐怖谷效應在口播影片裡的樣子。模型如果沒被特別要求,預設生成的「完美」畫面恰好踩中三個最容易被認出的訊號:眨眼太規律(像節拍器)、皮膚太乾淨(像上了三層美肌濾鏡)、語氣太順(像在唸稿,沒有一絲換氣或猶豫)。接下來逐一拆解,怎麼在提示詞裡把它們寫掉。

眨眼:太準時,反而是破綻

真人眨眼不是等間隔事件,它會被情緒、專注程度、講話節奏牽著走——時快時慢,偶爾連續眨兩下,偶爾又撐超過五秒不眨。模型若不特別要求,容易走向兩個極端:完全不眨(長時間直視鏡頭,顯得呆滯),或者機械式等間隔眨眼,規律到反而更假。官方手冊給的錨點很實用:每 3–4 秒自然眨眼一次。這不是要模型精算節拍,而是給它一個「有在眨、頻率合理」的範圍,避免落入兩個極端。寫進提示詞就是一句 natural blink every 3-4 seconds, slightly irregular timing。

皮膚:磨皮磨掉的,是「這是活人」的證據

美顏濾鏡把毛孔、細紋、油光壓平,直覺上更好看,但那些正是皮膚在散射光線時留下的物理痕跡——次表面散射(subsurface scattering)造成的微妙紅潤與陰影層次,是「這是一張活的臉」的視覺證據。少了它,皮膚會呈現一種均勻到不自然的蠟像感或塑膠感,大腦立刻讀出破綻。口播帶貨的鏡頭幾乎全程對著臉,這個問題被放到最大。解法是主動反向排除,而不是假設模型會保留質地:visible skin texture, natural pores, slight oiliness on the T-zone, no beauty filter, no airbrushing。

破綻為什麼看起來假加這句救回來
眨眼太規律真人眨眼間隔隨情緒、專注度漂移;完全等間隔像節拍器natural blink every 3-4 seconds, slightly irregular
皮膚太乾淨磨皮抹掉次表面散射的紅潤與陰影,讀起來像蠟像visible skin texture, natural pores, no beauty filter
口條太順唸稿式等速語流沒有呼吸與遲疑,聽感生硬natural speech cadence, brief pauses, not a scripted read
鏡頭太穩教科書式穩定運鏡是廣告感,不是「有人正在自拍」的原生感slight handheld sway, natural imperfect framing

口語:讓她「說話」,不是在「唸稿」

官方手冊特別點名口播的口語風險:避免書面化。書面稿唸出來語速均勻、句子完整、幾乎不換氣——這種「完整」恰恰是破綻,因為真人說話會在想詞、換氣、強調重點時自然停頓,句子也常常不打完就轉個彎接下去。與其在提示詞裡寫抽象的「自然一點」,不如具體描述停頓會發生在哪裡。

  • 自然版:「這個──其實,我自己用了三個月」(停頓+口語轉折,像在想詞)
  • 唸稿版:「這個產品非常好用,我已經使用三個月,效果顯著」(語速均勻、句子太完整,像在唸稿)
  • 把「其實」「就是」這類口頭禪當成節奏工具使用,而不是要刻意避開的缺點

手持感與不完美構圖:別修得像廣告

投流跟種草最看重的是「像朋友在跟你說話」,不是「像廣告在推銷你」。教科書式的穩定運鏡、精準置中的構圖,觀眾一眼認出是廣告,防備心立刻升起。手機自拍口播反而該保留輕微的手持晃動與不完全置中的構圖——這是 UGC(使用者原生內容)的視覺指紋,也是讓觀眾放下戒心的關鍵:slight handheld camera sway, natural imperfect framing, front-facing phone camera feel。

台詞與畫面文字,要逐字放引號

上面幾句真實感約束用英文描述最穩,但台詞本身、以及會出現在畫面上的文字(字幕、slogan)要逐字用目標語言放進引號,不要翻譯或改寫成英文——模型才會照著唸、照著顯示,例如 she says「這個──我自己用了三個月」。

組合起來:一段完整的真實感約束

REALISM CONSTRAINTS
natural blink every 3-4 seconds, slightly irregular timing; no beauty filter, visible skin texture and pores; natural speech cadence with brief pauses, not a scripted read; slight handheld camera sway, natural imperfect framing
四個錨點就夠,別逐句疊加

真實感約束是在「反向排除模型的預設偏好」,不是要模型多做動作。一次塞超過五、六個修飾語,模型容易顧此失彼——眨眼顧到了,口條又跑掉。抓緊眨眼、皮膚、口語、運鏡這四個最有效的錨點就夠,其餘交給模型自由發揮。

這篇只解決一個問題:口播畫面「看起來像不像人」。至於怎麼把賣點寫成拍得出來的動作,或投流、種草、品牌片各自該用哪套骨架,那是結構層的事——交給〈廣告六要素:把賣點變成鏡頭拍得到的動作〉和〈五種廣告腳本:投流、種草、品牌片、互動、出海〉去處理。這裡的四個錨點可以直接疊加進那兩篇的任何一支腳本裡,不衝突。

動手做做看
把這篇的思路,直接拿去生成一支影片。
WWenzhe餐飲品牌主查看所有文章
瀏覽其他分類