這是一份實用指南:讀完後,你會知道怎麼寫出聽起來不像垃圾的 UGC 腳本、生成影片、剪輯,然後在真人身上測試。還有這一切要花多少錢。設定好之後,大約 20 分鐘,幾塊美金。
讓你知道這篇的來源:沒有被 Higgsfield 或任何人贊助。我也不是 UGC 操盤手,我是做 AI 廣告的。從 12 月起,我一直在密切追蹤那些真的用這個東西在賺錢的人,主要是我的朋友 @maxxmalist 和 @Mho_23,還有其他一些人,同時我也在跑自己的測試。每個數字都有來源或截圖,而截圖就是我自己第一次跑這個流程的真實紀錄。
為什麼是現在
我一直在測試 AI 影片,拿給身邊的人看,看他們會不會相信是真的。
多年來我們基本上總能看得出來。皮膚會露餡,那種塑膠感、死氣沉沉的外觀,讓任何多酷的東西都變成 AI 垃圾。
後來 Seedance 2.5 推出,皮膚終於看起來像真人了。@maxxmalist 的這篇貼文只是眾多例子之一,展示了這個模型到底有多猛:
https://x.com/maxxmalist/status/2085330197524390113
https://x.com/eptwts/status/2085141769755242580
先寫腳本,不是先選模型
觀眾會不會留下來,關鍵在腳本。以後也永遠是這樣。
每篇 AI UGC 教學都把篇幅花在生成那一步,一部分是因為贊助商賣的就是生成。ep(@eptwts)的 Seedance 工作流拆解真的很棒。
但你滑一下自己的動態:那些讓你看下去的影片,都是第一句就打中你,下一句又讓你想等下去。這是寫作,模型幫不了你。
第一步:建立你的評審團(一次性,約 10 分鐘)
你不能只靠寫更多腳本來學會寫腳本。你要靠被讀者狠狠撕碎,快速撕碎,幾百次,而且這些讀者要比你的觀眾更狠。
系統是這樣:
- 建立一個獨立的 Claude Agent,專門只做腳本
- 給它一組評審技能(judge skills),每個技能只負責一件事:一個管節奏、一個管詞彙、一個管點子、一個管結構
- 用一份超大的靈感庫(swipe file)訓練每位評審,內容來自與你風格和品味相符的人:你欣賞的作家和創作者的逐字稿、腳本、鉤子、點子。Gary Provost 是用來練節奏的經典選擇,但任何能讓你停下滑動的人都可以。我實際的建議:找一個不完美的來源,像是真實的 TikToker,然後把他們的整個個人主頁上傳給腳本 Agent。UGC 腳本不該聽起來像精雕細琢的寫作
- 把一批已經跑出成績的腳本庫餵給 Agent,無論是你自己的,還是你在研究的
- 你寫的每個腳本,在生成任何一幀之前,都要先通過完整評審團
技能(skill)就是 Agent 載入的一組指令檔:這個評審是誰、它在乎什麼、什麼會讓它否決一個腳本。把每個技能寫成一份給嚴厲組員的簡報,這個組員只有唯一一個任務。
我認為這裡你能做的最棒的事,是讓至少一位評審 100% 用真實的 UGC 創作者來訓練,你可以抓下他們所有的影片和腳本。
(如果你搞不清楚,就把這篇文章貼給 Claude。)
我發表的所有東西都會過七位評審,包括這篇文章(數量隨你調整)。這是我寫的東西不會讀起來像垃圾的唯一原因。

寫好腳本,讓評審團評一輪,重寫,再跑一次。當它存活下來,你就有值得花錢的東西了(做 AI UGC 時,一次寫 10 條以上通常很有幫助)。
第二步:生成影片
Seedance 2.5 是改變我想法的模型。Higgsfield 可能是最容易執行它的地方,Dreamina 和 Freepik 也行。
如果已經有一個為類似產品轉換過的 UGC 影片,就拿來用:把它丟給 Gemini,要求一份 1:1 帶時間戳的畫面拆解。這份拆解就會變成你的提示詞,而你通過評審的腳本就當作對話內容放進去(ep 寫過這個工作流的深入版)。
想從零開始?那就兩個提示詞:先首幀,再影片。
用 gpt-images-2 做首幀(Nano Banana 也可以)。訣竅是堆疊寫實關鍵字,這樣才不會得到那種精緻的 AI 感:
超寫實 iPhone 前鏡頭自拍,25 歲左右的女性坐在停好的車的駕駛座上,午後自然光穿過擋風玻璃,隨便紮的髮髻,超大號連帽衫,真實皮膚質感、可見毛孔,淡淡眼下陰影,正講到一半的隨興表情,一隻手舉起對鏡頭說話,淺景深,柔和的暖色調,真實的 TikTok vlog 美學,無文字,無字幕,9:16
然後把這張圖作為參考幀放進 Seedance 2.5,並以你的腳本為核心來下影片提示詞。把提示詞結構化成逐秒的鏡頭拆解:
主體:參考幀中的同一位女性,同樣的頭髮、同樣的連帽衫、同樣的車
鏡頭:手持前鏡頭自拍視角,胸部以上取景,自然的細微晃動,9:16
音訊:清晰的手機麥克風人聲,帶輕微環境音,無背景音樂
00:00-00:03 她微微靠近鏡頭,像講話講到一半的能量狀態:[你的鉤子台詞]
00:03-00:12 自然眨眼,輕微頭部動作,思考中停頓一次:[你的腳本主體]
00:12-00:15 微微笑,對著鏡頭直接講出結尾台詞:[你的 CTA]
保持皮膚紋理,不要美顏濾鏡感,嘴型同步,15 秒
設定 9:16,從 720p 開始,看到喜歡的 take 再升級。影片長度要對齊你的時間戳,否則口白會不同步。

Seedance 會把弱腳本渲染得跟強腳本一樣漂亮。這就是整個行業即將踩進去的陷阱。
第三步:像處理真實素材一樣剪輯
生成結果就是原始素材,所以把它當素材來剪:剪掉開頭的空檔、收緊每個停頓、加上字幕、墊一段聲音,就像剪一個真實創作者的自拍影片那樣。

當流程跑通,就打造機器
持續跑自己的測試,直到影片能穩定地騙過真人。調整評審、提示詞、剪輯。那套流程才是你真正的資產。
然後用 Wispr Flow 把整套流程口述進 Fable 5,打造你自己的機器:一個能規模化執行你完整流程的 Agent。手動把流程磨到完美之前不要做這件事——自動化一個壞掉的流程,只會更快產出垃圾。
成本是多少
在 Dreamina 上,一段 720p、8 秒的影片大約要 296 點數,以 $19 入門方案來算大概是 $3.50。各平台加總起來,720p 每支影片大約是 $2.50 到 $6(來源)。
(價格和模型存取權限變化很快,下手前先確認,別直接相信我。我這次實際的花費都在上面的截圖裡。)
所以你第一支能騙過人的影片:大約 20 分鐘的時間,成本比一頓午餐還便宜。現在你明白為什麼那些規模化操作的人正在印鈔票了。
你的第一個 20 分鐘
啟動計時前的一次性準備:建立評審 Agent(約 10 分鐘)
- 0-8:寫出第一版腳本,讓評審團把它撕碎,重寫到聽起來自然為止
- 8-14:用 gpt-images-2 生成首幀,把你的腳本貼進影片提示詞,用 Seedance 2.5 生成
- 14-18:CapCut 過一輪。剪掉空檔、字幕、聲音
- 18-20:像觀眾一樣再看一遍。如果連你都不會停下來滑,問題就在腳本,回去找評審團
把這篇存起來,今晚就照著跑一次。
想看更多 AI 影片乾貨,加入我的免費 TG:t.me/beechhq





