我不是叫 AI「幫我做動畫」:我如何用 Codex 完成一支 10 秒品牌片
2026-08-09
FuFu
6
這不是一篇「丟一句 Prompt,AI 就自動完成」的案例分享。我會完整拆解如何透過 Codex,從確認 Remotion 環境、尋找正式 Logo、選擇音樂、分析參考影片,到逐步修正「視窗打字、3D 空間、品牌巨字與 Logo 最後才出現」等需求,完成 Remotion 與 Gemini 兩種版本的 10 秒品牌動畫。文章同時整理可直接複用的對話指令、分工方式與逐幀驗收流程,讓你把模糊的創意想法,轉化成 AI 能執行、能修改,也能驗收的製作規格。
從找 Logo、選音樂、拆解參考影片,到分別完成 Remotion 與 Gemini 版本。這篇不只展示 AI 做了什麼,而是拆解我怎麼下指令、怎麼修正,以及怎麼讓結果逐步接近我要的樣子。
很多 AI 教學會直接展示一段很長的 Prompt,接著放上完成品,好像只要複製那段文字,就能得到相同結果。
但這次製作 FuFu AI Lab 品牌動畫時,我真正感受到的是:**成品不是來自一段神奇提示詞,而是一連串正確的決策。**
Codex 的確替我完成了套件更新、素材搜尋、節奏分析、程式實作、渲染與逐幀檢查;但我必須持續告訴它:什麼是重點、哪裡不對、什麼不能出現,以及怎樣才算完成。
所以這篇文章不會把重點放在「AI 自己跑了哪些指令」,而是要分享一套任何創作者都能複用的協作方式。
影片一:Remotion 製作版
https://youtu.be/bORvTjjw35Y
影片二:Gemini 生成版
https://youtu.be/6aToX7K6mdg
兩支影片來自同一套創意結構,但使用不同方法完成:Remotion 負責精準控制,Gemini 負責生成式影像的空間與意外性。
---
先看完整對話脈絡:我不是一次把需求說完
這次協作最重要的地方,是我的需求隨著看到的結果逐步變清楚。
以下是幾句真正改變作品方向的對話:
| 我在 Codex 裡說的話 | 這句話實際解決的問題
設定明確順序:先準備、再提案,不直接製作 |
|「品牌動畫要有視窗的那種 3D 感,動效要絲滑強烈。」|
定義視覺方向與動態性格
|「Logo 只在最後才出現,不然字會被吃掉。」|
把主觀問題轉成品牌出現時間的硬規則
|「你先給我適合匹配的 Suno 音樂,然後再重新規劃影片內容。」|
先確定音樂,再以音樂重做分鏡
|「整體效果會長這樣,但不要這麼簡單。重要的是開頭那個視窗,然後打字。」|
告訴 AI 參考片要學什麼、不要照抄什麼
|「把這個寫成一個十秒影片腳本提示詞。」|
把已驗證的 Remotion 分鏡轉成 Gemini 生成版本
這些指令單獨看都不長,但每一句都只處理一個決策。
這比一開始就丟出五百字的大型 Prompt 更容易控制,因為我可以在每一個階段看見結果,再決定下一步。
> 圖片建議:這裡可以放一張 Codex 對話截圖,包含「先升級、再規劃文字」與「視窗 3D 感」兩句。
---
第一步:把「先規劃」說清楚,建立製作核准點
我的回饋是:
規劃文字讓我參考。
這句話等於告訴 Codex:現在可以提出文案與分鏡,但還不能直接把正式動畫做完。
等我看完方向並回覆「好,製作」,才正式進入實作。
這是一個很值得保留的協作習慣。因為動畫比一般文字更難回頭,越晚發現方向錯誤,修改成本越高。
我確認方向後,才進入正式製作。
不要把「先給我看看」當成默契,最好直接說出目前允許 AI 做到哪一層。
---
第二步:不要只說「不好看」,要指出注意力為什麼出問題
第一版方向裡,Logo 出現得太早,和品牌文字同時競爭注意力。
我的回饋是:
> Logo 只在最後才出現,不然字會被吃掉。
這句話很有效,因為它同時包含了:
- 問題:Logo 吃掉主要文字的注意力。
- 解法:Logo 延後。
- 規則:前段完全不能出現。
Codex 後來把這句感性回饋翻成可以檢查的影格條件:Frame 269 不得出現 Logo,Frame 270 才能第一次顯示。
這就是我認為 AI 協作最重要的技巧之一:**先用人的語言說出觀看感受,再請 AI 把它轉成可執行的規則。**
可以直接複用的指令
>目前的問題不是 Logo 不好看,而是它太早出現,會搶走主標文字的注意力。Logo 只在最後才出現
---
第三步:音樂不是背景,而是大家共用的時間尺
確定 Logo 的位置之後,我沒有立刻繼續做畫面,而是先請 Codex 給我適合的 Suno 音樂方向。
我最後提供《Glass Signal》,一段約 10.85 秒、129 BPM 的電子音樂。從這一刻開始,我和 AI 不再用「前面快一點、後面炸一下」這種模糊語言溝通,而是可以直接討論 3.13 秒的 Enter、6.99 秒的最大爆點,以及 9 秒的 Logo 硬切。
最後形成的節奏是:
| 時間 | 我希望觀眾感受到什麼 | 對應畫面 |
| 0.00–1.25 秒 | 系統正在靠近 | 暖白 Terminal 視窗飛近 |
| 1.25–3.13 秒 | 即將啟動某件事 | 依節拍逐字輸入指令 |
| 3.13–5.13 秒 | 指令生效 | Enter 撞擊與 `BRAND MOTION` |
| 5.13–6.99 秒 | 能量快速累積 | 多層 3D 視窗走廊 |
| 6.99–9.00 秒 | 最大品牌衝擊 | 「每個想法/都能動起來」SLAM |
| 9.00–10.87 秒 | 看清楚這是誰 | FuFu Logo 尾卡 |
第四步:提供參考片時,一定要說「我要哪一部分」
我後來提供了 `參考影片 也就是Remotion官方的展示影片`,但沒有只說「照這個做」。我特別補充:
> 整體效果會長這樣,但不要這麼簡單。重要的是開頭那個視窗,然後打字。
這句話做了三件事:
1. 告訴 AI 這支影片是視覺語言參考,不是複製範本。
2. 指出真正要保留的是「視窗推近+打字」。
3. 說明新作品的複雜度與衝擊力必須更高。
Codex 因此只抽取視窗推近、逐字輸入與 Z 軸空間三種動態語法,沒有複製參考片中的 `SKILLS`、ASCII 造型、Logo、文案或版面。
如果只提供影片、不說明觀看重點,AI 只能自己猜;而它猜到的,通常是最表面的顏色與構圖。
---
第五步:要求 AI 把創意寫成可驗收的製作計畫
方向確定後,我讓 Codex 先整理正式計畫,而不是直接開始自由發揮。
計畫裡包含:
- 新增獨立 Composition `FuFuBrandTerminalV2`。
- 1920×1080、30fps、326 frames。
- 可修改終端指令、兩行主標與 SFX 開關。
- 所有動畫使用 Remotion 影格時間,不依賴自主 CSS 計時。
- 不增加 Three.js,使用穩定的 CSS 3D perspective。
- 避免容易造成輸出閃爍的動態 mask、`backdrop-filter` 與尾卡混合模式。
- 程序化生成鍵盤、Enter 與視窗掠過音效。
- 正式輸出從 Frame 270 起鎖定單層品牌卡。
注意,這些不是我一開始就要懂的技術細節。我需要做的是確認它們有沒有忠實保護我的創意要求。
我負責回答:這樣的順序對不對?Logo 是否真的最後才出現?文字是否有清楚停留?
Codex 負責回答:要用哪些元件、時間函式與輸出方式,才能穩定做到。
善用Codex內建規劃模式
>使用Codex規劃模式把內容固定下來
他會輸出以下內容
計畫必須包含:
- 新版本名稱與舊版保留方式
- 精確秒數與影格數
- 每個場景的開始、結束與轉場
- 可修改參數
- 音樂與音效策略
- 已知的輸出風險與避免方式
- 正式製作完成後的驗收項目
---
附上Gemini 提示詞(自行修改內容):我有上傳我的Logo 並在尾段加入”上傳圖片“
製作一支 10 秒、16:9、1920×1080 的高質感品牌動態短片。純 Motion Graphics,無人物。視覺風格融合暖白極簡科技、深藍玻璃視窗、強烈透視與絲滑的 3D 空間運動。動效快速、有重量感,但畫面必須乾淨、精準、不雜亂。
0.00–1.20 秒:
暖白色無限空間。一個極簡電腦 Terminal 視窗從遠方高速飛近,帶有明顯景深與輕微斜角透視。視窗接近鏡頭時絲滑減速,自動校正為正面角度。外框、頂欄、三顆圓形按鈕與閃爍游標依照節拍逐層建立。鏡頭持續非常輕微地向前推進。此階段完全沒有 Logo。
1.20–3.00 秒:
游標開始輸入指令:
「fufu generate --type brand-motion」
文字不是等速出現,而是跟隨音樂強弱拍分組輸入。每次按鍵帶動細微回彈、游標閃爍和視窗呼吸。最後一個字元完成後短暫停頓,3.00 秒按下 Enter,發出低頻撞擊聲。
3.00–5.00 秒:
Enter 按下瞬間,終端畫面產生巨大輸出文字「BRAND MOTION」。字體粗重、現代、銳利,其中 MOTION 帶有青藍色光芒。文字、狀態線、游標和視窗邊框沿著 Z 軸分離,形成前後多層透視平面。鏡頭穿過文字與視窗結構,速度逐漸加快。
5.00–6.90 秒:
暖白 Terminal 視窗高速穿越鏡頭,畫面翻入深藍色 3D 視窗世界。後方連續生成六至八層透明玻璃介面,組成具有強烈深度的數位走廊。白色介面碎片轉化為青藍光線、框線與高速掠過的資訊平面。鏡頭沿著走廊中心高速前進,視窗從左右兩側擦過鏡頭。6.90 秒所有視窗突然向中央壓縮,蓄積爆發能量。
6.90–9.00 秒:
第一行繁體中文字「每個想法」從 3D 視窗結構中高速撞入中央,具有強烈 SLAM 重量感與短暫超越回彈。
緊接著第二行「都能動起來」以更大尺度從下方爆發展開,青藍色字體配合強烈衝擊波與鏡頭震動。
兩行文字清楚定格約一秒,構圖為:
「每個想法」
「都能動起來」
8.70 秒開始,文字與所有深色視窗向畫面中心快速收束。
9.00 秒硬切。在 9.00 秒之前,畫面中絕對不能出現 FuFu Logo。
9.00–10.00 秒:
畫面瞬間閃回暖白品牌卡。此時才首次出現上傳圖片, 圖片不得重新設計或變形。下方依序呈現:
「FuFu AI Lab」
「從靈感,到作品」
「FROM IDEA TO OUTPUT」
品牌卡完全正面、置中、穩定,沒有多餘動畫。最後一秒保持靜止,讓品牌被清楚看見。
聲音設計:
129 BPM 未來感電子音樂;加入低音量鍵盤聲、Enter 低頻撞擊、視窗高速掠過聲、品牌巨字撞擊聲。音效有力量但不能蓋過音樂。
畫面限制:
繁體中文必須完全正確。
畫面不得出現額外字幕、亂碼、隨機英文字、浮水印或其他品牌。
不得提前顯示 FuFu Logo。
不得使用卡通風格、遊戲介面風格、廉價霓虹、過量粒子或失控的鏡頭震動。
所有視窗邊緣必須穩定,不閃爍、不扭曲、不重影。
Gemini 版本適合觀察生成模型如何理解材質、光線、3D 空間與攝影機;Remotion 版本則提供文字、節拍和品牌素材的確定性。
這兩支影片不是要證明哪個工具比較強,而是讓我看見同一份導演規格,在兩種製作系統裡會產生什麼差異。
一份可以直接套用的 Codex 協作總提示
如果你想用相同方法製作自己的品牌短片,可以從以下提示開始,再依照每一輪結果追加回饋:
善用Codex內建的規劃模式輸入:
我想為[品牌名稱]製作一支[秒數]秒的品牌動畫,主要使用[Remotion/其他工具]。
目前先不要正式製作,等他產出計劃後確認,如果有素材放進資料夾裡告訴他會使用到那些素材
收到計畫後,不需要急著說「好」。先問自己:
這個計劃是否有符合你所想像的,若有就開始請他製作,反之直接叫他哪裡需要改善,修正到好在製作,亦或者是你沒概念請他先製作第一版再來進行修改
---
這支十秒品牌片最值得分享的,不是它用了多少 3D 視窗或程式碼,而是我如何在每一輪對話中,讓「我想要更強烈」慢慢變成一套可以製作、可以修改,也可以驗收的規格。
真正能複用的從來不是某一段 Prompt,而是這套對話方法。