無法取得影片資訊
2026-07-25
FuFu
19
從一張數字人圖片開始,到影片分析、分段、提示詞與字幕後製的完整實測 最近我看到一支節奏很吸引人的口播影片。 原本只是人物坐在鏡頭前說話,但影片會隨著內容切換鏡位、加入人物描邊、背景變化與各種視覺特效,讓一支普通的口播影片變得更容易看完。 我知道這類效果可以使用 Gemini Omni Flash 的影片編輯功能製作,所以先把參考影片放進資料夾,再請 Codex 分析它的製作方式。
最近我看到一支節奏很吸引人的口播影片。
原本只是人物坐在鏡頭前說話,但影片會隨著內容切換鏡位、加入人物描邊、背景變化與各種視覺特效,讓一支普通的口播影片變得更容易看完。
我知道這類效果可以使用 Gemini Omni Flash 的影片編輯功能製作,所以先把參考影片放進資料夾,再請 Codex 分析它的製作方式。
我一開始對 Codex 說:
幫我分析資料夾裡的影片如何製作。我知道它是用 Gemini Omni Flash 做的,但我想複製它的畫面感,不要直接照抄,我想做一個類似的版本。
不過在分析過程中,我很快就改變了方向。
參考影片使用大量紙張拼貼、撕紙、拍立得、便利貼、手繪箭頭與社群介面。這些特效已經形成對方很明顯的視覺風格,如果我把內容翻成繁體中文,再照著使用相同特效,最後還是很像在模仿原作。
所以我重新告訴 Codex:
算了,不要抄他的特效。特效也要有自己的風格,我要做出差異。
這個決定,也成為後面整支影片最重要的方向。
因為這次的目的是測試 Gemini 的影片編輯能力,我暫時沒有安排真人拍攝。
當時我已經做好一張 Ivy 坐在鏡頭前的圖片,畫面中有桌面、麥克風與暖色錄音室,所以我決定先把圖片製作成一支正常的數字人口播影片,再把生成完成的口播交給 Gemini 加入特效。
我告訴 Codex:
我已經先做好一張 Ivy 坐在鏡頭前的圖片。影片不用太長,大約 30 秒,內容也不用先介紹 Gemini,單純測試怎麼做出一支狠抓眼球的影片。
後來我們決定用「注意力被消耗」作為影片主題,腳本是:
有時候,你不是懶。只是腦袋同時開了太多分頁。你想工作、想回訊息、想追上進度,還在擔心一些根本還沒發生的事情。明明每一件事都沒有真正開始,卻已經把你的注意力全部用完了。我後來做了一個很簡單的改變。不是逼自己更專心,而是每天只留下現在最重要的一件事。當你願意把其他分頁先關掉,腦袋才終於有空間,把眼前的事情做好。
這段腳本很適合測試視覺特效,因為裡面包含「分頁」、「注意力耗盡」、「關掉其他分頁」及「只留下一件事」等可以被具象化的概念。
接著,我使用數字人工具完成口播,最後得到一支約 35.72 秒的直式影片。
完成口播後,我把影片放回資料夾,再請 Codex 進行分段。
我的要求是:
Gemini 一次可以處理的影片長度有限,所以要先分段。如果一句話剛好講到一半時碰到 10 秒,就把剪輯點往前移,不要切斷句子。分段完成後,再給我每一段可以貼到 Gemini 的提示詞。
這裡最重要的不是每 10 秒切一次,而是要以完整句子為單位。
如果第 10 秒剛好位於一句話中間,就必須往前找到上一個自然停頓。寧願讓其中一段只有五、六秒,也不要把一句話切成兩半。
Codex 分析影片的台詞與停頓後,將整支影片分成五段:
五段加起來仍然是原本的完整內容,而且每一個剪輯點都位於自然句尾。
這個階段我主要使用 Codex 的 video-use Skill,讓它根據語音、停頓與完整句子尋找剪輯位置,而不是只按照固定秒數切割。
中途我也發現部分 Gemini 介面似乎可以接受更長的影片,甚至嘗試重新整理成接近 15 秒的片段。不過考量穩定性與前後銜接,這次最後分享的流程仍然以每段不超過 10 秒為主。
完成分段後,下一步是決定每一段要加入什麼特效。
因為我已經明確要求不要模仿參考影片,所以 Codex 幫我建立了一套新的視覺語言,稱為「透明注意力空間」。
主要元素包括:
第一段提到「腦袋同時開了很多分頁」,背景就出現多片透明玻璃視窗。
第二段談到工作、訊息、進度與還沒發生的事情,玻璃視窗中便依序出現檯燈、光點、延伸光軌與模糊煙霧。
第三段說注意力已經被用完,橘色光粒就逐漸熄滅。
第四段只留下現在最重要的一件事,因此畫面最後只保留一個透明方塊與橘色光點。
第五段則讓其他視窗依序闔上,最後回到乾淨、安靜的錄音室。
每一個效果都必須呼應正在說的內容,而不是為了讓畫面熱鬧,隨機加入一堆動畫。
提示詞設計的部分,我使用了 realistic-video-prompting Skill,協助把抽象台詞轉換成具體的物件、動作、時間與空間關係。
剛開始時,我們把提示詞寫得非常詳細。
裡面包含人物的臉、髮型、服裝、身形、座位、麥克風位置、色碼、材質、口型、原始聲音與大量禁止項目。
原本以為要求寫得越完整,Gemini 就越不會改變人物,但實際測試後,過多重複描述反而可能造成誤解。
所以我開始刪除不必要的內容。
最後真正使用的第一段提示詞是:
請直接編輯我上傳的直式口播影片,並保留原聲。 畫面安排: - 0.00–0.60 秒:維持原始正常口播,鏡頭極輕微向 Ivy 推近。 - 0.60–1.80 秒:她身後原本沉重的暗影像一層透明霧氣般向上散開,表示問題不是懶惰。Ivy 本人不變形。 - 1.80–3.20 秒:第一片無文字的透明玻璃視窗從鏡頭右側滑入,停在 Ivy 身後的景深區。 - 3.20–5.04 秒:更多不同大小的透明視窗從左右和後方依序展開,像腦中同時打開很多分頁,但不要遮住 Ivy 的眼睛、嘴巴和麥克風。最後停在「多個分頁懸浮」的狀態,方便接下一段。 動作必須一個接一個出現,使用柔和的 ease-out 減速,不要同時爆出所有元素。不要加入字幕、文字、Logo、紙張拼貼、手繪箭頭、社群介面、卡通風格、科幻 HUD、故障閃爍或液態變形。
這個版本只保留四種必要資訊:
我刪除了重複的人物設定、材質說明、顏色色碼及過長的禁止清單。
這次實測讓我發現,Gemini 的影片編輯提示詞不是越長越好。重點是把「什麼時間、發生什麼事情、哪些地方不能被遮住」寫清楚。
聲音是我一開始很擔心的問題。
如果原始影片是中文口播,Gemini 在重新生成影片時,有可能改變聲音內容,甚至將原本的中文變成英文。
因此,我最後在提示詞開頭直接寫:
請直接編輯我上傳的直式口播影片,並保留原聲。
成功保留原聲後,後製時不需要重新配音,也不需要再做一次口型同步。
這裡要注意,我不是請 Gemini 修改聲音,而是要求它保留影片原本已經存在的音軌,只處理畫面中的視覺效果。
如果遇到系統拒絕聲音相關指令,也可以準備無聲影片作為備用方案,先讓 Gemini 處理畫面,最後再接回原始音軌。但這次我的最終成品是直接保留原聲,沒有重新配音。
完成部分片段後,我又遇到另一個問題:Gemini 把原創數字人判定成知名人物。
第五段在刪減提示詞後可以成功生成,但第三段與第四段不管怎麼修改,都一直無法通過驗證。
我們先刪掉 Ivy 的名字,也移除「維持人物身分」、「保留原本五官」等描述,再把提示詞改成英文。最後甚至縮成:
讓背景出現幾片透明玻璃,然後慢慢變暗。其他畫面不變。
以及:
在桌面上加入一個透明方塊,裡面亮著橘色光點。其他畫面不變。
結果仍然被擋。
這時我們才確定,問題不在提示詞,而是輸入影片中的人臉被系統誤判。
Google 官方文件也提到,部分含有「可辨識人物」的上傳素材可能無法編輯,而且安全檢查會同時分析提示詞與輸入影片。Gemini Omni Flash 官方說明
如果提示詞已經縮到只剩一句話,仍然出現相同錯誤,就沒有必要繼續改寫。這種情況比較適合改用一般剪輯工具製作該段效果,避免持續消耗生成額度。
完成影片特效後,我沒有讓 Gemini 直接生成繁體中文字幕。
目前生成式影片模型仍然可能出現繁體中文錯字、缺字或無法辨識的假文字。如果只錯一個字,卻要重新生成整段影片,時間與生成額度都很浪費。
所以我把字幕留到最後處理。
我先使用 Codex 整理正確的字幕內容與時間,再透過 HyperFrames 將字幕後製到完整影片上。
這樣可以確保:
如果沒有使用 HyperFrames,也可以改用剪映、CapCut、Premiere Pro 或其他字幕工具。重點是把需要高度精準的文字留到最後製作。
這次的實際分工如下:
video-use 按照完整句子分段,每段不超過 10 秒。realistic-video-prompting 規劃每段特效與提示詞。這次主要使用兩個 Codex Skills,加上 HyperFrames 完成影片分析、分段、提示詞設計與字幕後製。
Skills 是提供給 AI Agent 的可重複工作流程。安裝後,不需要每次重新解釋全部技術細節,只要告訴 Codex 要使用哪一個 Skill,以及這次的目標即可。想進一步了解 Skills,可參考 OpenAI Skills 官方說明。
簡易安裝方式:對話欄裡貼上: github網址, 幫我安裝這個skills 就行了
GitHub:
https://github.com/browser-use/video-use
安裝說明:
video-use 是一個對話式影片剪輯 Skill,可以協助處理:
GitHub:
https://github.com/zhouwei713/seedance-prompt
這個 Skill 原本是為 AI 影片生成模型設計的真實感提示詞方法,可以應用在 Seedance、Sora、Kling、Runway、Veo,以及這次使用的 Gemini Omni Flash。
它會協助規劃:
GitHub:
https://github.com/heygen-com/hyperframes
官方文件:
https://hyperframes.heygen.com/introduction
HyperFrames 是一個使用 HTML、CSS 與 GSAP 製作影片的開源工具。它可以將網頁式的構圖逐格輸出成影片,特別適合製作:
這次測試並不是把整支影片丟進 Gemini,就能自動得到完整成品。
真正重要的步驟,是先讓 Codex 理解影片內容,找出每一句話可以被視覺化的地方,再依照完整句子分段,替每一段設計清楚、簡潔的提示詞。
Codex 負責內容理解、分段與提示詞;Gemini Omni Flash 負責加入原本拍攝不到的視覺效果;HyperFrames 則負責需要高度精準的中文字幕。
整個過程中,我確實遇到聲音處理、提示詞過長、繁體中文錯誤,以及數字人被誤判為知名人物等問題。
它還不是百分之百穩定的製作方式,但這次實測證明:即使只有一張數字人圖片與一段普通口播,也能透過 Codex+Gemini Omni Flash+HyperFrames,做出一支具有自己視覺風格的 AI 特效影片。
FuFu
112 Followers
0則留言
FuFu
112 Followers
我們使用本身的Cookie和第三方的Cookie進行分析,並根據您的瀏覽習慣和個人資料向您展示與您的偏好相關的廣告。如欲瞭解更多資訊,您可以查閱我們的隱私權政策。