top of page

【聲音筆記】AI 時代:創作者真正的護城河

8月3日
讀畢需時 7 分鐘

已更新:8月6日

AI Can Generate Music, But It Can’t Make Decisions: On the True Moat of a Creator


聲音筆記 / 按下生成之後・撰文/SHAO(BP Music Studio 主理人)



幾個月前寫了《穿著 Prada 的惡魔 2》的觀後隨筆,當時點了一個問題:會不會擔心被 AI 取代。那時結尾是感性的,我說,答案藏在那些「還在乎」的人身上。


這句話是我相信的。但這幾個月,因緣際會下同個問題又被問了很多次,多到我發現,對於提問的人亦或需要做決策的人來說,那個答案是不夠的。


關於從業人員怎麼想的——這次不談熱誠,談結構與實務。




「不錯」這件事有很多層級

There Are Many Ways to Be Good


前陣子有朋友傳了一段音樂給我。三十秒,弦樂鋪底,中間有一次還算漂亮的轉折。他問:「這是 AI 生的,你覺得怎麼樣?」


我對音樂的判斷一向保持客觀。好聽就是好聽,而「好聽」的多種面向,取決於你對細節的要求,以及這段音樂最終要被放在哪裡。

那次我的回答是:還不錯。但這三個字背後的判斷層級,我想花一點篇幅講清楚。



如果這段音樂只是要放在餐廳當背景,我的標準會很寬鬆——聽起來舒服、不搶走談話的位置,那就算好聽。這一層,現在的生成工具做得很好,而且只會越來越好。


再上去一層,是:「你願意閉上眼睛、仔細聽的那種。」每一個聲部為什麼站在那個位置?這個 Motif(動機)第三次出現時為什麼被剝離了一半?某個和聲的顏色為什麼剛好在這裡轉暗?那是經得起被「聽設計」的不錯。


再上去一層,牽涉到物理紋理與演奏能量。

在真人錄音的領域裡,弓毛與弦摩擦的微小抓咬感、管樂手換氣時空氣動了一下(Transient)的瞬間——那種無法複製的聲音紋理與演奏者當下的能量交鋒,是我願意把同一段音樂反覆聽上無數次的原因。


而最上面那一層,是接近偉大。

通常一個有用耳朵走過音樂歷史,受過嚴格審美訓練的作曲家,在經過成千上萬次微觀的判斷與取捨之後做出來的作品。它不只是好聽,它有結構、有脈絡、有極其精妙的裁切與創造——每一個選擇背後,都站著一個清楚的理由。


以上這四層都可以被稱為「不錯」。所以當有人問我 AI 做的音樂好不好,我第一個想反問的通常是:你是問哪一層?



你聽見的是答案,還是一個選擇?

The Difference Between an Answer and a Choice


講一個跟音樂無關的實務例子。


讀報表、整理數據,機器早就做得比人更快、更準。這叫「資訊處理」。


但拿到數據之後呢?要不要停損?要不要加碼?要不要替換掉一個合作了三年的核心夥伴?這些問題沒有標準答案。更關鍵的是——做完決定後,必須有人承擔後果。


模型可以提供一百種可能性,但它無法替任何一種可能性簽署姓名並承擔風險。

所以護城河從來不在資訊,在承擔。只要你的工作本質涉及責任與決策,那條河就一直都在——除非人類消失(笑)



指令解決風格,解決不了時間軸上的微觀判斷

A Prompt Is Already an Answer



在〈委託一首專屬配樂〉這篇裡,

我寫過:幾乎每一次影視委託的起點,都不是一份精確的總譜,而是一句說不太清楚的話。



例如:「我想要那種……有點像散場後、燈還沒亮的時候。」


或是:「一種循環、沒有盡頭的孤獨,但要保有極高的氣質與詩意。」



這些句子抽象又模糊,卻往往是作品最真實的靈魂起點

而生成工具想用好最根本的前提是:你得先把話說清楚。


你得先決定是 Lo-Fi 還是 New-Classical、BPM 是 90 還是 120、情緒是疏離還是溫暖。換句話說——在你能夠精確下 Prompt 的同時,最核心的審美定位其實已經完成了。


配樂師真正在做的,往往是那個「還無法下指令」的階段。


是咖啡放涼四個小時,把一團形容詞慢慢凝結成幾個可以指認的點,透過再推導、再翻譯組成聲音的座標;是聽著導演描述一片「深夜裡最寂靜的大海」,然後判斷那片海在頻譜上,到底需要什麼樣的 Texture。


更有甚者,是處理「反差」的判斷。


最近處理的一場戲中,畫面看起來極度幸福——光線溫暖,人們在笑;但導演要的是讓觀眾在當下產生疑慮,用音樂去提示畫面底下暗湧的悲傷。

這種需求很難用單一指令概括。因為它不是「悲傷配樂加快樂畫面」的簡單疊加,而是反差要留幾分?什麼時間點(Sync Point)讓情緒滲透出來?觀眾發覺前音樂要不要就收回?


因為它不是「悲傷的音樂配快樂的畫面」那麼簡單——反差要留幾分、什麼時候讓觀眾察覺、察覺之後又要不要收回來,箇中全是判斷。


生成工具給出的情緒曲線是統計學上的「大數法則」,是「大眾在這種氛圍下習慣的平均走向;而電影高潮要的恰恰是深刻理解常規然後違反那個走向、主動選擇打破常規所產生的張力。


那場戲的反差,最終成了整部片最具說服力的時刻與最被記住的亮點。



最難的那個判斷,通常是「這裡不要有音樂」

The Hardest Call Is Still Yours


生成工具的天職是輸出,你給它任務,它就必須填滿空間。但影視配樂的判斷,往往是反過來的:在該空的時候敢空,且守得住那份無聲的壓力。


當然,如果我們下達指令「生成一段極度稀疏、只有零星長音的音樂」,AI 確實做得到,甚至執行速度遠超人類。


但這依然是同一個邏輯——「決定這裡要稀疏」的這個判斷是由你做出的,工具只是執行了你已經完成的決策。


更極端的狀況是:一整場五分鐘的戲,乾脆完全不放音樂。


但這種決定不可能交給模型,因為這不是音樂本身的問題,而是這部電影整體敘事結構的問題。工具在乎的是生成的音樂品質,不在乎這段音樂在整部電影裡是否多餘。


這種判斷無法外包。它只能由一個看過整部片、理解前後情緒脈絡、且準備好面對導演質問的人來做。



護城河存在,不代表它永遠高價

Which Layer Gets Washed Away


寫《Prada 2》的時候,我用了「無法被運算取代」這樣的字。我必須坦承:無法被運算取代,並不等於市場會盲目給予高價。


舉例像手工餅乾。

機器工業化生產的不是次級品——餅乾更均勻、更穩定、成本更低,那是它自己的一種好;手工的價值不在於「絕對更好吃」,而在於它是另一種概念——有人根據今天的濕度微調了配方,有人決定了這一爐要烤到什麼程度。


在版權與訓練集授權問題徹底解決之前(那些模型學會的東西,很大一部分來自未獲授權的創作者,這在商業授權上是極大的法律隱患),談 AI 作為獨立創作者還太早。但未來一旦法規完善,AI 生成音樂確實可以被視為一種「便宜的罐頭樂曲庫」。


屆時,會被市場沖走的,是「只負責執行、不進行審美判斷」的那一層——把別人已經決定好的需求,單純用技術寫出來的人。


對我來說,這並非壞事。配樂師最有價值的時刻,本就不在於將音符填入軌道,而在於從一片空白時與導演反覆確認:那句「我想要那種感覺」,到底是什麼感覺。


當 AI 時代到來,執行的門檻降低,決策與翻譯的價值反而變得極其顯眼。


BP Music Studio 的界線與承諾

Which Layer Gets Washed Away


既然談到實務與結構,我想將 BP 的商業分寸明確釐清,這是任何委託方都權益攸關事:


  1. 原創性與版權鏈: 交付給你的每一段配樂,無論是旋律、和聲、配器還是架構,皆由我親自創作與管轄。AI 生成音樂絕不會出現在最終交付的聲軌中。


  1. 開放且務實的前期溝通:我不排斥在前期討論時,導演拿 AI 生成的 Temp Track(臨時音樂)來溝通氛圍或素材。


導演用AI生成音樂片段,告所我其中的某個環節/素材他很喜歡,確實已經有幾次合作的導演是這麼做的。


  1. 可經受檢驗的商業授權: 作品若要進軍影展、登上院線,或發行國際串流平台,權利鏈(Chain of Title)的完整性是法律上的硬指標。這不是道德潔癖,而是商業上最基本的嚴謹。。


(註:關於罐頭音樂、AI 作曲與客製化配樂的完整授權規範,我整理在〈罐頭音樂、AI 作曲,還是找人寫?〉一文。)



【BP 觀點:在 AI 時代,判斷一個聲音夥伴的三個關鍵問題】


一、他問的問題,比他給的答案多嗎?——好的合作開場不是急著證明自己有多會寫,而是先確認雙方聽見的是不是同一片大海。
二、他敢不敢說「這裡不要有音樂」?——懂得做減法、守得住留白的人,才是真的在為作品的生命力著想,而不是在交作業。
三、出了問題,誰簽名?——這是最不浪漫、卻最真實的職業核心。

朋友傳來的那段三十秒音樂,確實「不錯」——如果只是作為休閒聆聽,那已經足夠。


但如果你正在製作一部作品,需要的是那種閉上眼睛、能聽見每一個聲音紋理如何被精準調度的配樂,那麼我們大概得從那句「還說不太清楚的話」開始聊起。


因為到最後,導演會問的還是那一句:為什麼這裡是這樣。


我希望一直是那個答得出來的人。

The question was never whether a machine can generate music. It's who stays in the room when the director asks why.

留言


bottom of page