Local AI · DGX Spark
AI 音樂音效工作台
打一句描述,換一段能直接用的 BGM loop 或音效。
Stable Audio Open 地端生成——素材產生器,不是歌曲生成器。
實際介面・Playwright 實機截圖
為什麼要自己蓋一個
找免版權配樂、音效素材是個無底洞:授權要顧、風格常常對不上、雲端 AI 音樂生成服務又是按量付費、要排隊等,資料還得上傳出門。做簡報、做 demo 常常臨時就要一段音效,等不起。
家裡的 DGX Spark 有一顆閒著的 GPU。把 Stable Audio Open 架起來,打一句描述就能在地端生出一段素材,不用錢、不出門。
比較費心的反而是定位:這工具生的是 BGM loop 和音效素材,不是完整歌曲,先講清楚才不會用錯場景。
原理:一段音效的旅程
從一句描述到一段立體聲 WAV,中間發生四件事。
中英文描述進站
使用者用中文或英文描述想要的音樂或音效都可以,不需要先自己翻譯。
本地 LLM 優化 prompt
本地語言模型把口語描述改寫成模型看得懂的音樂/音效描述,補上節奏、情緒、樂器、氛圍等細節,讓沒有音樂術語背景的人也能得到對味的結果。
選風格與時長,決定走快速還是完整
使用者選定風格與時長後,系統對應到兩檔模型:快速版(small)11 秒輸出,生成只要約 0.5 秒,適合大量嘗試;完整版(1.0)47 秒輸出,音質與長度更完整,代價是生成要等約 60–90 秒。
Stable Audio Open 生成立體聲輸出
模型在 DGX Spark 本地推論,直接產出立體聲 WAV,下載後就能拿去當簡報、影片或遊戲的配樂與音效素材。
原理深掘:兩檔模型的取捨
兩條路徑共用同一套 LLM 優化流程,差異全部發生在音訊擴散模型這一步。
描述輸入
中/英文皆可
/api/musicgen/optimize
本地 LLM 補齊描述
節奏/情緒/樂器/氛圍
stable-audio-open-small
快速版・8-step pingpong 取樣
11 秒輸出・約 0.5 秒生成
stable-audio-open-1.0
完整版・100-step/cfg 7/dpmpp-3m-sde
47 秒輸出・約 60–90 秒生成
44.1kHz 立體聲 WAV
輸出
base64 回傳
可直接下載
快速版 vs 完整版
small:8-step 蒸餾版,沒有 inpaint 條件,分段續接延長已實測崩壞成靜音,故不提供延長模式
1.0:官方建議 100-step/cfg 7/dpmpp-3m-sde,比 small 慢 100 倍以上
短時長(3/6 秒)是把 11 秒版輸出裁切而成;47 秒版不提供裁短,需要短音效請用 11 秒以內檔位
11s
快速版(small)輸出時長
~0.5s
快速版生成耗時
47s
完整版(1.0)輸出時長
60–90s
完整版生成耗時
關鍵設計決策
Local-first,不經雲端
生成全程在 DGX Spark 本地完成,音樂與音效素材不用上傳到任何第三方服務。
兩段式模型選擇:快速 vs 完整
快速版(small)秒級出稿,適合大量嘗試找感覺;完整版(1.0)音質與長度更完整,留給真正要用的最終素材。
明確定位「素材生成器」,不是歌曲生成器
產出是 BGM loop 與音效素材,不是完整歌曲。先講清楚期待,才不會有人拿它去要一首完整的歌。
LLM 優化 prompt,降低描述門檻
使用者不需要懂音樂術語,本地 LLM 把口語描述轉成模型聽得懂的音樂/音效描述,中英文皆可輸入。
技術架構
Frontend
中英文輸入框
風格 / 時長選擇
立體聲 WAV 下載
LLM
本地模型優化 prompt
中英文皆可輸入
風格標籤融合
Inference
Stable Audio Open
small(快速)/ 1.0(完整)
DGX Spark 本地推論
Output
立體聲 WAV
11s(快速)/ 47s(完整)
可直接下載使用
線上工具已上鎖(Basic Auth)・本頁分享架構與設計