Local AI · DGX Spark

AI 音樂音效工作台

打一句描述,換一段能直接用的 BGM loop 或音效。
Stable Audio Open 地端生成——素材產生器,不是歌曲生成器。

2026 Stable Audio Open 100% 地端
AI 音樂音效工作台 實際介面

實際介面・Playwright 實機截圖

為什麼要自己蓋一個

找免版權配樂、音效素材是個無底洞:授權要顧、風格常常對不上、雲端 AI 音樂生成服務又是按量付費、要排隊等,資料還得上傳出門。做簡報、做 demo 常常臨時就要一段音效,等不起。

家裡的 DGX Spark 有一顆閒著的 GPU。把 Stable Audio Open 架起來,打一句描述就能在地端生出一段素材,不用錢、不出門。

比較費心的反而是定位:這工具生的是 BGM loop 和音效素材,不是完整歌曲,先講清楚才不會用錯場景。

原理:一段音效的旅程

從一句描述到一段立體聲 WAV,中間發生四件事。

01

中英文描述進站

使用者用中文或英文描述想要的音樂或音效都可以,不需要先自己翻譯。

02

本地 LLM 優化 prompt

本地語言模型把口語描述改寫成模型看得懂的音樂/音效描述,補上節奏、情緒、樂器、氛圍等細節,讓沒有音樂術語背景的人也能得到對味的結果。

03

選風格與時長,決定走快速還是完整

使用者選定風格與時長後,系統對應到兩檔模型:快速版(small)11 秒輸出,生成只要約 0.5 秒,適合大量嘗試;完整版(1.0)47 秒輸出,音質與長度更完整,代價是生成要等約 60–90 秒。

04

Stable Audio Open 生成立體聲輸出

模型在 DGX Spark 本地推論,直接產出立體聲 WAV,下載後就能拿去當簡報、影片或遊戲的配樂與音效素材。

原理深掘:兩檔模型的取捨

兩條路徑共用同一套 LLM 優化流程,差異全部發生在音訊擴散模型這一步。

描述輸入

中/英文皆可

/api/musicgen/optimize

本地 LLM 補齊描述

節奏/情緒/樂器/氛圍

stable-audio-open-small

快速版・8-step pingpong 取樣

11 秒輸出・約 0.5 秒生成

stable-audio-open-1.0

完整版・100-step/cfg 7/dpmpp-3m-sde

47 秒輸出・約 60–90 秒生成

44.1kHz 立體聲 WAV

輸出

base64 回傳
可直接下載

快速版 vs 完整版

small:8-step 蒸餾版,沒有 inpaint 條件,分段續接延長已實測崩壞成靜音,故不提供延長模式
1.0:官方建議 100-step/cfg 7/dpmpp-3m-sde,比 small 慢 100 倍以上
短時長(3/6 秒)是把 11 秒版輸出裁切而成;47 秒版不提供裁短,需要短音效請用 11 秒以內檔位

11s

快速版(small)輸出時長

~0.5s

快速版生成耗時

47s

完整版(1.0)輸出時長

60–90s

完整版生成耗時

關鍵設計決策

Local-first,不經雲端

生成全程在 DGX Spark 本地完成,音樂與音效素材不用上傳到任何第三方服務。

兩段式模型選擇:快速 vs 完整

快速版(small)秒級出稿,適合大量嘗試找感覺;完整版(1.0)音質與長度更完整,留給真正要用的最終素材。

明確定位「素材生成器」,不是歌曲生成器

產出是 BGM loop 與音效素材,不是完整歌曲。先講清楚期待,才不會有人拿它去要一首完整的歌。

LLM 優化 prompt,降低描述門檻

使用者不需要懂音樂術語,本地 LLM 把口語描述轉成模型聽得懂的音樂/音效描述,中英文皆可輸入。

技術架構

Frontend

中英文輸入框
風格 / 時長選擇
立體聲 WAV 下載

LLM

本地模型優化 prompt
中英文皆可輸入
風格標籤融合

Inference

Stable Audio Open
small(快速)/ 1.0(完整)
DGX Spark 本地推論

Output

立體聲 WAV
11s(快速)/ 47s(完整)
可直接下載使用

線上工具已上鎖(Basic Auth)・本頁分享架構與設計