今天用外購 API、明天換成自家機房的模型,對應用程式來說應該只是後台的一個設定。xStudio 把這件事變成真的。
把 base_url 指到 xStudio,原本的 OpenAI SDK 一行都不用改。之後要換模型、換供應商、加上備援,都在後台切換,應用程式不必重新部署。
每次呼叫都記下 token 數與台幣成本,依即時匯率換算。哪個部門、哪支金鑰、哪顆模型花掉多少,隨時查得到,不必等供應商對帳單。
金鑰綁定額度,用完當下硬切。試用專案不會因為一支迴圈寫錯,就在沒人注意的週末燒掉整季預算。
機房裡的 GPU 上架後,與外購 API 走同一套計價與監控。自建到底比外購便宜多少,可以拿同一份報表直接比。
一般使用者只要前兩區就能開始工作;後四區是管理員把上游、帳號、算力與既有 API 接進來的地方。
進來先看到自己的餘額、最近用量與可用模型清單。哪顆模型還有額度、上次呼叫失敗在哪,第一頁就講完。
第一步領金鑰、選模型、複製範例程式,貼上就能跑。金鑰只顯示一次,之後只看得到指紋與可用範圍。
第二步管理員加入外購 API 或自家端點,設定價格與權重。同一顆模型可以掛多個來源,一邊掛掉自動走另一邊。
管理員建使用者與部門、派額度與可用模型白名單。額度可以按月重設,也可以一次性發給短期專案。
管理員把機房的 GPU 機納管,一鍵上架自家模型成為可呼叫的端點。卡在誰手上、跑什麼模型、還剩多少顯存都看得到。
自建算力自家或第三方的既有 API 也能收進同一個入口,套用同一套金鑰、額度與稽核,不必為每支 API 各做一套控管。
延伸由左到右:模型怎麼接進來、開發者怎麼用、財務看到什麼。請求一進閘道就開始記帳,額度用完當下切斷。
不自己重寫模型轉接層,把成熟的開源核心包起來,補上台灣需要的計費、額度與治理。
以 LiteLLM 為轉接核心,涵蓋主流商用 API 與地端推論引擎(llama.cpp、vLLM、Ollama)。上游換掉,對外介面不變。
管理主控台、使用者入口、監控看板與模型閘道分開部署,任一個重啟不影響其他。以 Docker Compose 一鍵拉起整套。
金鑰只在建立當下顯示一次,之後存雜湊;需要還原的連線憑證以 AES-256-GCM 加密後落地。稽核紀錄寫入前先過遮罩。
這套平台本身就管著云碩機房裡的 GPU 與對外採購的 API,我們自己每天在用。不是只做給客戶看的樣板。
直接接的問題不在技術,在治理。金鑰散在各專案裡、沒人知道誰花了多少、換供應商要改一輪程式碼、地端模型與雲端 API 兩套管法。xStudio 把這些收成一個入口:金鑰集中發放、用量逐筆記錄、供應商在後台切換、自建與外購同一套報表。
會,所以同一顆模型可以掛多個上游來源並設定權重,一邊失敗自動走另一邊。閘道本身無狀態,可以多起幾份掛負載平衡。地端部署時還可以保留直連上游的緊急路徑。
凡是 OpenAI 相容的端點都接得上,包含主流商用 API 與地端推論引擎。云碩機群裡的 llama.cpp 與 vLLM 端點就是這樣掛上去的。非相容的自家 REST API 走「API 納管」那一區。
以供應商公布的每百萬 token 單價為基礎,乘上實際用量,再依當日匯率換算台幣。匯率來源與換算時點都記在紀錄裡,可以回溯。自建模型則按 GPU 時數攤提,攤提方式由管理者設定。
在算力平台那一區指定 GPU 機與模型檔,平台起推論服務並註冊成一個可呼叫的模型名稱。上架後與外購 API 在使用端看起來一樣,開發者不需要知道它跑在哪張卡上。