云碩自主 AI · 模型治理 · 地端部署

公司用了幾顆模型、花了多少錢
一個入口全都看得到

xStudio 把外購的 API 與自家 GPU 上的模型收進同一個 OpenAI 相容入口。開發者只改一行 base_url,原本的程式不動;管理者拿到逐筆用量、台幣成本與額度上限。額度用完當下就切斷,不是寄一封警告信,等到月底收帳單才發現。

1
個對外入口
TWD
即時匯率計價
逐筆
用量與成本記錄
0
廠商綁定
核心價值

模型可以換
接法不用改

今天用外購 API、明天換成自家機房的模型,對應用程式來說應該只是後台的一個設定。xStudio 把這件事變成真的。

改一行就接上

把 base_url 指到 xStudio,原本的 OpenAI SDK 一行都不用改。之後要換模型、換供應商、加上備援,都在後台切換,應用程式不必重新部署。

錢看得見

每次呼叫都記下 token 數與台幣成本,依即時匯率換算。哪個部門、哪支金鑰、哪顆模型花掉多少,隨時查得到,不必等供應商對帳單。

超量就停

金鑰綁定額度,用完當下硬切。試用專案不會因為一支迴圈寫錯,就在沒人注意的週末燒掉整季預算。

自建算力一起管

機房裡的 GPU 上架後,與外購 API 走同一套計價與監控。自建到底比外購便宜多少,可以拿同一份報表直接比。

六大功能區

依實際使用順序排列
不是照資料表擺

一般使用者只要前兩區就能開始工作;後四區是管理員把上游、帳號、算力與既有 API 接進來的地方。

登入與畫面

進來先看到自己的餘額、最近用量與可用模型清單。哪顆模型還有額度、上次呼叫失敗在哪,第一頁就講完。

第一步

打通第一個請求

領金鑰、選模型、複製範例程式,貼上就能跑。金鑰只顯示一次,之後只看得到指紋與可用範圍。

第二步

接上游供應商

管理員加入外購 API 或自家端點,設定價格與權重。同一顆模型可以掛多個來源,一邊掛掉自動走另一邊。

管理員

開帳號、給額度

建使用者與部門、派額度與可用模型白名單。額度可以按月重設,也可以一次性發給短期專案。

管理員

算力平台

把機房的 GPU 機納管,一鍵上架自家模型成為可呼叫的端點。卡在誰手上、跑什麼模型、還剩多少顯存都看得到。

自建算力

REST API 納管

自家或第三方的既有 API 也能收進同一個入口,套用同一套金鑰、額度與稽核,不必為每支 API 各做一套控管。

延伸
使用者操作流程

從接上游到看見帳單,七步走完

由左到右:模型怎麼接進來、開發者怎麼用、財務看到什麼。請求一進閘道就開始記帳,額度用完當下切斷。

xStudio 使用者操作流程圖
綠=模型接進來 藍=開發者操作 橘=管理決策 紫=平台輸出
技術與現況

以 LiteLLM 為核心
Docker Compose 一鍵起

不自己重寫模型轉接層,把成熟的開源核心包起來,補上台灣需要的計費、額度與治理。

OpenAI 相容閘道

以 LiteLLM 為轉接核心,涵蓋主流商用 API 與地端推論引擎(llama.cpp、vLLM、Ollama)。上游換掉,對外介面不變。

四個服務各司其職

管理主控台、使用者入口、監控看板與模型閘道分開部署,任一個重啟不影響其他。以 Docker Compose 一鍵拉起整套。

金鑰不落明文

金鑰只在建立當下顯示一次,之後存雜湊;需要還原的連線憑證以 AES-256-GCM 加密後落地。稽核紀錄寫入前先過遮罩。

已在自家機群運行

這套平台本身就管著云碩機房裡的 GPU 與對外採購的 API,我們自己每天在用。不是只做給客戶看的樣板。

常見問題

導入前,先把疑慮問清楚

和直接接 OpenAI 有什麼差別

直接接的問題不在技術,在治理。金鑰散在各專案裡、沒人知道誰花了多少、換供應商要改一輪程式碼、地端模型與雲端 API 兩套管法。xStudio 把這些收成一個入口:金鑰集中發放、用量逐筆記錄、供應商在後台切換、自建與外購同一套報表。

這樣會不會變成單點故障

會,所以同一顆模型可以掛多個上游來源並設定權重,一邊失敗自動走另一邊。閘道本身無狀態,可以多起幾份掛負載平衡。地端部署時還可以保留直連上游的緊急路徑。

支援哪些供應商

凡是 OpenAI 相容的端點都接得上,包含主流商用 API 與地端推論引擎。云碩機群裡的 llama.cpp 與 vLLM 端點就是這樣掛上去的。非相容的自家 REST API 走「API 納管」那一區。

台幣成本怎麼算的準

以供應商公布的每百萬 token 單價為基礎,乘上實際用量,再依當日匯率換算台幣。匯率來源與換算時點都記在紀錄裡,可以回溯。自建模型則按 GPU 時數攤提,攤提方式由管理者設定。

地端模型怎麼上架

在算力平台那一區指定 GPU 機與模型檔,平台起推論服務並註冊成一個可呼叫的模型名稱。上架後與外購 API 在使用端看起來一樣,開發者不需要知道它跑在哪張卡上。

先把「誰用了多少」弄清楚

我們可以帶著跑起來的平台到現場,接上貴單位實際在用的 API 與機房 GPU 示範。

填寫需求,安排展示 →