自己買的 GPU 常見兩種浪費:分不出去,或是分出去就收不回來。xReactor 解的是這兩件事。
選機型、按開機,約一分鐘後拿到 JupyterLab 網址與 SSH 資訊。不必寫工單、不必等人配環境、不必知道卡插在哪台機器上。
裝好的套件與資料可以存成快照,下次開機直接載入。實測跨快照連容器內的標記檔都還在,不是只存個映像名稱。
按實際開機時數計費,關機就停。閒置超過設定時間自動釋放,避免有人開著機器出差一週。
管理者設定每個團隊可見的機型、可開的實例數與儲存上限,配額由伺服器端強制執行,不是只在畫面上擋。
前三區是一般使用者的日常;後三區給團隊管理者分配資源,以及把訓練好的模型直接掛成 API。
依卡型與規格挑方案,填名稱按開機。實例列表顯示狀態、已用時數與連線資訊,關機與釋放都在同一頁。
第一步JupyterLab 直接開,或用 SSH 進去。要對外開服務就加埠對映,平台即時改路由給你一個可連的網址。
第二步資料碟掛進實例當持久空間,主控台的檔案管理器與實例內雙向同步。快照把整個環境存起來,刪錯了還能從回收桶還原。
第三步建團隊、加成員、派點數。設定可見機型與實例上限,成員用了多少、還剩多少,管理者一頁看完。
管理者訓練好的模型掛成一個對外網址:請求進來才開機、閒置到期自動關,四種路由模式可選。不必為了偶爾的呼叫養一台常開的機器。
進階時數、點數與發票資訊集中一頁。支援自訂金額與教育身分驗證,團隊帳單與個人帳單分開結算。
帳務由左到右:GPU 與資料怎麼納管、使用者怎麼開機工作、管理者怎麼分配配額。關機就不計費,閒置自動釋放。
開一台實例=在叢集裡開一個帶 GPU 限額的 Pod,不是模擬。快照、資料碟、埠對映都對應到真實的叢集操作。
以 k3s 與 NVIDIA GPU Operator 為執行層,GPU 可整卡配置或切片分配。實例內 nvidia-smi 看到的就是真卡。
快照走 containerd 的 commit,把整個環境保存成新映像,再以它開出的實例環境完整延續,不是重跑一次安裝腳本。
節點密碼移除、下載改一次性票證、金鑰只存雜湊、實例密碼 AES-256-GCM 加密、審計日誌寫入前遮罩,後台有機密防護檢查頁可一鍵驗。
平台功能已完成並通過自動化測試與前端走查,執行層的 GPU 叢集正在重建。要評估導入可以先看完整功能示範,上線時程另議。
差在收得回來。直接開帳號的結果通常是:卡被前三個要到的人長期佔著,沒人知道誰在用、用得值不值得,要收回還得去談。xReactor 讓資源有明確的借還與計費,閒置自動釋放,管理者看得到每個人的實際用量。
是。實例是叢集裡一個帶 GPU 限額的 Pod,進去跑 nvidia-smi 就會看到指定的卡與顯存。可以整卡獨占,也可以切片給多人共用同一張卡。
掛在資料碟上的不會,那是獨立的持久空間。實例本身的系統碟在釋放後回收,所以裝好的環境要存成快照。快照刪除後會先進回收桶,可以還原,確認不要了才永久刪除。
可以,這是主要的交付方式。平台與執行層都在貴單位機房內,資料與模型不出機房。也可以由云碩代管機房的算力,依實際用量計費。
平台功能已完成,執行層的 GPU 叢集正在重建中。現階段可以安排完整的功能示範與導入評估,實際上線時程要看貴單位的硬體到位狀況一起排。我們不會把還沒站穩的東西說成已經在服務。