FUFU-LLM · GOVERNANCE

Runtime & Token Usage

即時觀察 gateway 與推論引擎壓力,並管理 API key、token 消耗與延遲。

Live runtime

每秒讀取本機 vLLM metrics;Shadow Admission 會逐次模擬接受、排隊或拒絕,但不會真的改變任何請求。

等待第一筆樣本… SHADOW · NOT APPLIED
Gateway concurrency
/ 20 active
queued · oldest
vLLM scheduler
Running
Waiting
HTTP active
Streams
Token throughput · EWMA 5s
Input tok/s
Output tok/s
Cache-hit tok/s
Requests/s
KV cacheGPU block usage
尚無 scheduler waiting reason
Latency · rolling 30sp95 / mean
Queue p95
TTFT p95
E2E p95
Inter-token mean
Safe-range observerCollecting
建議上限 · 未套用

累積連續樣本後才會顯示壓力判斷。

Shadow admission · last invocationSHADOW · 不執行
等待第一筆調用…

新請求仍會照常通過;這裡只呈現反事實判斷。

Would accept · 5m
Would queue · 5m
Would reject · 5m
Active reserved tokens
Decision mean
Gateway active · 最近 120 秒sampler 尚未啟動
Total tokens
Prompt tokens
Completion tokens
Requests
Avg latency

Usage range

可勾選多個 API Key;日期以 UTC 計算,結束日包含整天。

API Keys

Managed key 只會在建立完成時顯示完整值;Environment key 由 runtime `.env` 提供,僅可檢視。

建立新的 API Key

建立後請立即複製完整 key。Gateway 只保存不可逆摘要,之後無法再次取回。

選取NameKeySourceStatusCreatedLast usedAction
讀取中…

Daily token consumption

統計會累加同一個外部 request 內的 provider usage,包括 router/planner/research 的內部 LLM 呼叫。

尚無資料

By API Key

KeyRequestsPromptCompletionTotalLatency
尚無資料

By Profile / Model

DimensionRequestsTotal tokens
尚無資料