KITT STT · 2026-09-17

平台效能測試

每個平台分成「時間測試」與「記憶體測試」。先選平台,再在同一平台內比較 CUDA、Online TRT、Offline TRT;C-X1 為預設畫面。

2026-09-17

C-X1

v6.0.0 / LoRA v3b · CUDA

image:registry.devops.foxconn.com/srdc/agent/stt/kitt-stt:v6.0.0-1-gdc02dde-thor。同一組固定 3/6/15 秒 WAV。

Online TRT/Offline TRT 未列數值。libonnxruntime_providers_tensorrt.so has unresolved libnvinfer.so.10 and libnvonnxparser.so.10; no TensorRT library was present in the image.

時間測試

完整服務 3 輪、每輪一條 WebSocket、固定 3/6/15 秒 WAV,warmup=0;bulk 與 realtime 分開執行。 完整服務 18/18 final ASR 成功。僅在同一平台內比較後端;不同版本與硬體不做絕對毫秒排名。

047941411873s6s15smsCUDACUDA · 3s:65.74 ms;CUDA 基準CUDA · 6s:78.40 ms;CUDA 基準CUDA · 15s:162.90 ms;CUDA 基準3 秒 · 相對 CUDA CUDA 65.74 ms CUDA 基準6 秒 · 相對 CUDA CUDA 78.40 ms CUDA 基準15 秒 · 相對 CUDA CUDA 162.90 ms CUDA 基準
bulk 三輪中位數;點上 hover 可看後端、毫秒與相對 CUDA。
039781181573s6s15smsCUDACUDA · 3s:64.86 ms;CUDA 基準CUDA · 6s:73.88 ms;CUDA 基準CUDA · 15s:136.33 ms;CUDA 基準3 秒 · 相對 CUDA CUDA 64.86 ms CUDA 基準6 秒 · 相對 CUDA CUDA 73.88 ms CUDA 基準15 秒 · 相對 CUDA CUDA 136.33 ms CUDA 基準
realtime 三輪中位數;點上 hover 可看後端、毫秒與相對 CUDA。
完整服務精確數值
送音音長後端中位數 ms範圍 ms相對 CUDA
bulk3sCUDA65.7457.07–69.67基準
bulk6sCUDA78.4071.46–79.79基準
bulk15sCUDA162.90149.57–165.02基準
realtime3sCUDA64.8656.73–66.05基準
realtime6sCUDA73.8866.02–84.12基準
realtime15sCUDA136.33133.95–150.27基準
Direct recognizer 與 graph

Direct recognizer 量 accept_waveform + decode_stream,與完整服務 final ASR 的計時範圍不同。

音長後端recognizer p50 msp95 ms載入 s
3sCUDA35.0541.841.867
6sCUDA43.8144.441.688
15sCUDA70.9077.271.604
後端graphp50 msp95 ms
CUDAT=5035.6135.95
CUDAT=10037.1442.24
CUDAT=25058.5361.69

CUDA:providers: ['CUDAExecutionProvider', 'CPUExecutionProvider'];node provider counts: {'CUDAExecutionProvider': 523440, 'CPUExecutionProvider': 141300}。

記憶體測試

容量主指標CUDA · 3107 MiB完整服務推論後 cgroup current
量測內容RAMcgroup、PSS、RSS、VmHWM、peak
VRAM不另拆共用記憶體或容器未提供逐程序指標
MiBCUDACUDA:3107.21 MiB3107
完整服務推論後 cgroup current;同一平台內可直接比較後端。The direct graph/recognizer child processes are included in this cgroup peak; use after_service for the service footprint.
完整服務 RAM 指標
後端時點cgroup currentPSSRSSVmHWMcgroup peak
CUDA完整服務推論後3107.211818.353013.123045.123132.18
CUDAdirect 測試後4782.591766.722960.893045.128489.22
指標與量測手法
指標意思/讀取方式
cgroup current容器目前被計帳的 RAM,包含檔案快取;從 /sys/fs/cgroup/memory.current 讀取,容量決策優先看這個。
PSS程序按比例分攤共享頁;從 PID 1 smaps_rollup 讀取。
RSS / VmHWM程序常駐 RAM/程序啟動後最高 RSS;從 PID 1 status 讀取。
cgroup peak容器歷史最高計帳 RAM;可能包含 direct 測試的暫用子程序。