1 · 結論與選型
Orin 的上線選型是 Offline TRT。它在 bulk 3/6/15 秒都比 CUDA 快,且推論後的 cgroup current 是 3841 MiB,較 Online TRT 的 8630 MiB 少 55.5%。4090 也呈現相同記憶體方向,Offline TRT 較 Online TRT 少 60.0%。
複測後的差異:4090 舊資料的 15 秒 50–60% TRT 加速沒有重現;七輪複測是 bulk 約 7%、realtime 約 11–15%。Orin 的 15 秒 realtime 則在約 180 與 222 ms 間形成雙峰,Online/Offline 都會出現,因此不能用單次中位數宣稱兩者誰較快;bulk 約 220 ms 的結果穩定。
完整服務 final ASR latency 與直接 recognizer 的數值不相等,因為計時範圍不同。第 3、4 節量 accept_waveform + decode_stream,第 5 節從 VAD stop 後的 final ASR 路徑開始量。
2 · 測試方法與邊界
2.1 同一份 code 與音訊
- branch:
feat/orin-tensorrt;HEAD:a24a2fee4dfd;上游:740950fe61de。 - 兩平台的 LoRA v2
model.onnx與 tokens SHA-256 相同;3/6/15 秒 WAV 也固定並記錄 hash。 - 4090 使用本次建出的 x86 image;Orin 使用同版 ARM64 runtime/builder image。TensorRT engine 都在各自目標 GPU 建立。
- 只比較同一平台內的 CUDA/Online TRT/Offline TRT;不以絕對毫秒排名兩台不同硬體。
2.2 重複與計時
- 模型 graph 與 provider proof 分開跑;direct recognizer 每個音長使用新程序。
- 主服務每後端跑 3 輪,單一 WebSocket 依序送 3/6/15 秒,bulk 與 realtime 各一組;圖表採三輪中位數。兩台另各跑每後端 7 次 15 秒 bulk/realtime。
- 所有主服務與七輪複測統一使用
warmup=0,後端順序在複測改為 Offline → CUDA → Online,降低固定順序偏差。 - 滑鼠 hover 會顯示同平台、同音長的 CUDA/Online TRT/Offline TRT 毫秒、相對 CUDA 百分比與速度倍數。
使用的腳本與實際手法
| 腳本 | 用在哪裡 | 手法 |
|---|---|---|
recheck2-4090-full-warm0.sh | RTX 4090 主服務 | 以本次 x86 runtime image 對三後端各跑三輪 3/6/15 秒與 RAM/VRAM。 |
recheck2-4090-15s.sh | RTX 4090 不一致複測 | 每個後端建立獨立新服務,連續跑 7 次 15 秒 bulk/realtime。 |
run-orin-warm0.py | Orin 主服務 | CUDA、Online TRT、Offline TRT 各 3 輪 3/6/15 秒 bulk/realtime;warmup=0。 |
recheck2-orin-15s.py | Orin 不一致複測 | 以暫用 Pod 對三後端各連續跑 7 次 15 秒,完成後保留正式 Offline deployment。 |
run-orin.py、provider_recheck.py | 模型層/provider proof | 直接量 graph、recognizer、provider profiler 與 target-built Offline bundle。 |
deploy.sh、build_offline_trt_bundle.py | 正式 Orin | 套用 Offline overlay,builder Job 比對指紋後建置或重用 target-built bundle,Deployment 等待完成標記才啟動。 |
service-memory.py | 兩平台完整服務 | 讀 PID 1 的 status/smaps_rollup 與 cgroup ready/end;4090 另讀 nvidia-smi 整卡 VRAM。 |
Direct recognizer 是 decode 指標,不是純 GPU kernel 時間;完整服務的 server_latency_ms 是 VAD stop 後的 final ASR,兩者不能直接換算。Recognizer JSON 雖保留 warmup=10 參數欄位,該分支實際只先做 1 次 3 秒 decode,再收樣本。
3 · RTX 4090 模型後端
Recognizer latency 的範圍:accept_waveform + decode_stream,包括音訊送入與 feature preparation,不含 WebSocket、VAD、ITN 與模型載入。固定 shape graph 表最接近單純 ORT 模型圖的比較。
三條線顯示本輪直接 recognizer 的 p50;hover 可看每個音長的三後端值與相對 CUDA。
精確數值
| 音長 | 後端 | p50 ms | p95 ms | 載入 s | 相對 CUDA |
|---|---|---|---|---|---|
| 3s | CUDA | 12.36 | 12.43 | 1.989 | +0.0% |
| 3s | Online TRT | 16.44 | 16.56 | 47.980 | +33.0% |
| 3s | Offline TRT | 16.32 | 16.54 | 2.708 | +32.1% |
| 6s | CUDA | 16.92 | 24.30 | 1.319 | +0.0% |
| 6s | Online TRT | 21.71 | 29.88 | 11.307 | +28.3% |
| 6s | Offline TRT | 17.04 | 23.52 | 2.531 | +0.7% |
| 15s | CUDA | 33.49 | 45.21 | 2.254 | +0.0% |
| 15s | Online TRT | 29.02 | 34.47 | 10.720 | -13.4% |
| 15s | Offline TRT | 46.47 | 62.50 | 1.777 | +38.8% |
固定 shape graph 與 provider 證明
| 後端 | T=50 p50 | T=100 p50 | T=250 p50 | profiler 節點 |
|---|---|---|---|---|
| CUDA | 8.54 | 8.94 | 11.34 | {'CUDAExecutionProvider': 2908, 'CPUExecutionProvider': 785} |
| Online TRT | 9.02 | 6.14 | 10.23 | {'TensorrtExecutionProvider': 1} |
| Offline TRT | 6.09 | 5.83 | 9.76 | {'TensorrtExecutionProvider': 1} |
4 · Orin AGX 模型後端
Orin 的 direct recognizer 在 3/6/15 秒均由 Online TRT/Offline TRT 低於 CUDA;Offline 3、6、15 秒分別相對 CUDA -38.5%、-27.3%、-8.7%。
每個音長的新程序 direct recognizer p50;hover 以 CUDA 為固定基準。
精確數值
| 音長 | 後端 | p50 ms | p95 ms | 載入 s | 相對 CUDA |
|---|---|---|---|---|---|
| 3s | CUDA | 45.15 | 45.20 | 3.309 | +0.0% |
| 3s | Online TRT | 28.66 | 28.83 | 69.029 | -36.5% |
| 3s | Offline TRT | 27.78 | 28.05 | 8.038 | -38.5% |
| 6s | CUDA | 54.48 | 79.44 | 3.000 | +0.0% |
| 6s | Online TRT | 40.08 | 55.03 | 16.752 | -26.4% |
| 6s | Offline TRT | 39.62 | 52.00 | 7.964 | -27.3% |
| 15s | CUDA | 88.11 | 106.34 | 2.992 | +0.0% |
| 15s | Online TRT | 81.25 | 88.91 | 16.424 | -7.8% |
| 15s | Offline TRT | 80.49 | 85.62 | 7.950 | -8.7% |
固定 shape graph 與 provider 證明
| 後端 | T=50 p50 | T=100 p50 | T=250 p50 | profiler 節點 |
|---|---|---|---|---|
| CUDA | 36.72 | 37.36 | 44.94 | {'CUDAExecutionProvider': 2908, 'CPUExecutionProvider': 785} |
| Online TRT | 20.35 | 20.98 | 40.21 | {'TensorrtExecutionProvider': 1} |
| Offline TRT | 19.26 | 20.18 | 37.88 | {'TensorrtExecutionProvider': 1} |
以同一支 build_offline_trt_bundle.py --force 完整建置並驗證:Orin 80.78 秒;4090 27.57 秒。兩者 runtime 與 GPU 架構不同;這是產生平台專屬 EP context/engine 的一次性成本,不是每次服務啟動成本。
5 · 完整 STT 服務的 final ASR latency
這裡是服務 final ASR,不是第 3、4 節的 direct recognizer。計時從 VAD stop 後進入 final ASR,包含尾段處理、prep、lock、decode 與 ITN;不含先前 realtime interim 累積與送音時間。因此應以各節自身的 CUDA 基準比較,不能把兩節百分比相乘或相減。
5.1 RTX 4090
三輪 warmup=0 主測;TRT 的 15 秒優勢縮小,七輪結果見第 7 節。
三輪 warmup=0 主測;15 秒三後端接近,七輪用來判斷穩定性。
精確數值
| 送音 | 音長 | 後端 | 三輪中位數 ms | 範圍 ms | 相對 CUDA |
|---|---|---|---|---|---|
| bulk | 3s | CUDA | 31.71 | 30.42–35.40 | +0.0% |
| bulk | 3s | Online TRT | 23.24 | 22.02–25.36 | -26.7% |
| bulk | 3s | Offline TRT | 21.50 | 21.28–24.46 | -32.2% |
| bulk | 6s | CUDA | 42.17 | 42.06–46.23 | +0.0% |
| bulk | 6s | Online TRT | 32.44 | 32.32–34.89 | -23.1% |
| bulk | 6s | Offline TRT | 34.56 | 33.07–35.88 | -18.0% |
| bulk | 15s | CUDA | 82.45 | 79.73–88.65 | +0.0% |
| bulk | 15s | Online TRT | 75.49 | 75.09–83.16 | -8.4% |
| bulk | 15s | Offline TRT | 77.84 | 74.93–102.36 | -5.6% |
| realtime | 3s | CUDA | 38.60 | 31.54–45.38 | +0.0% |
| realtime | 3s | Online TRT | 28.92 | 25.20–30.20 | -25.1% |
| realtime | 3s | Offline TRT | 26.75 | 20.02–36.02 | -30.7% |
| realtime | 6s | CUDA | 49.53 | 44.10–49.96 | +0.0% |
| realtime | 6s | Online TRT | 34.59 | 32.39–46.54 | -30.2% |
| realtime | 6s | Offline TRT | 42.81 | 39.86–51.43 | -13.6% |
| realtime | 15s | CUDA | 70.24 | 69.04–75.13 | +0.0% |
| realtime | 15s | Online TRT | 71.21 | 69.04–75.40 | +1.4% |
| realtime | 15s | Offline TRT | 67.04 | 65.81–68.36 | -4.6% |
5.2 Orin AGX
Offline TRT 在三個 bulk 音長的中位數均低於 CUDA。
15 秒會落在約 180/222 ms 兩群;第 7 節列出七輪範圍。
精確數值
| 送音 | 音長 | 後端 | 三輪中位數 ms | 範圍 ms | 相對 CUDA |
|---|---|---|---|---|---|
| bulk | 3s | CUDA | 126.92 | 124.69–127.40 | +0.0% |
| bulk | 3s | Online TRT | 84.60 | 84.25–84.77 | -33.3% |
| bulk | 3s | Offline TRT | 84.44 | 77.04–85.09 | -33.5% |
| bulk | 6s | CUDA | 152.80 | 152.50–158.44 | +0.0% |
| bulk | 6s | Online TRT | 103.63 | 103.50–109.73 | -32.2% |
| bulk | 6s | Offline TRT | 110.24 | 105.21–110.66 | -27.9% |
| bulk | 15s | CUDA | 243.12 | 241.65–252.72 | +0.0% |
| bulk | 15s | Online TRT | 220.80 | 219.67–235.42 | -9.2% |
| bulk | 15s | Offline TRT | 219.64 | 218.08–233.67 | -9.7% |
| realtime | 3s | CUDA | 123.29 | 121.53–135.33 | +0.0% |
| realtime | 3s | Online TRT | 68.59 | 64.88–72.12 | -44.4% |
| realtime | 3s | Offline TRT | 68.73 | 68.22–69.53 | -44.3% |
| realtime | 6s | CUDA | 133.25 | 133.20–153.32 | +0.0% |
| realtime | 6s | Online TRT | 90.65 | 90.14–91.05 | -32.0% |
| realtime | 6s | Offline TRT | 91.40 | 91.19–91.54 | -31.4% |
| realtime | 15s | CUDA | 208.59 | 208.51–247.52 | +0.0% |
| realtime | 15s | Online TRT | 180.86 | 179.69–224.94 | -13.3% |
| realtime | 15s | Offline TRT | 223.92 | 179.19–225.47 | +7.3% |
6 · 記憶體:RAM / VRAM,不含 disk
主圖先看 cgroup current:它是整個容器現在被計帳的 RAM,包含檔案快取。可用按鈕切換「推論後」與「載入完成」;PSS、RSS、VmHWM 與 cgroup peak 留在詳細表與第二張圖。
6.1 RTX 4090 完整服務
推論後時,以 CUDA 的容器計帳記憶體最低;同一張固定尺度可直接比較切換前後。
載入完成時,以 CUDA 的容器計帳記憶體最低;同一張固定尺度可直接比較切換前後。
PSS、RSS 與程序峰值的口徑不同;容量決策先看 cgroup current,再用這張圖判讀程序共享頁與歷史峰值。
完整記憶體數值
| 後端 | 時點 | cgroup current | PSS | RSS | VmHWM | cgroup peak |
|---|---|---|---|---|---|---|
| CUDA | 載入完成 | 1901.11 | 2258.27 | 2265.41 | 2359.09 | 2001.46 |
| CUDA | 推論後 | 2014.01 | 2371.13 | 2378.18 | 2411.01 | 2411.02 |
| Online TRT | 載入完成 | 7540.01 | 8955.07 | 8962.12 | 9638.14 | 8225.70 |
| Online TRT | 推論後 | 7643.71 | 9057.88 | 9065.01 | 9638.14 | 8225.70 |
| Offline TRT | 載入完成 | 2949.81 | 1994.22 | 2001.32 | 2917.75 | 3875.99 |
| Offline TRT | 推論後 | 3058.70 | 2102.94 | 2110.12 | 2917.75 | 3875.99 |
6.2 Orin AGX 完整服務
推論後時,以 Offline TRT 的容器計帳記憶體最低;同一張固定尺度可直接比較切換前後。
載入完成時,以 Offline TRT 的容器計帳記憶體最低;同一張固定尺度可直接比較切換前後。
PSS、RSS 與程序峰值的口徑不同;容量決策先看 cgroup current,再用這張圖判讀程序共享頁與歷史峰值。
完整記憶體數值
| 後端 | 時點 | cgroup current | PSS | RSS | VmHWM | cgroup peak |
|---|---|---|---|---|---|---|
| CUDA | 載入完成 | 3788.12 | 1640.82 | 3884.71 | 3908.00 | kernel 未提供 |
| CUDA | 推論後 | 3912.67 | 1744.22 | 4010.12 | 4053.75 | kernel 未提供 |
| Online TRT | 載入完成 | 8453.74 | 6309.40 | 8726.87 | 9447.70 | kernel 未提供 |
| Online TRT | 推論後 | 8629.85 | 6412.33 | 8905.12 | 9447.70 | kernel 未提供 |
| Offline TRT | 載入完成 | 3653.68 | 1457.86 | 3803.24 | 4286.32 | kernel 未提供 |
| Offline TRT | 推論後 | 3840.65 | 1570.06 | 3990.62 | 4286.32 | kernel 未提供 |
6.3 模型後端本身:直接 recognizer
每個音長使用新程序;圖中取 3、6、15 秒三個 end 快照的中位數,能看出模型後端本身的容器記憶體成本。
直接 recognizer 記憶體中位數
| 後端 | cgroup current | PSS | RSS | VmHWM |
|---|---|---|---|---|
| CUDA | 1104.79 | 1318.78 | 1323.22 | 1354.52 |
| Online TRT | 5834.54 | 7532.29 | 7537.36 | 9411.94 |
| Offline TRT | 588.89 | 963.31 | 968.43 | 1571.82 |
每個音長使用新程序;圖中取 3、6、15 秒三個 end 快照的中位數,能看出模型後端本身的容器記憶體成本。
直接 recognizer 記憶體中位數
| 後端 | cgroup current | PSS | RSS | VmHWM |
|---|---|---|---|---|
| CUDA | 2187.54 | 1097.73 | 2299.20 | 2348.36 |
| Online TRT | 7759.07 | 5522.38 | 7027.82 | 8613.00 |
| Offline TRT | 850.67 | 864.86 | 2174.70 | 2280.00 |
6.4 首次建 engine、暖快取與 Offline 載入
| 平台 | Online TRT 空 cache 載入 s | Online TRT 暖 cache 載入 s | Offline artifact 冷建 s | Offline TRT 載入 s |
|---|---|---|---|---|
| 4090 | 47.980 | 11.014 | 27.570 | 2.531 |
| Orin | 69.029 | 16.588 | 80.779 | 7.964 |
Orin Online TRT cold-cache 完整服務記憶體
| 時點 | cgroup current MiB | PSS MiB | RSS MiB | VmHWM MiB |
|---|---|---|---|---|
| 載入完成 | 9157.18 | 6200.10 | 8736.50 | 9380.16 |
| 首次 3 秒推論後 | 9210.14 | 6223.58 | 8787.19 | 9380.16 |
6.5 RTX 4090 整卡 VRAM
整卡 VRAM 含背景程序,所以圖表只把同測項前後差當近似增量。
VRAM 原始快照
| 後端 | 測前 MiB | 推論後 MiB | 增量 |
|---|---|---|---|
| CUDA | 2540 | 5035 | +2495 |
| Online TRT | 2540 | 5199 | +2659 |
| Offline TRT | 2540 | 5193 | +2653 |
6.6 指標、平台與手法
| 指標 | RTX 4090 | Orin | 測什麼/怎麼測 |
|---|---|---|---|
| cgroup current | 有 | 有 | 整個容器目前被計帳的 RAM,含檔案快取;讀 /sys/fs/cgroup/memory.current,主圖優先看這個。 |
| PSS | 有 | 有 | 程序按比例分攤共享頁;讀 PID 1 的 smaps_rollup。 |
| RSS | 有 | 有 | 程序常駐 RAM,共享頁在每個程序都完整計入;讀 PID 1 的 VmRSS。 |
| VmHWM | 有 | 有 | 程序啟動至今最高 RSS;讀 PID 1 的 VmHWM。 |
| cgroup peak | 有 | kernel 未提供 | 容器歷史最高計帳 RAM;4090 讀 memory.peak,Orin 不填零。 |
| MemTotal / MemAvailable | 有 | 有 | 整台主機總 RAM 與當下可用 RAM,只作背景交叉檢查。 |
| GPU memory.used | 有 | 不另拆 | 4090 以 nvidia-smi 讀整卡 VRAM;Orin CPU/GPU 共用 LPDDR,沒有獨立 per-process VRAM。 |
7 · 新舊差異與不一致
正文只使用本輪 rebase 後的 v5.10/LoRA v2 數據。歷史附錄僅保留上一輪 cycle 的 4090 CUDA/Online TRT,用來看重測差異;它不是這輪的主結論。Orin 沒有歷史數據混入。
4090 上一輪與本輪逐項差異
| 後端 | 送音 | 音長 | 上一輪 ms | 本輪 ms | 本輪差異 |
|---|---|---|---|---|---|
| CUDA | bulk | 3s | 22.45 | 31.71 | +41.2% |
| CUDA | bulk | 6s | 26.83 | 42.17 | +57.2% |
| CUDA | bulk | 15s | 72.64 | 82.45 | +13.5% |
| CUDA | realtime | 3s | 28.21 | 38.60 | +36.8% |
| CUDA | realtime | 6s | 30.55 | 49.53 | +62.1% |
| CUDA | realtime | 15s | 74.55 | 70.24 | -5.8% |
| Online TRT | bulk | 3s | 13.34 | 23.24 | +74.2% |
| Online TRT | bulk | 6s | 17.97 | 32.44 | +80.5% |
| Online TRT | bulk | 15s | 75.10 | 75.49 | +0.5% |
| Online TRT | realtime | 3s | 17.98 | 28.92 | +60.8% |
| Online TRT | realtime | 6s | 13.37 | 34.59 | +158.7% |
| Online TRT | realtime | 15s | 54.44 | 71.21 | +30.8% |
7.1 15 秒七輪控制複測
| 平台 | 送音 | 後端 | 中位數 ms | 範圍 ms | MAD ms | 相對 CUDA |
|---|---|---|---|---|---|---|
| RTX 4090 | bulk | CUDA | 81.03 | 79.65–89.05 | 1.11 | +0.0% |
| RTX 4090 | bulk | Online TRT | 75.17 | 74.48–82.84 | 0.52 | -7.2% |
| RTX 4090 | bulk | Offline TRT | 75.42 | 74.63–82.53 | 0.40 | -6.9% |
| RTX 4090 | realtime | CUDA | 80.77 | 69.41–86.08 | 3.39 | +0.0% |
| RTX 4090 | realtime | Online TRT | 68.53 | 63.07–76.28 | 3.62 | -15.2% |
| RTX 4090 | realtime | Offline TRT | 71.70 | 62.05–76.56 | 4.17 | -11.2% |
| Orin | bulk | CUDA | 238.19 | 237.91–251.85 | 0.28 | +0.0% |
| Orin | bulk | Online TRT | 220.64 | 219.62–232.86 | 0.43 | -7.4% |
| Orin | bulk | Offline TRT | 220.11 | 219.28–234.38 | 0.36 | -7.6% |
| Orin | realtime | CUDA | 205.78 | 203.02–238.21 | 1.37 | +0.0% |
| Orin | realtime | Online TRT | 221.46 | 180.38–223.92 | 2.46 | +7.6% |
| Orin | realtime | Offline TRT | 181.75 | 178.95–226.78 | 0.48 | -11.7% |
RTX 4090:舊主測 CUDA 15 秒曾漂到約 189 ms,造成 50–60% 的表面加速。這次相同 warmup、獨立新服務與輪替順序後,七輪 bulk 的 Online/Offline TRT 分別為 -7.2%/-6.9%,realtime 為 -15.2%/-11.2%;TRT 仍快,但幅度較小。
Orin:Online TRT realtime 七輪是 180.38, 181.31, 221.46, 222.14, 223.92, 181.39, 222.45 ms;Offline TRT 是 221.66, 181.64, 181.61, 181.75, 226.78, 182.23, 178.95 ms。兩者都出現約 180/222 ms 雙峰,中位數由兩群各自出現幾次決定;目前只能說 Offline/Online bulk 都穩定快於 CUDA,不能用這組 realtime 排名 Online 與 Offline。
MAD 是相對中位數的絕對偏差中位數。完整原始樣本、失敗嘗試與排除原因都保留在下載 JSON。
8 · Build、部署與驗證
| 項目 | 時間 | 說明 |
|---|---|---|
| 4090 基礎 image build | 19.85 s | 本輪 x86 基礎 image build。 |
| 4090 TensorRT 測試層 | 334.23 s | 安裝 TensorRT 的測試 image layer。 |
Orin Online TRT skaffold deploy -p orin-online | 33.78 s | Skaffold rollout 33.167 s;這筆不是完整 deploy.sh。 |
| Orin Offline TRT 首次實機 build/deploy | 374.74 s | 包含 target builder Job;Skaffold rollout 154.742 s。 |
| Orin Offline TRT 最終 deploy-only | 58.03 s | bundle 指紋相同而重用;Skaffold rollout 25.539 s。 |
Dockerfile.orin 的 sherpa-onnx build jobs 使用 max(1, floor(nproc / 2));本輪量測 image 的依賴層有 cache 命中,不能從 deploy 總時間推導這項變更的加速比例。
registry.devops.foxconn.com/srdc/agent/stt/kitt-stt:v5.10.0-remeasure-20260908-relative-context-wip-orin;Pod Running,restart 0,Offline init exit {'wait-offline-trt-bundle': 0}。bundle .complete 已存在,context model 12,260 bytes,sm87 engine 986,486,764 bytes。最終 production smoke:bulk 3 秒 ok、realtime 3 秒 ok。8.1 Orin Online/Offline YAML 與 bundle
deployment/k3s-orin/base 放共用 Deployment/Service/Route;overlays/online 掛 Online TRT config;overlays/offline 加入 builder Job、等待 init container 與 Offline bundle mount。切換由 YAML overlay/Skaffold profile 決定,deploy.sh 不在 runtime config 內硬改 provider。
Offline bundle 的模型、config、builder、ORT、TensorRT、裝置指紋有變化時才重建;這輪 Orin bundle 建在 sm87 上,沒有使用 4090 的 sm89 engine。這次正式 deploy-only 顯示 Offline TensorRT bundle is current,之後 pod 等待 Offline 完成標記並已成功 rollout。
8.2 驗證結果與限制
- 完整服務主統計:108/108 個 final ASR 結果成功;15 秒控制複測:84/84 成功。
- 正式 Offline TRT production smoke:bulk 3 秒 ok、realtime 3 秒 ok,不混入三輪主要統計。
- Orin provider proof:CUDA graph 記錄 CUDA/CPU 節點;Online TRT 與 Offline TRT 的 profiler 節點計數皆為
{'TensorrtExecutionProvider': 1}/{'TensorrtExecutionProvider': 1}。 - Relative-context source guard 與 Python compile 通過;本機 Python 沒有安裝 pytest,因此未把 pytest suite 宣稱為已跑。
- 暫用 Orin benchmark pods 都已清理,只保留正式 Offline TRT deployment;此輪沒有 commit 或 push Git branch。
8.3 名詞
| 名詞 | 本報告的意思 |
|---|---|
| Online TRT | 服務讀完整 ONNX,在目標 GPU 建圖或命中 engine cache。 |
| Offline TRT / EP context model | 先在目標機產生 ONNX context,載入時引用外部 TensorRT engine;此輪的目的包含降低服務建圖 RAM。 |
| sm87 / sm89 | NVIDIA compute capability;Orin 為 sm87、RTX 4090 為 sm89,TensorRT engine 不跨機搬用。 |
| VAD | Voice Activity Detection;完整服務 final ASR latency 從 VAD stop 後開始。 |
| PSS / RSS / VmHWM | 程序記憶體的分攤、常駐與歷史峰值口徑;容量主判斷仍看 cgroup current。 |
| VRAM | 4090 的獨立顯存;Orin CPU/GPU 共用 LPDDR,所以不建立假想的獨立 VRAM 欄。 |
下載本輪完整 JSON(含每輪 raw sample、記憶體快照、provider proof、部署資料與 4090 歷史比較)