KITT STT · 2026-09-04 CYCLE · REBASE 後完整重測

Orin 與 RTX 4090
三後端效能與記憶體

正文全部採用 a16280f rebase 到最新 origin/main 後的新數據。CUDA、Online TRT、Offline TRT 都以 3/6/15 秒測試模型與完整 STT 服務;舊 4090 數字只留在歷史附錄。

FP323 / 6 / 15 秒bulk / realtimeRAM / VRAM未 commit

1 · 結論與選型

Orin Offline TRT · bulk-43.8% ~ -18.1%相對同音長 CUDA
4090 Offline TRT · bulk-48.7% ~ -20.1%相對同音長 CUDA
推論後 cgroup 節省Orin 55.4%Offline TRT 相對 Online TRT
完整服務有效結果108 / 108兩平台三後端三輪

建議選 Offline TRT。兩台的 Offline TRT 速度與 Online TRT 接近,但完整服務 RAM 大幅下降:Orin 推論後 cgroup current 比 Online TRT 少 55.4%,4090 少 77.5%。4090 的 VRAM 增量則幾乎相同,表示 Offline TRT 主要省下 host RAM/統一記憶體中的建圖成本。

正式 Orin 已切到 target-built Offline TRT bundle;engine 由 Orin 的 sm87/TensorRT runtime 產生,沒有搬用 4090 的 sm89 engine。模型權重、tokens 與主要服務 source hash 在兩平台相同。

2 · 測試方法與邊界

2.1 同一份 code

  • branch:feat/orin-tensorrt;HEAD:a16280f1ea7e
  • origin/main4ee182123144,已驗證為 HEAD 祖先。
  • 4090 從根目錄 Dockerfile 建 image;Orin 由 deploy.sh build/push/deploy。
  • 音訊 SHA-256 固定,三個後端共用同一份 3/6/15 秒 WAV。

2.2 重複與計時

  • 模型 graph:T=50/100/250,暖機 10 次、正式 50 次,主計時不開 profiler。
  • 直接 recognizer:每音長新程序,先以 3 秒暖機一次,再正式解碼 3 次。
  • 完整服務:每後端一個新容器/Pod,暖機 3 次;3/6/15 秒 bulk、realtime 各跑 3 輪,表與線圖用三輪中位數。
  • Hover 點位固定以同平台、同音長 CUDA 為基準,顯示毫秒與百分比。
使用的腳本與實際手法
腳本用在哪裡手法
deploy.shOrinDVC 模型檢查、ARM64 image build、push、套用 k3s manifest、等待 rollout;本輪另記整段時間。
tests/batch_decode/provider_recheck.py4090 / Orin直接量 ORT graph、sherpa-onnx recognizer、載入時間與程序/cgroup 記憶體;短 profiler run 只證明 provider 分配。
tests/batch_decode/hardware_profile.py4090 / Orin 完整服務經 5 行 wrapper 先載入服務 library 對齊,再執行版控腳本;單一 WebSocket series 比較 bulk 與 realtime。
service-memory.py(gitignored helper)完整服務/proc/1/status/proc/1/smaps_rollup/sys/fs/cgroup 讀 ready/end;4090 再以 nvidia-smi 量整卡顯存。

兩平台 runtime 不完全相同(4090 ORT 1.23.2;Orin ORT 1.24.0),因此只比較各平台內後端差異,不用絕對毫秒做跨機排名。4090 GPU 還有其他程序,VRAM 以同測項前後增量解讀。

3 · RTX 4090 模型後端

081725333s6s15smsCUDACUDA · 3s:12.39 ms;相對 CUDA +0.0%(+0.00 ms)CUDA · 6s:16.98 ms;相對 CUDA +0.0%(+0.00 ms)CUDA · 15s:29.04 ms;相對 CUDA +0.0%(+0.00 ms)Online TRTOnline TRT · 3s:10.01 ms;相對 CUDA -19.2%(-2.38 ms)Online TRT · 6s:13.90 ms;相對 CUDA -18.1%(-3.07 ms)Online TRT · 15s:28.32 ms;相對 CUDA -2.5%(-0.71 ms)Offline TRTOffline TRT · 3s:9.80 ms;相對 CUDA -20.9%(-2.59 ms)Offline TRT · 6s:14.22 ms;相對 CUDA -16.3%(-2.76 ms)Offline TRT · 15s:29.86 ms;相對 CUDA +2.8%(+0.83 ms)

Online TRT 與 Offline TRT 在 3、6 秒都快於 CUDA;15 秒三者接近,直接 recognizer 沒有顯示明顯 TRT 回歸。

精確數值
音長後端p50 msp95 ms載入 s相對 CUDA
3sCUDA12.3912.603.065+0.0%
3sOnline TRT10.0110.1540.634-19.2%
3sOffline TRT9.8010.121.490-20.9%
6sCUDA16.9824.551.282+0.0%
6sOnline TRT13.9015.967.079-18.1%
6sOffline TRT14.2222.361.499-16.3%
15sCUDA29.0436.991.358+0.0%
15sOnline TRT28.3228.845.682-2.5%
15sOffline TRT29.8636.181.602+2.8%
固定 shape graph 與 provider 證明
後端T=50 p50T=100 p50T=250 p50profiler 節點
CUDA8.238.1910.66{'CUDAExecutionProvider': 2908, 'CPUExecutionProvider': 785}
Online TRT5.875.8310.20{'TensorrtExecutionProvider': 1}
Offline TRT5.905.7910.06{'TensorrtExecutionProvider': 1}

4 · Orin AGX 模型後端

0254974983s6s15smsCUDACUDA · 3s:45.21 ms;相對 CUDA +0.0%(+0.00 ms)CUDA · 6s:54.44 ms;相對 CUDA +0.0%(+0.00 ms)CUDA · 15s:87.74 ms;相對 CUDA +0.0%(+0.00 ms)Online TRTOnline TRT · 3s:28.11 ms;相對 CUDA -37.8%(-17.11 ms)Online TRT · 6s:39.53 ms;相對 CUDA -27.4%(-14.91 ms)Online TRT · 15s:81.89 ms;相對 CUDA -6.7%(-5.85 ms)Offline TRTOffline TRT · 3s:27.81 ms;相對 CUDA -38.5%(-17.40 ms)Offline TRT · 6s:39.60 ms;相對 CUDA -27.3%(-14.84 ms)Offline TRT · 15s:81.25 ms;相對 CUDA -7.4%(-6.49 ms)

Orin 的 Online TRT 與 Offline TRT 幾乎重疊;3、6 秒加速最明顯,15 秒收益縮小。

精確數值
音長後端p50 msp95 ms載入 s相對 CUDA
3sCUDA45.2145.342.872+0.0%
3sOnline TRT28.1128.5066.583-37.8%
3sOffline TRT27.8128.077.945-38.5%
6sCUDA54.4481.142.756+0.0%
6sOnline TRT39.5354.6714.710-27.4%
6sOffline TRT39.6052.717.932-27.3%
15sCUDA87.74107.942.820+0.0%
15sOnline TRT81.8989.8014.863-6.7%
15sOffline TRT81.2586.937.930-7.4%
固定 shape graph 與 provider 證明
後端T=50 p50T=100 p50T=250 p50profiler 節點
CUDA36.3036.9944.97{'CUDAExecutionProvider': 2908, 'CPUExecutionProvider': 785}
Online TRT19.9720.3939.47{'TensorrtExecutionProvider': 1}
Offline TRT19.2519.8838.58{'TensorrtExecutionProvider': 1}

Offline TRT artifact 在 Orin 冷建一次花 67.49 秒;4090 是 22.84 秒。這是產生平台專屬 EP context 與 engine 的一次性成本,不是每次服務啟動成本。

5 · 完整 STT 服務

5.1 RTX 4090

0122335473s6s15smsCUDACUDA · 3s:24.29 ms;相對 CUDA +0.0%(+0.00 ms)CUDA · 6s:26.86 ms;相對 CUDA +0.0%(+0.00 ms)CUDA · 15s:41.95 ms;相對 CUDA +0.0%(+0.00 ms)Online TRTOnline TRT · 3s:16.17 ms;相對 CUDA -33.4%(-8.12 ms)Online TRT · 6s:17.24 ms;相對 CUDA -35.8%(-9.62 ms)Online TRT · 15s:33.84 ms;相對 CUDA -19.3%(-8.11 ms)Offline TRTOffline TRT · 3s:12.46 ms;相對 CUDA -48.7%(-11.83 ms)Offline TRT · 6s:16.95 ms;相對 CUDA -36.9%(-9.91 ms)Offline TRT · 15s:33.53 ms;相對 CUDA -20.1%(-8.42 ms)

三輪中位數中 Offline TRT 的 3、6、15 秒 bulk 都快於 CUDA;15 秒另一次複測也落在相同區間。

0102031413s6s15smsCUDACUDA · 3s:36.53 ms;相對 CUDA +0.0%(+0.00 ms)CUDA · 6s:23.18 ms;相對 CUDA +0.0%(+0.00 ms)CUDA · 15s:34.92 ms;相對 CUDA +0.0%(+0.00 ms)Online TRTOnline TRT · 3s:10.81 ms;相對 CUDA -70.4%(-25.72 ms)Online TRT · 6s:18.20 ms;相對 CUDA -21.5%(-4.98 ms)Online TRT · 15s:21.47 ms;相對 CUDA -38.5%(-13.45 ms)Offline TRTOffline TRT · 3s:11.25 ms;相對 CUDA -69.2%(-25.28 ms)Offline TRT · 6s:20.48 ms;相對 CUDA -11.6%(-2.70 ms)Offline TRT · 15s:23.80 ms;相對 CUDA -31.8%(-11.12 ms)

realtime 的 final recognizer 延遲不含 3/6/15 秒送音時間;三個音長的 Offline TRT 中位數都低於 CUDA。

精確數值
送音音長後端三輪中位數 ms範圍 ms相對 CUDA
bulk3sCUDA24.2922.70–25.69+0.0%
bulk3sOnline TRT16.1713.12–20.90-33.4%
bulk3sOffline TRT12.4611.97–12.95-48.7%
bulk6sCUDA26.8626.49–30.88+0.0%
bulk6sOnline TRT17.2417.13–19.86-35.8%
bulk6sOffline TRT16.9516.34–19.54-36.9%
bulk15sCUDA41.9540.50–54.10+0.0%
bulk15sOnline TRT33.8433.58–42.53-19.3%
bulk15sOffline TRT33.5333.34–39.89-20.1%
realtime3sCUDA36.5324.39–39.90+0.0%
realtime3sOnline TRT10.8110.80–18.64-70.4%
realtime3sOffline TRT11.2510.41–12.86-69.2%
realtime6sCUDA23.1822.24–32.37+0.0%
realtime6sOnline TRT18.2012.29–22.08-21.5%
realtime6sOffline TRT20.4812.47–23.21-11.6%
realtime15sCUDA34.9232.39–42.28+0.0%
realtime15sOnline TRT21.4720.98–34.35-38.5%
realtime15sOffline TRT23.8023.51–26.41-31.8%

5.2 Orin AGX

037741111473s6s15smsCUDACUDA · 3s:96.26 ms;相對 CUDA +0.0%(+0.00 ms)CUDA · 6s:98.95 ms;相對 CUDA +0.0%(+0.00 ms)CUDA · 15s:131.55 ms;相對 CUDA +0.0%(+0.00 ms)Online TRTOnline TRT · 3s:54.17 ms;相對 CUDA -43.7%(-42.09 ms)Online TRT · 6s:58.72 ms;相對 CUDA -40.7%(-40.23 ms)Online TRT · 15s:109.34 ms;相對 CUDA -16.9%(-22.21 ms)Offline TRTOffline TRT · 3s:54.10 ms;相對 CUDA -43.8%(-42.16 ms)Offline TRT · 6s:59.23 ms;相對 CUDA -40.1%(-39.72 ms)Offline TRT · 15s:107.73 ms;相對 CUDA -18.1%(-23.82 ms)

Offline TRT 與 Online TRT 接近,且三個音長的 bulk 中位數都低於 CUDA。

0255075993s6s15smsCUDACUDA · 3s:84.63 ms;相對 CUDA +0.0%(+0.00 ms)CUDA · 6s:86.05 ms;相對 CUDA +0.0%(+0.00 ms)CUDA · 15s:88.75 ms;相對 CUDA +0.0%(+0.00 ms)Online TRTOnline TRT · 3s:46.62 ms;相對 CUDA -44.9%(-38.01 ms)Online TRT · 6s:44.99 ms;相對 CUDA -47.7%(-41.06 ms)Online TRT · 15s:69.03 ms;相對 CUDA -22.2%(-19.72 ms)Offline TRTOffline TRT · 3s:45.98 ms;相對 CUDA -45.7%(-38.65 ms)Offline TRT · 6s:45.65 ms;相對 CUDA -46.9%(-40.40 ms)Offline TRT · 15s:67.63 ms;相對 CUDA -23.8%(-21.12 ms)

Offline TRT 保留 Online TRT 的速度;15 秒的相對收益小於短句,但仍低於 CUDA。

精確數值
送音音長後端三輪中位數 ms範圍 ms相對 CUDA
bulk3sCUDA96.2695.83–133.31+0.0%
bulk3sOnline TRT54.1752.87–55.55-43.7%
bulk3sOffline TRT54.1051.91–59.33-43.8%
bulk6sCUDA98.9597.35–111.80+0.0%
bulk6sOnline TRT58.7257.59–61.10-40.7%
bulk6sOffline TRT59.2359.19–65.61-40.1%
bulk15sCUDA131.55124.84–138.05+0.0%
bulk15sOnline TRT109.34107.56–119.26-16.9%
bulk15sOffline TRT107.73100.35–125.06-18.1%
realtime3sCUDA84.6383.96–84.65+0.0%
realtime3sOnline TRT46.6244.91–58.38-44.9%
realtime3sOffline TRT45.9842.30–47.78-45.7%
realtime6sCUDA86.0584.01–92.39+0.0%
realtime6sOnline TRT44.9944.38–45.45-47.7%
realtime6sOffline TRT45.6545.53–45.75-46.9%
realtime15sCUDA88.7586.38–125.89+0.0%
realtime15sOnline TRT69.0368.59–112.91-22.2%
realtime15sOffline TRT67.6366.83–68.03-23.8%

6 · 記憶體:RAM / VRAM,不含 disk

6.1 RTX 4090 完整服務

MiBCUDACUDA:2002.88 MiB2003Online TRTOnline TRT:6902.36 MiB6902Offline TRTOffline TRT:1553.64 MiB1554

推論後時,以 Offline TRT 的容器計帳記憶體最低;同一張固定尺度可直接比較切換前後。

MiBCUDACUDA:1872.79 MiB1873Online TRTOnline TRT:6751.16 MiB6751Offline TRTOffline TRT:1412.39 MiB1412

載入完成時,以 Offline TRT 的容器計帳記憶體最低;同一張固定尺度可直接比較切換前後。

MiBCUDA · PSSCUDA · PSS:2362.01 MiB2362CUDA · RSSCUDA · RSS:2369.20 MiB2369CUDA · VmHWMCUDA · VmHWM:2415.51 MiB2416Online TRT · PSSOnline TRT · PSS:9138.48 MiB9138Online TRT · RSSOnline TRT · RSS:9145.75 MiB9146Online TRT · VmHWMOnline TRT · VmHWM:9670.09 MiB9670Offline TRT · PSSOffline TRT · PSS:1953.33 MiB1953Offline TRT · RSSOffline TRT · RSS:2098.27 MiB2098Offline TRT · VmHWMOffline TRT · VmHWM:2860.31 MiB2860

PSS、RSS 與程序峰值的口徑不同;容量決策先看 cgroup current,再用這張圖判讀程序共享頁與歷史峰值。

完整記憶體數值
後端時點cgroup currentPSSRSSVmHWMcgroup peak
CUDA載入完成1872.792233.422240.682322.061960.53
CUDA推論後2002.882362.012369.202415.512412.32
Online TRT載入完成6751.168987.698994.949670.097438.35
Online TRT推論後6902.369138.489145.759670.097438.35
Offline TRT載入完成1412.391949.881957.092860.312326.56
Offline TRT推論後1553.641953.332098.272860.312326.56

6.2 Orin AGX 完整服務

MiBCUDACUDA:3936.52 MiB3937Online TRTOnline TRT:8592.07 MiB8592Offline TRTOffline TRT:3831.88 MiB3832

推論後時,以 Offline TRT 的容器計帳記憶體最低;同一張固定尺度可直接比較切換前後。

MiBCUDACUDA:3807.70 MiB3808Online TRTOnline TRT:8487.49 MiB8487Offline TRTOffline TRT:3632.59 MiB3633

載入完成時,以 Offline TRT 的容器計帳記憶體最低;同一張固定尺度可直接比較切換前後。

MiBCUDA · PSSCUDA · PSS:1760.47 MiB1760CUDA · RSSCUDA · RSS:4021.76 MiB4022CUDA · VmHWMCUDA · VmHWM:4069.36 MiB4069Online TRT · PSSOnline TRT · PSS:6265.84 MiB6266Online TRT · RSSOnline TRT · RSS:8760.11 MiB8760Online TRT · VmHWMOnline TRT · VmHWM:9368.82 MiB9369Offline TRT · PSSOffline TRT · PSS:1567.93 MiB1568Offline TRT · RSSOffline TRT · RSS:3976.35 MiB3976Offline TRT · VmHWMOffline TRT · VmHWM:4188.49 MiB4188

PSS、RSS 與程序峰值的口徑不同;容量決策先看 cgroup current,再用這張圖判讀程序共享頁與歷史峰值。

完整記憶體數值
後端時點cgroup currentPSSRSSVmHWMcgroup peak
CUDA載入完成3807.701655.863894.803898.62kernel 未提供
CUDA推論後3936.521760.474021.764069.36kernel 未提供
Online TRT載入完成8487.496162.448582.189368.82kernel 未提供
Online TRT推論後8592.076265.848760.119368.82kernel 未提供
Offline TRT載入完成3632.591443.223776.894188.49kernel 未提供
Offline TRT推論後3831.881567.933976.354188.49kernel 未提供

6.3 模型後端本身:直接 recognizer

MiBCUDACUDA:1085.97 MiB1086Online TRTOnline TRT:5465.39 MiB5465Offline TRTOffline TRT:587.46 MiB587

每個音長使用新程序;圖中取 3、6、15 秒三個 end 快照的中位數,能看出模型後端本身的容器記憶體成本。

直接 recognizer 記憶體中位數
後端cgroup currentPSSRSSVmHWM
CUDA1085.971315.221319.761352.11
Online TRT5465.397545.497549.979423.36
Offline TRT587.46971.04975.521579.04
MiBCUDACUDA:1091.46 MiB1091Online TRTOnline TRT:6778.99 MiB6779Offline TRTOffline TRT:3331.37 MiB3331

每個音長使用新程序;圖中取 3、6、15 秒三個 end 快照的中位數,能看出模型後端本身的容器記憶體成本。

直接 recognizer 記憶體中位數
後端cgroup currentPSSRSSVmHWM
CUDA1091.461096.012286.682305.90
Online TRT6778.995519.037015.898601.89
Offline TRT3331.37861.412163.172275.33

6.4 首次建 engine、暖快取與 Offline 載入

平台Online TRT 空 cache 載入 sOnline TRT 暖 cache 載入 sOffline artifact 冷建 sOffline TRT 載入 s
409040.6346.38122.8361.499
Orin66.58314.78767.4867.932
Orin 完整服務首次建 engine 記憶體
時點cgroup current MiBPSS MiBRSS MiBVmHWM MiB
載入完成9053.336139.508649.6010275.58
首次 3 秒推論後9104.496163.428701.2910275.58

空 cache 與暖 cache 取直接 recognizer 的新程序;Offline artifact 冷建只做一次。完整服務首次建 engine 使用 emptyDir,與暖快取主圖分列。

6.5 RTX 4090 整卡 VRAM

MiBCUDACUDA:2495.00 MiB2495Online TRTOnline TRT:2661.00 MiB2661Offline TRTOffline TRT:2653.00 MiB2653

CUDA、Online TRT、Offline TRT 的服務顯存增量接近;整卡還包含其他程序,所以只把同測項前後差當近似增量。

VRAM 原始快照
後端測前 MiB載入完成 MiB推論後 MiBready 增量end 增量
CUDA95691204212064+2473+2495
Online TRT95691212212230+2553+2661
Offline TRT95691211412222+2545+2653

6.6 指標、平台與手法

指標4090Orin測什麼/怎麼測
cgroup current整個容器目前被計帳的 RAM,含檔案快取;讀 /sys/fs/cgroup/memory.current,主圖優先看這個。
PSS程序按比例分攤共享頁;讀 PID 1 的 smaps_rollup
RSS程序常駐 RAM,共享頁在每個程序都完整計入;讀 PID 1 的 VmRSS
VmHWM程序啟動至今最高 RSS;讀 PID 1 的 VmHWM
cgroup peakkernel 未提供容器歷史最高計帳 RAM;4090 讀 memory.peak,Orin 不填零。
MemTotal / MemAvailable整台主機總 RAM 與當下可用 RAM,只作背景交叉檢查。
GPU memory.used不另拆4090 用 nvidia-smi 讀整卡 VRAM;Orin CPU/GPU 共用 LPDDR,沒有獨立 per-process VRAM。

7 · 新舊差異與不一致

正文只使用本輪 rebase 後數據。歷史附錄只比較上一輪 cycle 帶過來的 4090 CUDA/Online TRT;上一輪沒有同條件 Offline TRT 完整服務,因此不補推測值。Orin 全部採本輪新值,不混入舊數據。

4090 上一輪與本輪逐項差異
後端送音音長上一輪 ms本輪 ms本輪差異
CUDAbulk3s22.4524.29+8.2%
CUDAbulk6s26.8326.86+0.1%
CUDAbulk15s72.6441.95-42.2%
CUDArealtime3s28.2136.53+29.5%
CUDArealtime6s30.5523.18-24.1%
CUDArealtime15s74.5534.92-53.2%
Online TRTbulk3s13.3416.17+21.2%
Online TRTbulk6s17.9717.24-4.1%
Online TRTbulk15s75.1033.84-54.9%
Online TRTrealtime3s17.9810.81-39.9%
Online TRTrealtime6s13.3718.20+36.1%
Online TRTrealtime15s54.4421.47-60.6%

4090 15 秒沒有重現上一版報告的系統性異常。本輪三輪中位數的 Online TRT bulk 比 CUDA 快 19.3%;另一次單獨複測為 CUDA 39.17 ms、Online TRT 39.40 ms。單次樣本可互換快慢,但三輪與複測都落在約 34–42 ms,判定為短期變異,不列成當前回歸。

Orin Online TRT 15 秒 realtime 第一輪 112.91 ms,後兩輪約 68.59/69.03 ms;報告採三輪中位數並保留範圍,不隱藏這個離散值。

8 · Build、部署與驗證

項目時間說明
4090 基礎 image build36.52 s根目錄 Dockerfile;部分 dependency layer 命中 cache。
4090 TensorRT 測試層459.27 s安裝 TensorRT 10.13.3.9;三後端共用這份 image。
Orin Online TRT deploy.sh531.20 s含 DVC、build、push、deploy;rollout 165.272 s。
Orin Offline TRT deploy.sh287.57 s正式切換;rollout 112.308 s,使用 target-built offline-a16280f bundle。

Dockerfile.orin 的 sherpa-onnx jobs 已改為 max(1, floor(nproc / 2));32 CPU 時是 16。這次 rebase 後兩次 deploy 的 sherpa layer都命中 cache,所以不能拿 deploy 總時間宣稱 CPU 公式帶來多少加速。

正式 Orin:registry.devops.foxconn.com/srdc/agent/stt/kitt-stt:v5.8.0-main-a16280f-offline-20260906-orin@sha256:1dd50b2f99d40ab5fbe8128e9a0f02405caf888cdc2af568f9dbb8d0b55fb73e;Pod Ready,restart 0,init exit 0。context model 12,273 bytes,sm87 engine 984,975,172 bytes;主程序 maps 已確認載入 TensorRT runtime。

8.1 驗證結果

8.2 名詞定義

名詞本報告的意思與影響
Online TRT服務仍讀完整 ONNX,在目標 GPU 建圖或命中 engine cache;快取命中仍可能保留較高 host RAM。
Offline TRT / EP context model先在目標機產生小型 ONNX context,載入時直接引用外部 TensorRT engine;本輪用來降低啟動建圖 RAM。
sm87 / sm89NVIDIA GPU compute capability;Orin 是 sm87、RTX 4090 是 sm89。TensorRT engine 綁定架構與 runtime,不可跨機搬用,換平台必須重建。
RSSResident Set Size,程序常駐 RAM;共享頁會重複計入,所以容量判斷不能只看 RSS。
PSSProportional Set Size,把共享頁按比例分攤;比 RSS 更接近程序對共享 RAM 的份額。
smaps / smaps_rollupLinux 程序記憶體映射統計;本輪從 PID 1 的彙總檔讀 PSS。
cgroup current / peak容器現在/歷史最高被計帳的 RAM;主容量比較使用 current,Orin kernel 沒有 peak 時明列不可用。
VRAM獨立顯卡記憶體;4090 可由 nvidia-smi 量整卡,Orin 的 CPU/GPU 共用記憶體所以不另造一欄。

下載本輪完整 JSON(含每輪、每個 raw sample、記憶體快照與歷史比較)