Tüm Vaka Analizleri

Edge AI & Computer Vision

Mühendislik Yaklaşımı

Kısıtlı Uç Cihazda Çıkarım Hattı Mimarisi

INT8 kuantizasyon · CUDA graphs · DLA co-execution · NVIDIA Jetson Orin NX

NVIDIA Jetson Orin NX 16GB · TensorRT 8.6 · JetPack 6

INT8Kuantizasyon
CUDA graphsKernel launch
DLAYük dağılımı
fps/WAsıl metrik
PlatformJetson Orin NX · TensorRT · JetPack
Problem sınıfıFP32 çıkarım, SWaP-C kısıtlı platformda gerçek zamana yetmiyor
YaklaşımINT8 kuantizasyon + engine serialization + CUDA graphs + DLA co-execution
ÖlçümUçtan uca hat fps'i ve harici güç ölçümü, termal denge sonrası

01Problem

Problem: SWaP-C Kısıtlı Platformda Çıkarım Bütçesi

Otonom bir hava aracı sisteminde standart FP32 ONNX runtime çıkarımı, gerçek zamanlı nesne tespiti ve takibi için gereken hızı üretmez. Boyut, ağırlık, güç ve maliyet kısıtlı bir platformda mesele yalnızca hız da değildir: güç bütçesi doğrudan uçuş süresini sınırlar. Bu yüzden hedef metrik fps değil, watt başına fps olur.

  • 01Yetersiz çıkarım hızı, hızlı hareket eden nesnelerin takibinde kare atlamasına ve takip kaybına yol açar
  • 02FP32 çıkarımı GPU'yu doygunluğa götürür, eş zamanlı görüntü ön işleme için kaynak bırakmaz
  • 03Yüksek güç tüketimi hedef uçuş süresinin altında kalınmasına neden olur
  • 04Model her açılışta ONNX'ten yeniden derlenirse başlatma süresi operasyonu geciktirir
  • 05Hattaki CPU-GPU kopyaları ve kernel launch ek yükü ölçülmediğinde darboğazın yeri bilinmez

02Sistem Bağlamı

DonanımNVIDIA Jetson Orin NX (Ampere GPU + DLA)
YazılımJetPack · TensorRT · CUDA
ModelYOLO ailesi nesne tespiti
BaşlangıçFP32 ONNX Runtime
HedefINT8 TensorRT engine + DLA co-execution
Ölçüm yöntemiUçtan uca hat fps'i + harici güç ölçümü, sürekli yük altında
Test koşuluGörev temsilî video akışı, termal denge sonrası

03Kök Neden Analizi

  1. 01Model FP32 hassasiyette koşuyordu. Orin NX'in INT8 Tensor Core ve DLA kapasitesi tamamen atıl durumdaydı
  2. 02ONNX Runtime genel amaçlı yürütme kullanıyordu; TensorRT'nin katman füzyonu ve kernel otomatik seçimi devre dışıydı
  3. 03Her kare için ayrı kernel launch zinciri CPU overhead'i üretiyordu. GPU bekleme döngüleri ölçümde görünür haldeydi
  4. 04Engine her açılışta yeniden derleniyordu; serialization kullanılmıyordu
  5. 05Tüm yük GPU üzerindeydi. DLA çekirdekleri hiç kullanılmıyor, güç verimliliği fırsatı kaçırılıyordu

04Ne Değiştirdik

01

Modele temsilî veri kümesiyle kalibre edilmiş INT8 kuantizasyon uygulanır

Tensor Core ve DLA kapasitesi kullanılır hale gelir; doğruluk kaybı görev kümesiyle doğrulanır

02

TensorRT engine serialization devreye alınır

Açılışta yeniden derleme ortadan kalkar, model yükleme süresi öngörülebilir olur

03

CUDA graphs ile kare başına kernel launch zinciri tek grafa indirilir

CPU launch ek yükü azalır, GPU besleme sürekliliği sağlanır

04

DLA co-execution: uygun katmanlar DLA'ya, kalanlar GPU'ya dağıtılır

Aynı iş daha düşük güç bütçesiyle yapılır, GPU üzerinde yer açılır

05

Ön işleme GPU'ya taşınır (CUDA ile resize ve normalize), CPU-GPU kopyaları azaltılır

Hattaki darboğaz modelin kendisine kayar, uçtan uca hız sürdürülebilir olur

05Benchmark Sonuçları

06Bu Neden Önemliydi?

fps tek başına anlamsızdır; SWaP-C kısıtlı bir platformda anlamlı metrik fps/W'tır. Aynı bataryayla hem daha uzun görev süresi hem de daha fazla eş zamanlı algı işi, bu oranın iyileşmesinden gelir.

  • 01Gerçek zamanlı çoklu nesne tespiti ve takibi tek cihazda mümkün hale gelir
  • 02Düşen güç tüketimi batarya ömrünü ve görev süresini doğrudan uzatır
  • 03Açığa çıkan GPU kapasitesi ek algı görevleri (sensör füzyonu) için kullanılabilir
  • 04INT8 kalibrasyon ve doğrulama akışı yeniden kullanılabilir bir hat olarak kurulur, model güncellemeleri aynı yoldan geçer

Edge AI & Computer Vision ihtiyacınızı kendi platformunuzda değerlendirmek için gömülü sistem mimari denetimi planlayabilir ya da sistem gereksinim hesaplayıcısı ile platform sınıfınızı belirleyebilirsiniz.

Metodoloji Notu

  • fps değeri izole model benchmark'ı olarak değil, uçtan uca hat (görüntü alma, tespit, çıktı) üzerinden raporlanır
  • Güç ölçümü harici cihazla, termal denge sonrası sürekli yük altında alınır
  • INT8 doğruluk kaybı, göreve temsilî doğrulama kümesiyle FP32 referansa karşı ölçülür
  • Karşılaştırma özdeş donanım, özdeş giriş akışı ve özdeş güç modunda yapılır
  • Bu sayfa yöntemi anlatır. Bir ölçüm yayınlandığında kurulumu ve yöntemi sayının yanında verilir

Edge AI pipeline'ınız hedef fps veya güç bütçesini karşılamıyor mu?

Ücretsiz teknik değerlendirme ile sisteminizdeki gecikme ve deterministik kontrol sorunlarını birlikte inceleyelim.

Bu sayfa bir yöntem notudur, ölçüm raporu değildir. Spikedge yalnızca kendi tezgâhında alınmış ve kurulumu yayınlanabilen ölçümleri yayınlar; bu konuda yayınlanabilir ölçüm hazır olduğunda bu sayfaya eklenir.