Edge AI & Computer Vision
Mühendislik YaklaşımıKısıtlı Uç Cihazda Çıkarım Hattı Mimarisi
INT8 kuantizasyon · CUDA graphs · DLA co-execution · NVIDIA Jetson Orin NX
NVIDIA Jetson Orin NX 16GB · TensorRT 8.6 · JetPack 6
01Problem
Problem: SWaP-C Kısıtlı Platformda Çıkarım Bütçesi
Otonom bir hava aracı sisteminde standart FP32 ONNX runtime çıkarımı, gerçek zamanlı nesne tespiti ve takibi için gereken hızı üretmez. Boyut, ağırlık, güç ve maliyet kısıtlı bir platformda mesele yalnızca hız da değildir: güç bütçesi doğrudan uçuş süresini sınırlar. Bu yüzden hedef metrik fps değil, watt başına fps olur.
- 01Yetersiz çıkarım hızı, hızlı hareket eden nesnelerin takibinde kare atlamasına ve takip kaybına yol açar
- 02FP32 çıkarımı GPU'yu doygunluğa götürür, eş zamanlı görüntü ön işleme için kaynak bırakmaz
- 03Yüksek güç tüketimi hedef uçuş süresinin altında kalınmasına neden olur
- 04Model her açılışta ONNX'ten yeniden derlenirse başlatma süresi operasyonu geciktirir
- 05Hattaki CPU-GPU kopyaları ve kernel launch ek yükü ölçülmediğinde darboğazın yeri bilinmez
02Sistem Bağlamı
03Kök Neden Analizi
- 01Model FP32 hassasiyette koşuyordu. Orin NX'in INT8 Tensor Core ve DLA kapasitesi tamamen atıl durumdaydı
- 02ONNX Runtime genel amaçlı yürütme kullanıyordu; TensorRT'nin katman füzyonu ve kernel otomatik seçimi devre dışıydı
- 03Her kare için ayrı kernel launch zinciri CPU overhead'i üretiyordu. GPU bekleme döngüleri ölçümde görünür haldeydi
- 04Engine her açılışta yeniden derleniyordu; serialization kullanılmıyordu
- 05Tüm yük GPU üzerindeydi. DLA çekirdekleri hiç kullanılmıyor, güç verimliliği fırsatı kaçırılıyordu
04Ne Değiştirdik
Modele temsilî veri kümesiyle kalibre edilmiş INT8 kuantizasyon uygulanır
→ Tensor Core ve DLA kapasitesi kullanılır hale gelir; doğruluk kaybı görev kümesiyle doğrulanır
TensorRT engine serialization devreye alınır
→ Açılışta yeniden derleme ortadan kalkar, model yükleme süresi öngörülebilir olur
CUDA graphs ile kare başına kernel launch zinciri tek grafa indirilir
→ CPU launch ek yükü azalır, GPU besleme sürekliliği sağlanır
DLA co-execution: uygun katmanlar DLA'ya, kalanlar GPU'ya dağıtılır
→ Aynı iş daha düşük güç bütçesiyle yapılır, GPU üzerinde yer açılır
Ön işleme GPU'ya taşınır (CUDA ile resize ve normalize), CPU-GPU kopyaları azaltılır
→ Hattaki darboğaz modelin kendisine kayar, uçtan uca hız sürdürülebilir olur
05Benchmark Sonuçları
06Bu Neden Önemliydi?
fps tek başına anlamsızdır; SWaP-C kısıtlı bir platformda anlamlı metrik fps/W'tır. Aynı bataryayla hem daha uzun görev süresi hem de daha fazla eş zamanlı algı işi, bu oranın iyileşmesinden gelir.
- 01Gerçek zamanlı çoklu nesne tespiti ve takibi tek cihazda mümkün hale gelir
- 02Düşen güç tüketimi batarya ömrünü ve görev süresini doğrudan uzatır
- 03Açığa çıkan GPU kapasitesi ek algı görevleri (sensör füzyonu) için kullanılabilir
- 04INT8 kalibrasyon ve doğrulama akışı yeniden kullanılabilir bir hat olarak kurulur, model güncellemeleri aynı yoldan geçer
Edge AI & Computer Vision ihtiyacınızı kendi platformunuzda değerlendirmek için gömülü sistem mimari denetimi planlayabilir ya da sistem gereksinim hesaplayıcısı ile platform sınıfınızı belirleyebilirsiniz.
Metodoloji Notu
- fps değeri izole model benchmark'ı olarak değil, uçtan uca hat (görüntü alma, tespit, çıktı) üzerinden raporlanır
- Güç ölçümü harici cihazla, termal denge sonrası sürekli yük altında alınır
- INT8 doğruluk kaybı, göreve temsilî doğrulama kümesiyle FP32 referansa karşı ölçülür
- Karşılaştırma özdeş donanım, özdeş giriş akışı ve özdeş güç modunda yapılır
- Bu sayfa yöntemi anlatır. Bir ölçüm yayınlandığında kurulumu ve yöntemi sayının yanında verilir
Edge AI pipeline'ınız hedef fps veya güç bütçesini karşılamıyor mu?
Ücretsiz teknik değerlendirme ile sisteminizdeki gecikme ve deterministik kontrol sorunlarını birlikte inceleyelim.
Bu sayfa bir yöntem notudur, ölçüm raporu değildir. Spikedge yalnızca kendi tezgâhında alınmış ve kurulumu yayınlanabilen ölçümleri yayınlar; bu konuda yayınlanabilir ölçüm hazır olduğunda bu sayfaya eklenir.
