Hajókat ismer fel 100%-os pontossággal a Vision Transformer modell
A Vision Transformer (ViT) modell 100%-os pontossággal és a leggyorsabb feldolgozási idővel ismerte fel a hajókat a tengeri képeken, felülmúlva a hagyományos CNN-modelleket.

A tengerek biztonságát erősítené a mesterséges intelligencia és a számítógépes látás új generációja. Kutatók hat különböző mélytanulási architektúrát teszteltek, hogy megtalálják a legalkalmasabbat a hajók valós idejű észlelése céljából.
A kutatásban 6468 tengeri képet használtak fel, különböző időjárási körülmények között, mint például borult, ködös, esős és napos környezetben. A vizsgált modellek között szerepelt egy alap Convolutional Neural Network (CNN), négy transzfer tanulási modell (Xception, VGG16, MobileNetV2 és EfficientNetV2L), valamint egy Vision Transformer (ViT) modell — írja az arXiv.
Kapcsolódó: AI-alapú forgalomirányítás
A Vision Transformer fölénye
Az eredmények alapján a Vision Transformer (ViT) bizonyult a leghatékonyabbnak, 100%-os pontossággal és a legkisebb hibaarány mellett. Ezen felül a ViT volt a leggyorsabb a videók feldolgozásában is, ami kulcsfontosságú a valós idejű tengeri megfigyelés szempontjából.
Kapcsolódó: mélytanulási kabinszegmentálás
A kutatás eredményeinek alkalmazása
A kutatók kiemelték, hogy bár a könnyűsúlyú architektúrák erőforrás-korlátozott eszközökön is jól teljesíthetnek, a ViT modell bizonyítja a mesterséges intelligencia és a számítógépes látásban rejlő potenciált a tengeri felügyelet, határvédelem és autonóm navigáció terén.
Kapcsolódó: videóobjektum-észlelés
A tanulmányt az arXiv-en tették közzé, ahol a Vision Transformer modell 100%-os pontossággal ismerte fel a hajókat a tengeri képeken, és a leggyorsabb feldolgozási időt érte el a 6468 tengeri kép feldolgozásában.
Kapcsolódó: kevés mintás objektumdetekció