Intelligenza Artificiale Guida tecnico-scientifica

Algoritmi transformer vs YOLO: detection di erbe infestanti ad alta densità in campo biologico

Nel contesto dell'agricoltura biologica e di precisione, la gestione non chimica delle erbe infestanti (weeds) rappresenta…

Box di detection CROP e WEED su mais con drone agricolo in volo per il diserbo di precisione

Introduzione: la sfida della detection in condizioni di alta densità vegetale

Nel contesto dell'agricoltura biologica e di precisione, la gestione non chimica delle erbe infestanti (weeds) rappresenta una delle sfide operative e finanziarie più complesse. L'eliminazione delle malerbe nello spazio intra-fila e inter-fila richiede l'intervento tempestivo di robot da diserbo meccanico o laser, la cui efficacia chirurgica dipende interamente dalle prestazioni degli algoritmi di Computer Vision installati a bordo.

Tuttavia, quando le infestanti germogliano ad alta densità formando una coltre vegetale fitta ed intrecciata con la coltura principale (es. su mais, pomodoro, lattuga o carota allo stadio di semenzale), i sistemi tradizionali di visione artificiale entrano in crisi. Fenomeni come la parziale sovrapposizione delle foglie (occlusion), le variazioni di illuminazione naturale, la somiglianza spettrale e morfologica tra le specie e la presenza di ombre complesse rendono difficile discriminare dove finisce la foglia della pianta coltivata e dove inizia il meristema della malerba.

Per superare queste limitazioni, la ricerca in Deep Learning applicata all'agricoltura ha sviluppato due principali famiglie di architetture di rilevamento: i modelli ad alta velocità basati su YOLO (You Only Look Once) e i modelli ad attenzione globale basati sui Vision Transformers (ViT / Swin Transformer).

Architettura e principi di funzionamento: convolution vs attention

Operatore mostra su tablet il confronto tra YOLOv8 e Swin Transformer per l'analisi di campo
Sul tablet, YOLOv8 e Swin Transformer a confronto sulla stessa scena di campo.

Per comprendere le differenti prestazioni dei due approcci nel rilevamento delle infestanti ad alta densità, occorre analizzare la diversa gestione del contesto spaziale dell'immagine:

┌────────────────────────────────────────────────────────────────────────────────────────┐
│                               ARCHITETTURA RECOGNICTION                               │
├───────────────────────────────────────────┬────────────────────────────────────────────┤
│           Rete Convoluzionale (YOLO)      │          Vision Transformer (ViT/Swin)     │
├───────────────────────────────────────────┼────────────────────────────────────────────┤
│ • Campo Ricettivo Locale (Kernels 3x3/5x5)│ • Self-Attention Meccanismo Globale        │
│ • Estrazione di Features Morfologiche     │ • Relazioni di Dipendenza a Lunga Distanza │
│ • Bassa Complessità Computazionale (O(N)) │ • Complessità Quadratica (O(N²)) o Finestra│
│ • Altissima Velocità di Inferenza (FPS+)  │ • Altissima Accuratezza su Pattern Complessi│
└───────────────────────────────────────────┴────────────────────────────────────────────┘

1. la famiglia YOLO (YOLOv5, YOLOv8, YOLOv11)

Gli algoritmi della famiglia YOLO utilizzano convoluzioni locali (CNN) per estrarre le caratteristiche dell'immagine mediante finestre scorrevoli. L'immagine viene suddivisa in una griglia regolare ed il modello predice simultaneamente le coordinate dei rettangoli di delimitazione (bounding boxes), la classe d'appartenenza e la probabilità di confidenza.

2. i vision transformers (Swin transformer, DeDETR)

I Vision Transformers dividono l'immagine in piccoli tasselli (patches) e applicano il meccanismo di Self-Attention (Auto-Attenzione). Questo permette al modello di valutare le relazioni matematiche tra ogni singola porzione dell'immagine e tutte le altre, indipendentemente dalla loro distanza spaziale.

Tabella comparativa prestazionale sul campo

Schema della griglia locale YOLO contro la self-attention globale del Vision Transformer
La griglia convoluzionale di YOLO contro l'attenzione globale dei transformer.

+-----------------------------------------------------------------------------------+ +-----------------------------------------------------------------------------------+ | Parametro di Valutazione | YOLOv8 / YOLOv11 | Swin Transformer / DeDETR | +-----------------------------------------------------------------------------------+ | Velocità d'Inferenza (FPS) | 60 - 120 FPS (Real-Time) | 15 - 30 FPS (Medio-Lento) | | Accuratezza mAP@0.5 (Bassa) | 92,4% | 94,1% | | Accuratezza mAP@0.5 (Alta) | 78,6% (Perdita su Occlusioni) | 89,8% (Elevata Robustezza) | | Occupazione Memoria VRAM | 1,8 GB - 4 GB | 6,5 GB - 12 GB | | Hardware Richiesto | Edge GPU Embedded (Jetson) | Workstation / GPU Industriale| +-----------------------------------------------------------------------------------+

---

## Architetture Ibride e Sinergia col Telerilevamento da Drone ITALDRONI

Per coniugare l'elevata accuratezza dei Transformers con la velocità d'esecuzione di YOLO, la ricerca più avanzata sta sviluppando modelli ibridi (es. YOLO-ViT / RT-DETR) che integrano blocchi di attenzione selettiva all'interno del backbone convoluzionale.

In questo flusso di lavoro, il telerilevamento condotto dai droni professionali ITALDRONI svolge un ruolo di supporto decisivo.

Sotto la guida di Dimitri Albino, pilota professionista certificato EU-STS abilitato al volo BVLOS, i droni effettuano sorvoli preventivi ad alta quota sulle parcelle agricole con camere ad alta risoluzione (GSD < 0,5 cm/pixel):

[ Mappatura Aerea UAV ITALDRONI ] ---> [ Analisi Densità Infestanti (Transformers) ] ---> [ Mappa di Prescrizione VRA ] ---> [ Diserbo Robotico YOLO Real-Time ] [ Mappatura Aerea UAV ITALDRONI ] ---> [ Analisi Densità Infestanti (Transformers) ] ---> [ Mappa di Prescrizione VRA ] ---> [ Diserbo Robotico YOLO Real-Time ]

  1. Mappatura Preventiva di Densità: Le ortofoto multispettrali e RGB acquisite dal drone vengono elaborate off-line su server cloud tramite modelli Swin Transformer. Questo permette di mappare con precisione la densità di germinazione delle infestanti e le aree a maggior rischio di soffocamento.
  2. Ottimizzazione del Robot di Campo: La mappa di prescrizione generata dal drone viene caricata sulla centralina del robot di superficie. Nelle zone a bassa/media densità il robot attiva l'algoritmo YOLO per procedere a massima velocità (5-8 km/h), mentre nelle sacche ad alta densità segnalate dal drone il robot riduce la velocità d'avanzamento ed attiva la modalità d'inferenza ad alta precisione.

Conclusioni

Flusso dal sorvolo drone alla mappa di densità delle infestanti fino al diserbo robotico edge AI
Dal sorvolo ITALDRONI al diserbo robotico edge AI passando per l'analisi cloud.

Il confronto tra algoritmi Transformer e YOLO non vede un vincitore assoluto, bensì l'integrazione di due tecnologie complementari. Se YOLO rimane lo standard di riferimento per l'attuazione meccatronica in tempo reale su macchine operatrici, i Vision Transformers rappresentano la nuova frontiera per l'analisi complessa di immagini ad alta densità. La sinergia tra i sorvoli ad alta risoluzione ITALDRONI e le piattaforme robotiche da campo garantisce un diserbo biologico efficace, sostenibile e privo di chimica di sintesi.

Approfondimento tecnico: quantizzazione INT8 e benchmark su piattaforme edge NVIDIA jetson

Per consentire l'esecuzione in tempo reale dei modelli Swin Transformer ed YOLOv8/v11 a bordo di droni agricoli e robot da diserbo senza dipendere dalla connettività cloud, occorre applicare tecniche avanzate di ottimizzazione del codice mediante il framework NVIDIA TensorRT.

Il processo di Quantizzazione Post-Training (PTQ) o di Quantizzazione-Aware Training (QAT) converte i pesi della rete neurale dalla precisione a virgola mobile a 32 bit (FP32) alla precisione ad interi a 8 bit (INT8):

FP32 (32-bit Floating Point) \longrightarrow INT8 (8-bit Integer)

Questo passaggio riduce l'impronta di memoria VRAM del 75% e quadruplica la velocità di inferenza sulle unità di elaborazione NVIDIA Jetson Orin Nano / AGX Orin, consentendo al robot di processare flussi video ad alta risoluzione (1080p / 4K) mantenendo una frequenza di elaborazione superiore a 60 frame/secondo.

Impatto della quantizzazione sull'Accuratezza di detection

I test condotti nei laboratori di sviluppo evidenziano come la quantizzazione INT8 applicata a YOLOv8 riduca la mAP@0.5 di appena lo 0,4%, a fronte di un abbattimento dei consumi energetici da 45 Watt a soli 12 Watt, un fattore cruciale per estendere l'autonomia operativa delle macchine elettriche e dei droni a batteria ITALDRONI.

Transformer vs YOLO agricoltura Vision Transformers ViT Detection infestanti alta densità Swin Transformer YOLOv8 weed detection diserbo robotico di precisione telerilevamento droni Dimitri Albino
<