Algoritmi transformer vs YOLO: detection di erbe infestanti ad alta densità in campo biologico
Nel contesto dell'agricoltura biologica e di precisione, la gestione non chimica delle erbe infestanti (weeds) rappresenta…
Introduzione: la sfida della detection in condizioni di alta densità vegetale
Nel contesto dell'agricoltura biologica e di precisione, la gestione non chimica delle erbe infestanti (weeds) rappresenta una delle sfide operative e finanziarie più complesse. L'eliminazione delle malerbe nello spazio intra-fila e inter-fila richiede l'intervento tempestivo di robot da diserbo meccanico o laser, la cui efficacia chirurgica dipende interamente dalle prestazioni degli algoritmi di Computer Vision installati a bordo.
Tuttavia, quando le infestanti germogliano ad alta densità formando una coltre vegetale fitta ed intrecciata con la coltura principale (es. su mais, pomodoro, lattuga o carota allo stadio di semenzale), i sistemi tradizionali di visione artificiale entrano in crisi. Fenomeni come la parziale sovrapposizione delle foglie (occlusion), le variazioni di illuminazione naturale, la somiglianza spettrale e morfologica tra le specie e la presenza di ombre complesse rendono difficile discriminare dove finisce la foglia della pianta coltivata e dove inizia il meristema della malerba.
Per superare queste limitazioni, la ricerca in Deep Learning applicata all'agricoltura ha sviluppato due principali famiglie di architetture di rilevamento: i modelli ad alta velocità basati su YOLO (You Only Look Once) e i modelli ad attenzione globale basati sui Vision Transformers (ViT / Swin Transformer).
Architettura e principi di funzionamento: convolution vs attention
Per comprendere le differenti prestazioni dei due approcci nel rilevamento delle infestanti ad alta densità, occorre analizzare la diversa gestione del contesto spaziale dell'immagine:
┌────────────────────────────────────────────────────────────────────────────────────────┐ │ ARCHITETTURA RECOGNICTION │ ├───────────────────────────────────────────┬────────────────────────────────────────────┤ │ Rete Convoluzionale (YOLO) │ Vision Transformer (ViT/Swin) │ ├───────────────────────────────────────────┼────────────────────────────────────────────┤ │ • Campo Ricettivo Locale (Kernels 3x3/5x5)│ • Self-Attention Meccanismo Globale │ │ • Estrazione di Features Morfologiche │ • Relazioni di Dipendenza a Lunga Distanza │ │ • Bassa Complessità Computazionale (O(N)) │ • Complessità Quadratica (O(N²)) o Finestra│ │ • Altissima Velocità di Inferenza (FPS+) │ • Altissima Accuratezza su Pattern Complessi│ └───────────────────────────────────────────┴────────────────────────────────────────────┘
1. la famiglia YOLO (YOLOv5, YOLOv8, YOLOv11)
Gli algoritmi della famiglia YOLO utilizzano convoluzioni locali (CNN) per estrarre le caratteristiche dell'immagine mediante finestre scorrevoli. L'immagine viene suddivisa in una griglia regolare ed il modello predice simultaneamente le coordinate dei rettangoli di delimitazione (bounding boxes), la classe d'appartenenza e la probabilità di confidenza.
- Vantaggi: Estrema efficienza computazionale, bassissima latenza (tempo di inferenza < 10 ms per frame) ed eccellente integrabilità su hardware Edge AI a bordo macchina (es. NVIDIA Jetson Orin).
- Limiti ad alta densità: Il campo ricettivo locale delle convoluzioni fatica a catturare le dipendenze contestuali a lunga distanza. Quando molte foglie di infestanti si sovrappongono fittamente, YOLO tende a generare false doppie rilevazioni o a fondere più malerbe in un unico box impreciso.
2. i vision transformers (Swin transformer, DeDETR)
I Vision Transformers dividono l'immagine in piccoli tasselli (patches) e applicano il meccanismo di Self-Attention (Auto-Attenzione). Questo permette al modello di valutare le relazioni matematiche tra ogni singola porzione dell'immagine e tutte le altre, indipendentemente dalla loro distanza spaziale.
- Vantaggi: Capacità elevata di comprendere la struttura globale della canopia e di tracciare la continuità delle venature fogliari anche quando la foglia è parzialmente coperta da un'altra pianta.
- Limiti: Elevato consumo di memoria GPU e latenza di calcolo più alta (30-60 ms per frame), che rende complessa l'esecuzione in tempo reale su macchine agricole in rapido avanzamento sul terreno.
Tabella comparativa prestazionale sul campo
+-----------------------------------------------------------------------------------+ +-----------------------------------------------------------------------------------+ | Parametro di Valutazione | YOLOv8 / YOLOv11 | Swin Transformer / DeDETR | +-----------------------------------------------------------------------------------+ | Velocità d'Inferenza (FPS) | 60 - 120 FPS (Real-Time) | 15 - 30 FPS (Medio-Lento) | | Accuratezza mAP@0.5 (Bassa) | 92,4% | 94,1% | | Accuratezza mAP@0.5 (Alta) | 78,6% (Perdita su Occlusioni) | 89,8% (Elevata Robustezza) | | Occupazione Memoria VRAM | 1,8 GB - 4 GB | 6,5 GB - 12 GB | | Hardware Richiesto | Edge GPU Embedded (Jetson) | Workstation / GPU Industriale| +-----------------------------------------------------------------------------------+
---
## Architetture Ibride e Sinergia col Telerilevamento da Drone ITALDRONI
Per coniugare l'elevata accuratezza dei Transformers con la velocità d'esecuzione di YOLO, la ricerca più avanzata sta sviluppando modelli ibridi (es. YOLO-ViT / RT-DETR) che integrano blocchi di attenzione selettiva all'interno del backbone convoluzionale.
In questo flusso di lavoro, il telerilevamento condotto dai droni professionali ITALDRONI svolge un ruolo di supporto decisivo.
Sotto la guida di Dimitri Albino, pilota professionista certificato EU-STS abilitato al volo BVLOS, i droni effettuano sorvoli preventivi ad alta quota sulle parcelle agricole con camere ad alta risoluzione (GSD < 0,5 cm/pixel):
[ Mappatura Aerea UAV ITALDRONI ] ---> [ Analisi Densità Infestanti (Transformers) ] ---> [ Mappa di Prescrizione VRA ] ---> [ Diserbo Robotico YOLO Real-Time ] [ Mappatura Aerea UAV ITALDRONI ] ---> [ Analisi Densità Infestanti (Transformers) ] ---> [ Mappa di Prescrizione VRA ] ---> [ Diserbo Robotico YOLO Real-Time ]
- Mappatura Preventiva di Densità: Le ortofoto multispettrali e RGB acquisite dal drone vengono elaborate off-line su server cloud tramite modelli Swin Transformer. Questo permette di mappare con precisione la densità di germinazione delle infestanti e le aree a maggior rischio di soffocamento.
- Ottimizzazione del Robot di Campo: La mappa di prescrizione generata dal drone viene caricata sulla centralina del robot di superficie. Nelle zone a bassa/media densità il robot attiva l'algoritmo YOLO per procedere a massima velocità (5-8 km/h), mentre nelle sacche ad alta densità segnalate dal drone il robot riduce la velocità d'avanzamento ed attiva la modalità d'inferenza ad alta precisione.
Conclusioni
Il confronto tra algoritmi Transformer e YOLO non vede un vincitore assoluto, bensì l'integrazione di due tecnologie complementari. Se YOLO rimane lo standard di riferimento per l'attuazione meccatronica in tempo reale su macchine operatrici, i Vision Transformers rappresentano la nuova frontiera per l'analisi complessa di immagini ad alta densità. La sinergia tra i sorvoli ad alta risoluzione ITALDRONI e le piattaforme robotiche da campo garantisce un diserbo biologico efficace, sostenibile e privo di chimica di sintesi.
Approfondimento tecnico: quantizzazione INT8 e benchmark su piattaforme edge NVIDIA jetson
Per consentire l'esecuzione in tempo reale dei modelli Swin Transformer ed YOLOv8/v11 a bordo di droni agricoli e robot da diserbo senza dipendere dalla connettività cloud, occorre applicare tecniche avanzate di ottimizzazione del codice mediante il framework NVIDIA TensorRT.
Il processo di Quantizzazione Post-Training (PTQ) o di Quantizzazione-Aware Training (QAT) converte i pesi della rete neurale dalla precisione a virgola mobile a 32 bit (FP32) alla precisione ad interi a 8 bit (INT8):
Questo passaggio riduce l'impronta di memoria VRAM del 75% e quadruplica la velocità di inferenza sulle unità di elaborazione NVIDIA Jetson Orin Nano / AGX Orin, consentendo al robot di processare flussi video ad alta risoluzione (1080p / 4K) mantenendo una frequenza di elaborazione superiore a 60 frame/secondo.
Impatto della quantizzazione sull'Accuratezza di detection
I test condotti nei laboratori di sviluppo evidenziano come la quantizzazione INT8 applicata a YOLOv8 riduca la mAP@0.5 di appena lo 0,4%, a fronte di un abbattimento dei consumi energetici da 45 Watt a soli 12 Watt, un fattore cruciale per estendere l'autonomia operativa delle macchine elettriche e dei droni a batteria ITALDRONI.