Come funzionano i Sistemi di Visione AI | Logirobotix
Technical Guide

Come funzionano i Sistemi di Visione AI

πŸ“… Aggiornato: Agosto 2025 ⏱️ Lettura: 8 minuti πŸ”¬ Tecnico

Introduzione: Cos’Γ¨ la Visione AI?

La visione artificiale AI (Computer Vision AI) Γ¨ una branca dell’intelligenza artificiale che insegna ai computer a “vedere” e “interpretare” immagini nello stesso modo in cui lo fa l’occhio umano β€” ma con precisione e velocitΓ  sovrumane.

A differenza dei sistemi di visione tradizionali (che seguono regole rigide codificate manualmente), i sistemi di visione AI imparano dai dati. Vedono migliaia di immagini di prodotti, identificano pattern che gli umani non riescono a percepire, e migliorano continuamente nel tempo.

πŸ” In termini semplici: Se un ispettore QC umano vede il 70% dei difetti perchΓ© si stanca, un sistema di visione AI ne vede il 99.8% perchΓ© non si stanca mai β€” e impara da ogni immagine che elabora.

I 5 Step di Funzionamento

Ecco il percorso che segue un’immagine dal momento in cui entra nel sistema fino a quando genera una decisione:

Step 1: Acquisizione dell’immagine

Una camera ad alta risoluzione (5-12 megapixel) cattura l’immagine del prodotto in tempo reale mentre passa sulla linea. La camera non Γ¨ una telecamera semplice β€” Γ¨ equipaggiata con:

  • Sensore CMOS/CCD ad alta risoluzione (per catturare dettagli microscopici)
  • Illuminazione multi-spettrale (LED controllati per eliminare ombre e riflessi)
  • Ottica telecentric/macro (per garantire distorsione minima e precisione Β±0.1mm)
  • VelocitΓ  di cattura sincronizzata con il movimento del prodotto (millisecondi)

Step 2: Preprocessing (Pulizia dell’immagine)

L’immagine grezza contiene “rumore” β€” variazioni di illuminazione, riflessi, sporco sulla lente. Il preprocessing le rimuove:

  • Normalizzazione contrasto
  • Riduzione rumore (smoothing)
  • Correzione illuminazione
  • Estrazione bordi e feature rilevanti

Dopo il preprocessing, l’immagine Γ¨ “pulita” e pronta per l’analisi.

Step 3: Feature Extraction (Deep Learning Detection)

Qui inizia il vero “cervello”: una rete neurale artificiale (CNN) analizza l’immagine in millisecondo, attraversando milioni di layer nascosti che cercano pattern.

INPUT IMAGE (1000x1000px) ↓ [CONV LAYER 1] – Rileva bordi semplici ↓ [CONV LAYER 2] – Rileva forme (cerchi, linee) ↓ [CONV LAYER 3] – Rileva texture (rugositΓ , pattern) ↓ [CONV LAYER 4-8] – Rileva “concetti” (graffi, bolle, deformazioni) ↓ [FULLY CONNECTED] – Prende la decisione finale ↓ OUTPUT: “DIFETTO RILEVATO” + Confidence: 96%

Ogni layer trasforma l’immagine, estraendo informazioni sempre piΓΉ complesse. Il primo layer potrebbe riconoscere una linea; l’ottavo layer riconosce “questa linea Γ¨ un graffio”.

Step 4: Classification & Decision

La rete neurale genera un confidence score (0-100%) per ogni possibile difetto:

  • Graffio: 78%
  • Bolla: 5%
  • Deformazione: 2%
  • Nessun difetto: 15%

Se il confidence per il difetto con score piΓΉ alto supera la soglia (es: 80%), il sistema dice “DIFETTO RILEVATO”. Se no, “PRODOTTO OK”.

Step 5: Azione automatica e Tracciamento

Se rilevato un difetto:

  • Rifiuto istantaneo: Valvola pneumatica a solenoid spinge il prodotto fuori dalla linea
  • Alert visuale: Operatore vede notifica su schermo (location difetto, tipo, severity)
  • Tracciamento: Database registra foto difetto, timestamp, numero lotto, posizione sulla linea
  • Feedback al modello: Sistema raccoglie il dato per future sessioni di training

Video: Come funziona il rilevamento difetti in tempo reale

Deep Learning vs Machine Learning Tradizionale

C’Γ¨ una differenza cruciale tra “Machine Learning tradizionale” e “Deep Learning”:

AspettoMachine Learning TradizionaleDeep Learning
Feature EngineeringUmano sceglie quale aspetto dell’immagine analizzareLa rete neurale scopre automaticamente
Esempio“Cerca linee dritte” β†’ Umano codifica algoritmo“Impara da 10.000 immagini” β†’ Rete scopre pattern
FlessibilitΓ Difficile adattarsi a nuovi tipi di difettiRetrain semplice su nuovi dati
Accuratezza70-80% (dipende da feature scelta bene)99%+ (impara pattern complessi)
Cosa funziona meglioDifetti ben definiti e prevedibiliDifetti vari e imprevisti
πŸ’‘ Analogia: Machine Learning tradizionale Γ¨ come insegnare a qualcuno una lista di regole (“Se vedi una linea dritta, Γ¨ un graffio”). Deep Learning Γ¨ come mostrare 10.000 foto di graffi e lasciare che il cervello impari autonomamente a riconoscerli.

Come funzionano i CNN (Convolutional Neural Networks)

Un CNN Γ¨ un’architettura di rete neurale specialmente progettata per elaborare immagini. La parola “convolutional” si riferisce al modo in cui la rete analizza l’immagine:

Convolution: Uno Sguardo Focalizzato

IMMAGINE ORIGINALE (28×28 pixel) Un “filtro” piccolo (3×3 pixel) scorre sull’immagine: β”Œβ”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β” β”‚ [X X X] X X X X X X β”‚ β”‚ [X X X] X X X X X X β”‚ ← Il filtro guarda questi 9 pixel β”‚ [X X X] X X X X X X β”‚ e calcola un numero β”‚ X X X X X X X X X X β”‚ β”‚ X X X X X X X X X X β”‚ β”‚ … β”‚ β””β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”˜ Il filtro si muove, pixel per pixel: β”Œβ”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β” β”‚ X [X X X] X X X X X β”‚ β”‚ X [X X X] X X X X X β”‚ ← Adesso guarda questi 9 β”‚ X [X X X] X X X X X β”‚ β”‚ X X X X X X X X X X β”‚ β”‚ … β”‚ β””β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”˜ Risultato: Una “mappa di attivazione” (feature map) che mostra dove nel’immagine sono presenti i pattern che il filtro sta cercando.

I CNN hanno milioni di filtri diversi, ognuno che cerca un pattern specifico:

  • Livello 1: Filtri che cercano “bordi” (pattern semplici)
  • Livello 2: Filtri che cercano “forme” (combinazioni di bordi)
  • Livello 3-8: Filtri che cercano “concetti” (un graffio Γ¨ una forma curva scura)

La rete apprende automaticamente quali filtri sono utili durante il training.

Video: Come visualizzare cosa “vede” una rete neurale CNN

Training del Modello: Come impara l’AI

Un modello di deep learning non nasce “intelligente”. Deve imparare dai dati. Ecco come funziona il training:

Passo 1: Raccogliere dati

  • 200-300 immagini di prodotti BUONI (no difetti)
  • 50-100 immagini di prodotti DIFETTOSI (vari tipi di difetti)
  • Ogni immagine etichettata: “OK” o “DIFETTO – Tipo: Graffio”

Passo 2: Dividere in training e validation

  • 70% per il training (il modello impara)
  • 30% per la validation (verifichiamo che funziona su dati mai visti prima)

Passo 3: Addestramento

Per ogni immagine di training:

LOOP: 1. Passa l’immagine attraverso la rete 2. Rete predice: “Difetto al 75%” 3. Controlla l’etichetta vera: “Difetto al 100%” 4. Calcola l’errore: 25% 5. Regola i pesi della rete per ridurre l’errore 6. Ripeti con la prossima immagine Dopo 1000 immagini: L’errore scende da 45% β†’ 15% β†’ 5% β†’ 2%

Passo 4: Validation

Testa il modello su immagini che non ha mai visto. Se funziona bene (95%+ accuratezza), il modello Γ¨ pronto per la produzione.

⚠️ Overfitting Risk: Se addestri troppo su gli stessi 200 dati, il modello “memorizza” quelle immagini specifiche anzichΓ© imparare il pattern generale. Per questo usiamo dati di validation diversi.

Metriche di Performance: Accuracy, Precision, Recall

Come misuriamo se un sistema di visione AI funziona bene? Non solo “accuratezza” β€” ci sono tre metriche fondamentali:

1. Accuracy (Accuratezza)

Percentuale di predizioni corrette su tutto il dataset.

Accuracy = (Corretti) / (Totali) = 980 / 1000 = 98% Interpretazione: “Su 1000 prodotti, il sistema ha scelto correttamente 980 volte”

2. Precision (Precisione)

Tra tutti i prodotti che il sistema dice “DIFETTO”, quanti sono veramente difettosi?

Precision = (Veri Positivi) / (Veri Positivi + Falsi Positivi) = 95 / (95 + 5) = 95% Interpretazione: “Quando il sistema dice ‘difetto’, Γ¨ corretto il 95% delle volte” Cosa significa bassissima precision: Scarta molti prodotti buoni (falsi positivi) β†’ Costi alti di rework

3. Recall (SensibilitΓ )

Tra tutti i prodotti veramente difettosi, quanti il sistema riesce a catturare?

Recall = (Veri Positivi) / (Veri Positivi + Falsi Negativi) = 95 / (95 + 3) = 97% Interpretazione: “Su 98 prodotti veramente difettosi, il sistema ne cattura 95” Cosa significa bassissimo recall: Lasciano passare difetti β†’ Clienti ricevono prodotti cattivi

Il Trade-off Precision vs Recall

Aumentare uno significa spesso diminuire l’altro. Un sistema puΓ²:

  • Alta Precision, Basso Recall: “Scarto solo quando sono SICURO” β†’ Scarti pochi buoni, ma lasciano passare difetti
  • Basso Precision, Alto Recall: “Scarto al minimo sospetto” β†’ Catturano tutti i difetti, ma scarti molti buoni
🎯 Target Logirobotix: Precision 99% + Recall 99.5% = Catturiamo quasi tutti i difetti, scarti quasi nessun buono.

Video: Capire Precision e Recall nel contesto di qualitΓ 

Performance nel Mondo Reale

I numeri di laboratorio sono belli, ma cosa succede in fabbrica con condizioni reali?

Benchmark reali Logirobotix

ScenarioAccuracyPrecisionRecall
Laboratorio (dati puliti)99.8%99.7%99.9%
Fabbrica reale (illuminazione variabile)98.5%98.2%98.8%
Prodotti con “aging” (usura nel tempo)97.2%96.9%97.5%
Dopo retraining (30 giorni di dati)99.1%98.9%99.2%

Key insight: La performance cala dal laboratorio alla fabbrica, ma il sistema impara continuamente dai nuovi dati e recupera la performance con il retraining regolare.

Limiti e Falsi Positivi

Nessun sistema di visione AI Γ¨ perfetto al 100%. Ecco i limiti reali:

Falsi Positivi (Scarto un prodotto buono)

  • Ombra sulla linea che somiglia a un graffio
  • Sporco sulla lente camera
  • Riflesso lucido che il modello interpreta come difetto
  • Prodotto usato che somiglia a difetto ma Γ¨ normal aging

Falsi Negativi (Lascio passare un difetto)

  • Difetto microscopico (< 0.5mm) non catturato dalla camera
  • Difetto sottile (es: micro-graffio appena visibile)
  • Difetto in zona di ombra
  • Tipo di difetto mai visto nel training (es: nuovo tipo di deformazione)
πŸ”§ Soluzione:
  • Falsi Positivi: Abbassare confidence threshold (da 95% a 85%)
  • Falsi Negativi: Aumentare confidence threshold (da 85% a 95%)
  • Nuovo tipo di difetto: Retrain con nuove immagini (2-4 ore)

Domande Frequenti

Quanto dura il training di un modello?
Con 300 immagini e hardware standard: 4-8 ore per il training iniziale. Retraining periodico (ogni 30 giorni): 2-3 ore. Se usi GPU dedicate: 1-2 ore.
Quante immagini servono per trainare bene un modello?
Minimo 200-300 immagini (50-100 difettose). PiΓΉ ne hai, meglio Γ¨. Con 1000+ immagini diverse, il modello diventa molto robusto. QualitΓ  > QuantitΓ : 300 foto di qualitΓ  > 5000 foto brutte.
Il modello continua a imparare durante la produzione?
No nel senso tradizionale. Raccogliamo dati continuamente (foto, difetti rilevati, feedback operatore). Ogni 30 giorni, facciamo un retraining con i nuovi dati β†’ il modello migliora continuamente.
E se il difetto Γ¨ completamente nuovo?
Se il sistema vede un defetto mai visto prima, lo segna come “anomalia” oppure lo lascia passare (dipende dalla configurazione). Poi facciamo retraining con esempi del nuovo difetto. Soluzione: 2-4 ore.
Cosa succede se cambia l’illuminazione in fabbrica?
I CNN sono sensibili all’illuminazione. Per questo usiamo “data augmentation” durante il training (mostriamo lo stesso difetto con diverse illuminazioni). Se comunque cala la performance, aggiornare l’illuminazione camera o fare retraining locale.
Un CNN puΓ² riconoscere difetti che non ha mai visto?
Limitatamente. Un CNN che ha imparato a riconoscere “graffio” potrebbe riconoscere un nuovo tipo di graffio. Ma un difetto completamente nuovo (es: mai visto in training) potrebbe sfuggire. Per questo il continuous learning Γ¨ importante.
CNN vs Vision Transformer: cosa differenza?
CNN usa filtri convoluzionali locali. Vision Transformer guarda l’intera immagine e decide quali parti sono importanti (come l’attenzione umana). Transformer sono piΓΉ flessibili ma richiedono piΓΉ dati e potenza di calcolo. Logirobotix usa CNN per production speed, Transformer per R&D avanzato.

Pronto a vederli in azione?

I sistemi di visione AI non sono teoria β€” sono viva realtΓ  nelle fabbriche oggi. Se vuoi capire come funzionano sul tuo prodotto specifico, prenota una demo gratuita.

Scopri i sistemi di visione AI Logirobotix β†’
πŸ“ Articolo scritto da: Engineering Team Logirobotix
πŸ”„ Ultimo aggiornamento: Agosto 2025
πŸ”— Risorse correlate: Sistemi di Visione AI β€’ Blog