AlgaGain

Information Extraction

Dati utili chiusi in documenti, immagini e audio?

AlgaGain li estrae e li classifica, anche quando sono scritti nel linguaggio del vostro settore, con sigle, termini ed eccezioni, e li porta in database e gestionali. Per ogni dato si sa da dove viene e quale regola l’ha trovato.

La demo si richiede ad AGG Soluzioni Avanzate, che commercializza la piattaforma: si apre il suo sito.

AlgaGain, information extraction system

Da quali fonti

Testi ed email

Testo semplice, JSON, XML, HTML.

Documenti

PDF e Office, moduli prestampati, anche intere cartelle.

Web

Pagine da indirizzo, ricerca diretta su Wikipedia.

Immagini

Documenti scansionati o fotografati, letti con OCR.

Audio

Registrazioni trascritte e poi analizzate.

Come estrae

Navigare il documento

Le regole si muovono nel documento in modo strutturato (righe, blocchi, orientamento) e trovano relazioni di posizione anche complesse: il valore accanto a un’etichetta, sotto un titolo, nello stesso riquadro.

Tutte le forme di una parola, in modo ripetibile

“Pagare” trova “pagato” e “pagheremo” grazie al dizionario morfologico, non a un’ipotesi del modello: lo stesso risultato ogni volta, e se serve con la parte del discorso (verbo o nome). Gli LLM si aggiungono dove servono, non al posto delle regole.

Parti logiche della frase

Ben oltre soggetto, oggetto e frase principale, con AlgaKnow.

Entità complesse

Riferimenti normativi, codici, importi, date.

Raffinamento progressivo

Regole alternative o in parallelo, attivate dal contesto.

Tutto tracciato

Ogni estrazione con la regola che l’ha prodotta.

Mappa delle funzioni di AlgaGain
Mappa delle funzioni di AlgaGain: ogni riquadro è una funzione. Cliccate per ingrandire.

Classificare

Troppe categorie e pochi esempi?

Più approcci insieme, scelti caso per caso.

Regole

Precise e spiegabili, per i criteri noti.

Classificatore locale

Un modello che gira sui vostri server.

Somiglianza

Il confronto con documenti già classificati.

LLM

Solo per i casi più difficili.

Approcci a confronto

Estrazione di dati da immagini di documenti.

OCR + regoleOCR + LLMSolo LLMOCR locale
Velocità~10 s~23 s~15 s~7 s (solo lettura)
Accuratezzamassimaelevataelevataelevata
Costomolto bassoaltobassohardware locale
Rischio di allucinazionimolto bassobassomedio-bassomedio-basso
Dati sensibilipseudonimizzazione o contrattopseudonimizzazione o contrattopseudonimizzazione o contrattorestano in azienda
Flessibilitàmediaaltaaltissimamedia
Dati indicativi da test interni su singole pagine, inizio 2026.

Un OCR sbaglia, un LLM allucina: per questo i controlli simbolici servono in tutti i casi.

Oltre l’estrazione

Etichettatura

Etichettatura automatica dei documenti.

Questionari

Generazione di questionari dai documenti: prototipo funzionante, da sviluppare su progetto.

Un caso: dati da foto di documenti

Oltre il 94% di letture esatte di codici fiscali, POD e PDR da foto scattate col cellulare.

Le soluzioni »

Approfondimento tecnico
  • Fonti: testo, JSON, XML, HTML; PDF e Office con Apache Tika; estrazione da URL; ricerca diretta su Wikipedia; file caricati e attraversamento di cartelle
  • Immagini: OCR con Tesseract, OpenCV e servizi cloud (OpenAI, Google); audio con Whisper
  • Regole: corrispondenze non posizionali, esclusioni, negazioni, variabili, forma canonica, parti del discorso, parti logiche (frase intera con subordinate o solo principale), filtri sulle entità, esecuzione condizionale
  • Posizione: riga corrente e righe calcolate; blocco OCR, numero di blocchi, dimensioni e orientamento
  • Estensioni delle regole in Java; tracciamento dell’esecuzione; eventi per la pre-elaborazione specifica del progetto
  • Classificazione: regole, classificatore locale basato su BERT, somiglianza in un vector store, LLM

Mettete alla prova AlgaGain

Demo e progetti con AGG Soluzioni Avanzate, che commercializza la Piattaforma Algaware in Italia.