RAG: cos’è, come funziona e come usarla nei sistemi AI aziendali
L’intelligenza artificiale generativa sa produrre testi, riassunti e risposte con grande naturalezza, ma non conosce automaticamente i documenti, i processi e i dati aggiornati di un’azienda. È proprio qui che entra in gioco la RAG, Retrieval-Augmented Generation: un’architettura ormai ampiamente utilizzata per collegare un modello linguistico a fonti informative selezionate e verificabili.
La RAG non rende un modello infallibile e non consiste semplicemente nel “caricare alcuni PDF in un chatbot”. È un sistema composto da più elementi: qualità dei dati, indicizzazione, ricerca, regole di accesso, generazione della risposta, citazioni e controllo dei risultati. Se progettata bene, permette di trasformare archivi dispersi in uno strumento di lavoro utile; se progettata male, può restituire con sicurezza informazioni incomplete o fuori contesto.
Cos’è la Retrieval-Augmented Generation
Un Large Language Model, o LLM, genera una risposta sulla base delle informazioni apprese durante l’addestramento e del contesto che riceve nella conversazione. Tuttavia, ciò che il modello ha appreso può non essere aggiornato, non includere dati privati e non riflettere le regole specifiche di un’organizzazione.
La RAG aggiunge al processo una fase di ricerca. Prima di chiedere al modello di rispondere, il sistema cerca le informazioni più pertinenti in una base di conoscenza autorizzata: manuali, pagine web, cataloghi, documenti tecnici, procedure, ticket di assistenza, database o contenuti del CRM. I passaggi recuperati vengono inseriti nel contesto della richiesta e il modello li utilizza per formulare una risposta.
Il concetto è stato formalizzato nel 2020 nel lavoro Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. Oggi la RAG è una componente consolidata di chatbot, assistenti interni, motori di ricerca intelligenti e sistemi agentici. Il valore, quindi, non sta più nella novità del termine, ma nella capacità di implementarlo in modo affidabile all’interno di un processo aziendale reale.
Come funziona una RAG, passo dopo passo
1. Preparazione delle fonti
Il lavoro comincia dai contenuti. I documenti vengono raccolti, puliti, classificati e arricchiti con metadati come titolo, data, reparto, prodotto, lingua, versione e livello di riservatezza. Questa fase è decisiva: una base di conoscenza duplicata, obsoleta o contraddittoria produce risposte altrettanto confuse.
2. Suddivisione e indicizzazione
I documenti lunghi vengono divisi in porzioni più piccole, chiamate chunk. La dimensione e il modo in cui vengono creati dipendono dal contenuto: un listino, un contratto e un manuale tecnico non dovrebbero essere trattati nello stesso modo. Ogni porzione può essere trasformata in un embedding, una rappresentazione numerica che aiuta il sistema a riconoscere la somiglianza semantica tra una domanda e i contenuti disponibili.
3. Ricerca delle informazioni pertinenti
Quando l’utente formula una domanda, il sistema cerca i passaggi più utili. Non esiste solo la ricerca vettoriale: in molti progetti una ricerca ibrida, che combina significato, parole chiave e filtri sui metadati, è più efficace. Un ulteriore modello di reranking può riordinare i risultati per dare priorità alle fonti realmente pertinenti.
4. Costruzione del contesto
I risultati selezionati vengono inseriti nel prompt insieme alla domanda e alle istruzioni operative. Qui si stabilisce, per esempio, che il modello deve rispondere solo in base alle fonti disponibili, segnalare quando le informazioni non sono sufficienti, rispettare il tono del brand e non mostrare contenuti per i quali l’utente non possiede l’autorizzazione.
5. Generazione, fonti e controllo
Il modello elabora il contesto e genera una risposta. Quando il caso d’uso lo richiede, il sistema mostra anche le fonti, i documenti o i passaggi utilizzati. Registrare le ricerche e valutare le risposte permette di capire dove il sistema funziona e dove deve essere migliorato.
RAG e fine-tuning non sono la stessa cosa
RAG e fine-tuning risolvono problemi diversi. La RAG fornisce informazioni al momento della richiesta ed è indicata quando i dati cambiano, sono proprietari o devono essere citati. Il fine-tuning modifica il comportamento del modello attraverso esempi e può essere utile per ottenere uno stile, un formato o una classificazione coerenti.
Se l’obiettivo è far conoscere all’assistente il catalogo aggiornato, le procedure interne o lo stato di un ordine, la RAG è spesso il punto di partenza. Se invece occorre insegnare una modalità di risposta molto specifica e ripetibile, può essere utile il fine-tuning. In alcuni progetti le due tecniche possono convivere, ma nessuna delle due sostituisce una buona progettazione del flusso.
Perché può essere utile in azienda
- Informazioni aggiornabili: modificare una fonte o reindicizzare un documento è più pratico che riaddestrare un modello.
- Conoscenza privata: l’assistente può lavorare con dati aziendali che non facevano parte dell’addestramento dell’LLM.
- Maggiore verificabilità: la risposta può essere accompagnata dai riferimenti utilizzati.
- Ricerca più naturale: gli utenti possono interrogare grandi archivi con domande formulate nel linguaggio quotidiano.
- Integrazione nei processi: la RAG può alimentare chatbot, aree riservate, CRM, help desk e applicazioni sviluppate su misura.
Questi vantaggi non sono automatici. La RAG può ridurre il rischio di risposte inventate, ma non lo elimina: il sistema può recuperare il documento sbagliato, interpretare male un passaggio o produrre una sintesi imprecisa. Per questo le affermazioni importanti devono poter essere verificate e le decisioni ad alto impatto devono prevedere controlli adeguati.
Casi d’uso concreti
Assistenza clienti
Un assistente può consultare FAQ, condizioni di vendita, manuali e dati autorizzati sugli ordini per rispondere con maggiore precisione. Se la richiesta supera le sue competenze o manca una fonte affidabile, deve trasferire la conversazione a un operatore senza improvvisare.
Ricerca nella documentazione interna
Procedure, regolamenti, documenti di onboarding e materiali tecnici spesso sono distribuiti tra cartelle e piattaforme diverse. Una RAG può offrire un punto di accesso conversazionale, rispettando ruoli e permessi: una persona deve poter recuperare soltanto ciò che è autorizzata a vedere.
Cataloghi ed e-commerce
Collegando schede prodotto, disponibilità, compatibilità e guide all’acquisto, il sistema può aiutare il cliente a confrontare soluzioni e trovare l’articolo più adatto. I dati dinamici, come prezzo e disponibilità, dovrebbero essere letti direttamente dalle API o dal gestionale, non copiati in un indice destinato a diventare rapidamente obsoleto.
Supporto commerciale e CRM
Un assistente può riassumere lo storico di un cliente, cercare informazioni nelle offerte e preparare una bozza di risposta. L’utente conserva il controllo prima dell’invio, mentre il sistema riduce il tempo speso a cercare dati in strumenti differenti.
Supporto tecnico
Manuali, changelog e ticket risolti possono diventare una base di conoscenza per tecnici e clienti. La risposta dovrebbe indicare versione del prodotto, procedura e fonte, evitando di mescolare istruzioni riferite a configurazioni differenti.
I limiti da considerare prima dello sviluppo
La qualità di una RAG dipende soprattutto dalla qualità del recupero. Se la fonte corretta non viene trovata, il modello non può utilizzarla. È quindi necessario misurare separatamente almeno due aspetti: se il sistema recupera i contenuti pertinenti e se la risposta finale è fedele a quei contenuti.
Vanno inoltre gestiti aggiornamenti, duplicati, documenti scaduti, tabelle complesse, scansioni, contenuti multilingua e domande ambigue. Anche latenza e costi devono essere valutati: aggiungere più passaggi o inviare troppo contesto non garantisce una risposta migliore.
La sicurezza è parte dell’architettura, non un’aggiunta finale. I permessi devono essere applicati prima del recupero; i dati sensibili devono essere trattati secondo finalità e policy definite; i documenti esterni devono essere considerati potenzialmente ostili. Un testo indicizzato può infatti contenere istruzioni progettate per manipolare il modello, fenomeno noto come indirect prompt injection.
Nei settori legale, sanitario o finanziario, una risposta può aiutare a trovare e sintetizzare informazioni, ma non dovrebbe essere presentata automaticamente come parere professionale, diagnosi o decisione d’investimento. Servono fonti qualificate, tracciabilità, limiti dichiarati e revisione umana proporzionata al rischio.
Quando una RAG non è la soluzione giusta
Non ogni progetto di intelligenza artificiale richiede una RAG. Se le informazioni sono poche e stabili, può bastare un prompt ben costruito. Se servono calcoli esatti, operazioni transazionali o dati in tempo reale, è spesso preferibile collegare il modello a funzioni e API dedicate. Se la ricerca tradizionale soddisfa già il bisogno, aggiungere generazione può aumentare complessità senza creare vero valore.
La domanda iniziale non dovrebbe essere “quale database vettoriale scegliamo?”, ma “quale attività vogliamo migliorare, quali fonti sono affidabili e come misureremo il risultato?”. La tecnologia viene dopo la definizione del problema.
Come progettiamo una soluzione RAG in MLoiacono
In MLoiacono partiamo dal processo, non dal modello. Analizziamo chi userà il sistema, quali domande deve gestire, dove risiedono i dati e quali azioni devono restare sotto il controllo di una persona. Da questa analisi nasce un prototipo circoscritto, costruito su un insieme rappresentativo di documenti e domande reali.
Successivamente lavoriamo sulla preparazione delle fonti, sulla strategia di segmentazione, sulla ricerca ibrida, sui permessi e sull’integrazione con sito web, e-commerce, CRM o software aziendali. L’interfaccia viene progettata per rendere chiare le fonti, comunicare i limiti e facilitare il passaggio a un operatore quando necessario.
Prima del rilascio creiamo un set di valutazione: domande semplici, casi limite, richieste prive di risposta, informazioni riservate e tentativi di manipolazione. Monitoriamo pertinenza delle fonti, fedeltà della risposta, tempi, costi e feedback degli utenti. Una RAG utile non è un progetto che si configura una volta sola, ma un sistema che evolve insieme ai documenti e ai processi dell’organizzazione.
Dai documenti aziendali a risposte davvero utili
La RAG è oggi uno dei modi più concreti per portare l’intelligenza artificiale dentro un’azienda, perché collega la capacità linguistica degli LLM a conoscenze selezionate. Il risultato, però, dipende meno dall’effetto sorpresa del chatbot e molto di più dalla cura con cui vengono gestiti dati, ricerca, sicurezza ed esperienza utente.
Se vuoi capire se i tuoi archivi, il tuo sito o i tuoi strumenti aziendali possono diventare la base di un assistente intelligente, parliamone. Possiamo partire da un caso d’uso misurabile e progettare una soluzione su misura, integrata nel flusso di lavoro che utilizzi ogni giorno.