Consulenza LLM, agenti e RAG per aziende

Sono Riccardo Gasparini, ingegnere AI freelance a Modena. Porto i modelli linguistici dentro i processi aziendali: ricerca sui documenti interni, estrazione di dati da documenti e moduli, agenti che interrogano database e sistemi esistenti. Con modelli cloud oppure self-hosted su GPU, quando i dati non possono uscire dall'azienda.

Problemi tipici

  • Migliaia di documenti tecnici, procedure e manuali che nessuno riesce a interrogare.
  • Dati chiusi in PDF, scansioni e file Office che vanno riportati a schema senza errori.
  • Un database legacy che solo due persone sanno interrogare in SQL.
  • Modelli che non possono vedere dati sensibili: serve inferenza on-premise.
  • Un prototipo RAG che "funziona in demo" ma nessuno ha misurato.

Cosa consegno

  • Pipeline di ingestion con parsing dei documenti (Docling, OCR, modelli visione-linguaggio) e chunking semantico.
  • Retrieval ibrido denso e sparso con reranking, retrieval visuale delle pagine quando serve.
  • Agenti LangGraph con output strutturato e validato (Pydantic), text-to-SQL con guardrail.
  • Valutazione con RAGAS o test set proprietari, prima e dopo ogni modifica.
  • Backend FastAPI multi-tenant con autenticazione, streaming, deploy Docker o Kubernetes.
  • Serving self-hosted con vLLM o Ollama, oppure API Claude e OpenAI.

Come lavoro su questo

Parto dai documenti e dalle domande vere degli utenti, non dal modello. Costruisco un set di valutazione in pochi giorni, poi itero misurando. In produzione ogni componente è sostituibile: modello, vector store, reranker.

Lavori in questo ambito

Gruppo industriale · 2026

Piattaforma RAG multi-azienda sui documenti interni

Problema
Migliaia di documenti tecnici e procedure sparsi tra le società del gruppo, impossibili da interrogare, e nessun dato può uscire dall'azienda.
Cosa ho fatto
Ingestion con Docling e chunking semantico, indicizzazione tripla (chunk, domande generate, riassunti), ricerca ibrida densa e sparsa con reranking cross-encoder e retrieval visuale delle pagine con ColPali. Stack LLM completamente locale su vLLM, risposte in streaming con permessi per azienda, valutazione continua con RAGAS, deploy su Kubernetes.
  • Docling
  • Qdrant
  • BGE-M3
  • ColPali
  • vLLM
  • RAGAS
  • FastAPI
  • Helm

Diagnostica di laboratorio · 2026

Estrazione strutturata da referti di laboratorio

Problema
Parametri come sodio e potassio, con valori e unità, chiusi in referti PDF e scansionati con etichette sempre diverse, da estrarre senza inventare nulla.
Cosa ho fatto
Grafo LangGraph a tre agenti: uno normalizza i termini richiesti, uno cerca i parametri nel testo con match esatto o fuzzy, uno valida e corregge il JSON finale con liste trovati e non trovati. Output Pydantic, streaming, archivio documenti per utente, modelli self-hosted, multi-tenant su Kubernetes.
  • LangGraph
  • Pydantic
  • Docling
  • vLLM
  • FastAPI
  • Kubernetes

Ristorazione collettiva · 2026

Assistente conversazionale su un database ricette legacy

Problema
Un database IBM DB2 di ricette e ingredienti che solo chi scrive SQL riusciva a interrogare, e domande in linguaggio naturale da parte dello staff.
Cosa ho fatto
Tre agenti LangGraph: il primo classifica l'intento, il secondo genera query sicure sul DB2 (WHERE dinamiche, ricerca case-insensitive, join ottimizzati per la versione 9.7), il terzo filtra e aggrega con pandas. Sessioni con scadenza, KPI, export CSV, modello open su vLLM self-hosted, autenticazione Keycloak, Helm e CI.
  • LangGraph
  • IBM DB2
  • vLLM
  • Keycloak
  • FastAPI
  • Helm

Domande frequenti

Che tipo di progetti segui?

Progetti di computer vision industriale, sistemi basati su LLM (RAG, agenti, estrazione strutturata), forecasting su dati IoT e geospaziali, e piattaforme web e mobile che rendono questi modelli un prodotto. Dal PoC alla produzione, con codice, test e deploy.

Usi modelli cloud o on-premise?

Dipende dai dati. Quando possono uscire dall'azienda uso API come Claude o OpenAI; quando non possono, faccio girare modelli open su GPU vostre o su un server dedicato con vLLM o Ollama. Ho portato in produzione entrambe le soluzioni.

Come si inizia?

Scrivimi due righe sul problema. Facciamo una call di trenta minuti, gratuita, per capire se ha senso lavorare insieme. Se sì, preparo una proposta con obiettivo, metrica di successo, tempi e costi.