Fine-
tuning
Riaddestramento mirato · Personalizzazione del modello
Il fine-tuning è il processo di continuare l'addestramento di un LLM su un dataset specifico per modificarne lo stile o le competenze. A differenza del RAG: il fine-tuning cambia il modello (costoso, statico), il RAG gli fornisce contesto al momento della richiesta (flessibile, aggiornabile). Quasi sempre, per chi inizia, la risposta è RAG.
Fine-tuning vs RAG: il confronto diretto
Fine-tuning
- Modifica il modello permanentemente
- Richiede dataset di training (500+ esempi)
- Costo fisso + riaddestramento a ogni aggiornamento
- Ottimo per: stile fisso, tone of voice, format
- Lento da aggiornare (ore/giorni)
- Non cita le fonti automaticamente
RAG
- Non tocca il modello — fornisce contesto
- Funziona con qualsiasi documentazione esistente
- Aggiornabile in minuti (aggiorni il database)
- Ottimo per: conoscenza specifica, dati aggiornati
- Aggiornamento istantaneo
- Può citare le fonti (grounding tracciabile)
Quando il fine-tuning ha senso
Il fine-tuning è appropriato in questi scenari specifici:
- Tono di voce brand: vuoi che il modello scriva sempre con il tuo stile specifico, senza doverlo spiegare nel prompt ogni volta
- Task altamente specializzati: un modello per classificare documenti legali secondo una tassonomia proprietaria
- Riduzione della lunghezza del prompt: hai un formato di output molto specifico che oggi richiede 500 token di istruzioni — il fine-tuning può interiorizzarlo
- Latenza critica: un system prompt lungo rallenta — un modello fine-tunato risponde più velocemente per task specifici
Quando NON fare fine-tuning
Evita il fine-tuning se:
- Non hai almeno 200–500 esempi di alta qualità (input/output pairs)
- La conoscenza si aggiorna spesso — riaddestrare è costoso e lento
- Il problema si risolve con un buon system prompt — provatelo prima
- Vuoi che il modello "sappia" fatti specifici — il RAG è più affidabile e aggiornabile
- Hai un budget limitato — il ROI raramente giustifica il fine-tuning per PMI
Fine-tuning di modelli open source
Per chi vuole pieno controllo, i modelli open source (Llama 3.1, Mistral, Qwen 2.5) permettono fine-tuning completo. Con tecniche come LoRA e QLoRA, è possibile fare fine-tuning efficiente anche su GPU consumer. Ma la curva tecnica è significativa — questa è l'area in cui il supporto di un esperto fa la differenza.
// Come lo usa AI Coach Italia
Nel Brain Training Program, insegniamo quando il fine-tuning è giustificato e quando è una distrazione costosa. Per la stragrande maggioranza dei partecipanti, la risposta è RAG + system prompt ben strutturato — che risolve il 95% dei casi d'uso con un decimo dello sforzo. Quando il fine-tuning è davvero la scelta giusta, Federico Casarella guida il processo tecnico: curazione del dataset, scelta del modello base, training e valutazione.
Scopri il Brain Training Program →Domande frequenti sul fine-tuning
Cos'è il fine-tuning di un LLM?
Il fine-tuning è il processo di continuare l'addestramento di un LLM su un dataset specifico (coppie input/output) per modificarne stile o competenze. Cambia il modello stesso — diverso dal RAG che fornisce contesto al momento della richiesta senza toccare il modello.
Fine-tuning vs RAG: quale scelgo?
Regola pratica: conoscenza che cambia → RAG. Stile fisso → fine-tuning (o system prompt — provalo prima). Per quasi tutti gli imprenditori che iniziano, RAG è la risposta: più flessibile, aggiornabile, meno costoso, senza dataset di training.
Il fine-tuning è costoso?
Dipende dal modello. OpenAI offre fine-tuning di GPT-3.5 e GPT-4o-mini a prezzi accessibili. Il costo nascosto è la raccolta e cura del dataset di training, che richiede tempo e competenze. Spesso il ROI non giustifica il fine-tuning quando il RAG risolve lo stesso problema a costi minimi.
Posso fare fine-tuning di Claude o GPT?
OpenAI offre fine-tuning di GPT-3.5-turbo e GPT-4o-mini tramite API. Anthropic (Claude) non offre fine-tuning diretto al pubblico nel 2026 ma ha un programma enterprise. Per modelli open source come Llama, Mistral, Qwen, il fine-tuning è completamente accessibile con hardware adeguato e tecniche come LoRA/QLoRA.