IA open source
Quali sono i migliori LLM open source e come sceglierli?
Open source o open weight: la distinzione fondamentale
Molti modelli presentati come open source rilasciano solo i pesi addestrati, non i dati e il codice di training. Il termine più preciso è open weight: si possono scaricare, eseguire e ottimizzare, ma non riprodurre del tutto. La vera apertura conforme OSI, con dati e codice aperti, è più rara.
Nella pratica conta soprattutto la licenza. Determina se puoi usare un modello commercialmente, ridistribuirlo e sfruttarne gli output. I pesi aperti sono la chiave della sovranità dei dati e dell'uso locale, a prescindere da quanto sia aperto il resto del modello.
Le principali famiglie di modelli aperti
La panoramica seguente inquadra famiglie note. Capacità e versioni cambiano in fretta: verifica sempre generazione e licenza attuali presso il fornitore.
- Llama (Meta): ecosistema ampio, open weight con licenza community propria e condizioni d'uso, non open source classico.
- Mistral / Mixtral (Mistral AI, Francia): diversi modelli con licenza Apache 2.0, fornitore europeo, alcuni con architettura Mixture-of-Experts.
- Qwen (Alibaba): ampia gamma di dimensioni, molte varianti con Apache 2.0, in genere buona copertura multilingue.
- DeepSeek: pesi in parte con licenza MIT, con varianti orientate al ragionamento.
- Gemma (Google): modelli compatti ed efficienti, open weight con licenza Gemma propria.
- Phi (Microsoft): modelli piccoli con licenza MIT, spesso validi rispetto alle dimensioni.
- OLMo (Allen Institute for AI): completamente aperto, dati di training inclusi, con Apache 2.0, riferimento per l'apertura reale.
- Apertus (ETH Zurigo, EPFL, CSCS): il modello svizzero completamente aperto e multilingue, di cui parliamo più avanti.
- Altri: Falcon (TII), Command (Cohere), GLM (Zhipu) e un flusso costante di nuovi modelli ampliano il panorama.
Leggere correttamente le licenze
Il termine open source è usato in modo incoerente. Prima di ogni uso in produzione, verifica sempre il testo di licenza specifico, soprattutto per l'uso commerciale.
- Licenze OSI permissive (Apache 2.0, MIT): uso commerciale ampio, ridistribuzione e modifica di norma consentiti.
- Licenze community/open weight proprietarie (es. Llama, Gemma): uso consentito ma con condizioni e alcune limitazioni.
- Licenze solo per ricerca: nessun uso commerciale consentito.
- Chiarire sempre: uso commerciale, ridistribuzione, diritti sugli output, attribuzione e marchi.
- Pesi aperti non significa dati di training aperti: vanno valutati separatamente.
Come scegliere il modello giusto
Invece di cercare il presunto modello migliore, parti dal caso d'uso. Questi criteri aiutano una scelta solida e neutrale.
- Caso d'uso: chat, programmazione, estrazione, riassunto o RAG pongono esigenze diverse.
- Qualità linguistica: verifica tedesco, francese, italiano e, se serve, svizzero-tedesco con esempi tuoi.
- Dimensione del modello e hardware: i modelli grandi richiedono più VRAM; la quantizzazione riduce il fabbisogno.
- Licenza e condizioni commerciali: sono compatibili con il tuo modello di business?
- Esercizio: locale/on-premise per la sovranità dei dati, oppure hosting gestito per meno oneri.
- Adattabilità: possibilità di fine-tuning, prompting e integrazione di strumenti.
- Governance e manutenzione: cadenza degli aggiornamenti, sicurezza, documentazione e supporto della community.
Esecuzione in locale: hardware, strumenti e privacy
Un vantaggio chiave dei pesi aperti è l'esecuzione locale. Modelli piccoli e quantizzati girano già su un buon portatile; quelli grandi richiedono una GPU o un server.
- Strumenti: Ollama, llama.cpp, LM Studio, vLLM e le librerie Hugging Face semplificano download ed esecuzione.
- La quantizzazione (es. 4-bit, formato GGUF) riduce la memoria con perdita di qualità di solito contenuta.
- Sovranità dei dati: in locale i dati non lasciano la tua infrastruttura, un argomento forte per proteggere informazioni sensibili.
- Compliance: on-premise o hosting svizzero facilita il rispetto del revDSG, evitando trasferimenti non necessari all'estero.
La prospettiva svizzera ed europea
Apertus è un modello linguistico completamente aperto e multilingue dalla Svizzera, sviluppato da ETH Zurigo, EPFL e dal centro di supercalcolo CSCS e addestrato sul supercomputer Alps. Rappresenta sovranità digitale e trasparenza: pesi, dati di training e metodologia sono resi pubblici.
- EU AI Act: i modelli GPAI open source con licenza libera godono di alcune agevolazioni, ma non in caso di rischio sistemico; restano obblighi come il riepilogo dei dati di training e il rispetto del copyright. La norma ha effetto extraterritoriale.
- revDSG ed EDOEB: i pesi aperti aiutano a mantenere i dati personali in Svizzera e a documentare i trattamenti in modo trasparente.
- Indipendenza dai fornitori: i modelli aperti riducono il rischio di lock-in e aumentano il controllo su roadmap e costi.
Domande frequenti
Qual è la differenza tra LLM open source e open weight?
Open weight significa che i pesi addestrati sono liberamente disponibili: puoi scaricare, eseguire e adattare il modello. Il pieno open source include anche dati di training e codice aperti, così da poter riprodurre il modello. Molti modelli noti sono open weight ma non pienamente open source.
Qual è il miglior LLM open source?
Non esiste un modello migliore in assoluto. La scelta giusta dipende dal caso d'uso, dalla qualità linguistica per le tue lingue, dalla licenza, dall'hardware disponibile e dalle esigenze di privacy. Prova due o tre candidati con esempi reali tuoi, invece di affidarti a classifiche generiche.
Posso usare gli LLM open source a fini commerciali?
Dipende dalla licenza. I modelli con Apache 2.0 o MIT consentono in genere un ampio uso commerciale. Le licenze community proprietarie (come Llama o Gemma) di solito consentono l'uso commerciale ma con condizioni. Le licenze solo per ricerca lo escludono. Verifica sempre il testo di licenza specifico.
Quale hardware serve per eseguire un LLM in locale?
I modelli piccoli e quantizzati girano già su un buon portatile con RAM sufficiente. I modelli medi e grandi traggono grande beneficio da una GPU con VRAM adeguata o da un server. La quantizzazione riduce molto la memoria richiesta; strumenti come Ollama o LM Studio semplificano l'avvio.
Gli LLM aperti sono compatibili con l'EU AI Act e il revDSG?
I modelli aperti sono in linea di massima compatibili, ma non eliminano gli obblighi. L'EU AI Act prevede agevolazioni per i modelli GPAI open source con licenza libera, salvo in caso di rischio sistemico; restano richiesti il riepilogo dei dati di training e il rispetto del copyright. Sotto il revDSG, l'uso locale è un vantaggio, poiché i dati personali possono restare in Svizzera.
Esiste un LLM open source svizzero?
Sì. Apertus è un modello linguistico completamente aperto e multilingue dalla Svizzera, sviluppato da ETH Zurigo, EPFL e dal centro di supercalcolo CSCS e addestrato sul supercomputer Alps. Pesi, dati di training e metodologia sono pubblici, il che lo rende un riferimento per sovranità digitale e trasparenza.
Termini nel glossario
AI pratica per la vostra azienda
Dall’idea alla realizzazione: vi mostriamo cosa è concretamente possibile nel vostro caso.
Richiedi una demo