L’intelligenza dei modelli di frontiera. Il rigore di un database normativo. Nessun altro ha entrambi.
Per portare l’AI nel cuore del lavoro legale, e non solo ai suoi margini, un professionista deve potersi fidare su tre cose: che ragioni correttamente, che ogni risposta sia fondata su fonti verificabili, e che sappia fermarsi quando mancano gli elementi. LegalITA, il primo benchmark a tre dimensioni sul diritto italiano, le misura tutte e tre. Next-OS è primo in ognuna: ed è questo che rende possibile passare a un modo di lavorare AI-native.
85,1% vs 79,1%
+6,0 punti su Claude Opus 4.8
Anche contro uno dei migliori modelli generalisti, Next-OS guida il ragionamento giuridico.
80,6% vs 41,8%
+38,8 punti su Competitor A
Quasi il doppio delle risposte
con una fonte pertinente e verificabile.
85,0% vs 67,5%
+17,5 punti su Competitor C
Quando manca un documento essenziale, Next-OS sa quando fermarsi: prima e meglio di ogni altro sistema testato.
IL PROBLEMA
L’AI è entrata negli studi e nelle aziende. Ma è rimasta ai margini del lavoro.
La maggior parte dei professionisti legali e compliance oggi usa già l’AI: per riassumere, per preparare una bozza, per una prima esplorazione. Ma il cuore del lavoro, la ricerca giurisprudenziale, l’analisi del caso, la posizione da difendere, resta manuale. Non per resistenza al cambiamento: per una valutazione professionale corretta. Finora dovevi scegliere tra intelligenza e fonti.
I modelli generalisti di frontiera ragionano in modo straordinario, ma quando devono ancorare le risposte alla giurisprudenza reale inventano, o citano sentenze autentiche che non c’entrano: e su un atto la firma è la tua, non del modello. Le piattaforme legal-tech tradizionali hanno le fonti, ma un’intelligenza di generazione precedente, ormai sorpassata sul ragionamento proprio dai modelli generalisti.
Delegare all’AI il margine del lavoro non richiede fiducia. Delegarle il centro sì. LegalITA nasce per misurare esattamente le condizioni di quella fiducia.
107
17.000
11
3
IL METODO
Le tre condizioni per delegare.
Condizione 01
Ragiona come un professionista?
Altrimenti puoi delegare solo la forma.
- Il test
67 quesiti giuridici aperti in diritto civile, del lavoro e tributario, valutati criterio per criterio da un panel di tre giudici indipendenti. Un quesito è superato solo se ogni criterio richiesto è soddisfatto: nessun credito parziale. - Cosa abilita
È la differenza tra un’AI che scrive e un’AI a cui puoi affidare l’analisi: identificare i principi rilevanti e applicarli al caso concreto è il lavoro, non il suo contorno. - Il risultato
Next-OS supera integralmente l’85,1% dei quesiti, primo tra gli 11 sistemi. E c’è un dato che cambia il mercato: il miglior modello generalista, Claude Opus 4.8 (79.1%), supera tutte le piattaforme legal-tech in gara. Avere le fonti giuste non basta più, se l’intelligenza che le usa è di generazione precedente.
Condizione 02
Sa dimostrare quello che dice?
Altrimenti la verifica costa più della delega.
- Il test
Non basta citare una sentenza vera. La citazione deve essere risolta correttamente (corte, sezione, numero, anno) e deve sostenere davvero la questione in esame, nell’orientamento giusto: consolidato, successivo a un revirement, o uno degli orientamenti rilevanti se il contrasto è ancora aperto. - Cosa abilita
La responsabilità professionale non si delega: la firma resta tua. Se per controllare una risposta devi rifare la ricerca da zero, non hai guadagnato tempo: lo hai spostato. - Il risultato
Qui il divario è drammatico. Next-OS fornisce almeno una sentenza che copre effettivamente la questione nell’80,6% dei casi. I migliori modelli generalisti si fermano al 3%. GPT-5.5 a zero. Con un generalista la verifica delle fonti resta tutta sulle tue spalle. Con Next-OS diventa un controllo.
Condizione 03
Sa quando fermarsi?
Altrimenti non puoi fidarti nei casi veri.
- Il test
40 quesiti-trappola. Ognuno chiede di analizzare un documento specifico (un contratto, un avviso di accertamento, una sentenza) che però non è allegato. Solo un comportamento supera il test: fermarsi, segnalare che il documento manca e chiederlo. - Cosa abilita
Il lavoro vero non è un ambiente da demo: i documenti mancano, arrivano tardi, arrivano incompleti. È la condizione per lasciar lavorare l’AI senza sorvegliarla a ogni passo. - Il risultato
Next-OS si ferma e chiede i documenti nell’85% dei casi. Il miglior generalista, Claude Sonnet 5, poco più di una volta su due (52,5%). GPT-5.5 e Gemini 3.5 Flash una volta su otto. L’errore più frequente non è la distrazione: molti sistemi riconoscono che il documento manca, e formulano comunque una strategia come se lo avessero letto.
LA MORALE
Servono due ingredienti. Nessuno li ha entrambi. Noi sì.
I risultati di LegalITA raccontano perché finora lo switch non era razionale, e il motivo è strutturale, non congiunturale.
Perché i sistemi verticali non ragionano a livello frontier
Le piattaforme legal-tech tradizionali sono costruite attorno a un modello: lo interrogano, gli passano qualche documento recuperato, ne impacchettano la risposta. Ma le capacità dei modelli di frontiera non emergono chiamando un’API: emergono dall’ambiente di esecuzione in cui il modello lavora. Wrappare un modello significa metterne un tappo alle capacità; costruire l’ambiente di esecuzione significa liberarle.
Perché i modelli di frontiera non sanno citare
La loro conoscenza del diritto è impressa nei pesi, non ancorata a fonti interrogabili. E non basta metterci accanto un archivio di documenti: perché una citazione regga, il database sottostante deve essere machine-readable — ogni norma e ogni sentenza in una struttura che la macchina può interrogare, verificare e tracciare, con la sua vigenza e le sue relazioni. È l’infrastruttura che Aptus.AI costruisce da anni.
Next-OS è costruito per stare esattamente all’incrocio
Un ambiente di esecuzione che porta i modelli di frontiera al loro massimo, ancorato al database normativo machine-readable di Aptus.AI, dove ogni fonte è verificata, risolta e tracciabile. Ragiona meglio dei sistemi verticali, cita meglio dei modelli generalisti, si ferma quando l’onestà professionale lo richiede. È la combinazione che sposta l’AI dal margine al centro: dalla bozza alla ricerca, dall’assistente al collaboratore.
TRASPARENZA
Una decisione professionale si prende su prove verificabili.
Per questo il benchmark completo è documentato in un white paper pubblico: metodo, criteri, protocollo di valutazione, competitor legal-tech anonimizzati e limiti dichiarati esplicitamente, inclusa la dimensione del campione e la necessità di una validazione umana stratificata.
Codice di valutazione pubblico su GitHub