Skip to main content

L’intelligenza dei modelli di frontiera. Il rigore di un database normativo. Nessun altro ha entrambi.

Ragionamento → Grounding (fonti verificabili) → la zona in cui la delega diventa possibile Modelli generalisti ragionano, ma non citano Legal-tech tradizionali fonti, ma intelligenza datata Next-OS ragiona e cita
Ragionamento × grounding: solo Next-OS occupa il quadrante dove diventa razionale delegare.

107

casi reali di diritto italiano

17.000

decisioni della Corte di Cassazione

11

sistemi messi alla prova

3

dimensioni indipendenti
  • Il test
    67 quesiti giuridici aperti in diritto civile, del lavoro e tributario, valutati criterio per criterio da un panel di tre giudici indipendenti. Un quesito è superato solo se ogni criterio richiesto è soddisfatto: nessun credito parziale.
  • Cosa abilita
    È la differenza tra un’AI che scrive e un’AI a cui puoi affidare l’analisi: identificare i principi rilevanti e applicarli al caso concreto è il lavoro, non il suo contorno.
  • Il risultato
    Next-OS supera integralmente l’85,1% dei quesiti, primo tra gli 11 sistemi. E c’è un dato che cambia il mercato: il miglior modello generalista, Claude Opus 4.8 (79.1%), supera tutte le piattaforme legal-tech in gara. Avere le fonti giuste non basta più, se l’intelligenza che le usa è di generazione precedente.
Ragionamento — quesiti superati integralmente
All-pass su 67 task · più alto è meglio
La linea segna dove il miglior generalista supera l'intera fascia legal-tech.
  • Il test
    Non basta citare una sentenza vera. La citazione deve essere risolta correttamente (corte, sezione, numero, anno) e deve sostenere davvero la questione in esame, nell’orientamento giusto: consolidato, successivo a un revirement, o uno degli orientamenti rilevanti se il contrasto è ancora aperto.
  • Cosa abilita
    La responsabilità professionale non si delega: la firma resta tua. Se per controllare una risposta devi rifare la ricerca da zero, non hai guadagnato tempo: lo hai spostato.
  • Il risultato
    Qui il divario è drammatico. Next-OS fornisce almeno una sentenza che copre effettivamente la questione nell’80,6% dei casi. I migliori modelli generalisti si fermano al 3%. GPT-5.5 a zero. Con un generalista la verifica delle fonti resta tutta sulle tue spalle. Con Next-OS diventa un controllo.
Grounding — almeno una citazione che regge
Coverage sui 67 task giurisprudenziali · più alto è meglio
I migliori modelli generalisti restano a ≤ 3%: sanno ragionare, non sanno dimostrare.
  • Il test
    40 quesiti-trappola. Ognuno chiede di analizzare un documento specifico (un contratto, un avviso di accertamento, una sentenza) che però non è allegato. Solo un comportamento supera il test: fermarsi, segnalare che il documento manca e chiederlo.
  • Cosa abilita
    Il lavoro vero non è un ambiente da demo: i documenti mancano, arrivano tardi, arrivano incompleti. È la condizione per lasciar lavorare l’AI senza sorvegliarla a ogni passo.
  • Il risultato
    Next-OS si ferma e chiede i documenti nell’85% dei casi. Il miglior generalista, Claude Sonnet 5, poco più di una volta su due (52,5%). GPT-5.5 e Gemini 3.5 Flash una volta su otto. L’errore più frequente non è la distrazione: molti sistemi riconoscono che il documento manca, e formulano comunque una strategia come se lo avessero letto.
Fermarsi — riconosce il documento mancante e lo chiede
Global MDD su 40 quesiti-trappola · più alto è meglio
Non si accorge

inventa un'analisi sul documento assente

Risponde lo stesso

lo nota, ma costruisce una strategia comunque

Si ferma e chiede

il solo comportamento che supera il test

107
quesiti reali
137
criteri di valutazione
3
giudici indipendenti
κ 0,836
accordo tra giudici