quanTO – officina quantitativa del diritto tributario

Lexicon – Guida alla lettura

Le singole voci sono indicate all’inizio di ogni pagina unitamente al loro numero progressivo. Tutte le voci sono elencate in ordine alfabetico.

Per ogni voce sono stati creati, a partire dal corpus di tutte le pronunce rese dalla Corte costituzionale tra il 1956 e il 2022, quattro differenti subset in ragione delle variegate e plurime esigenze di studio e analisi, che si riflettono nella struttura della voce:

  • df_term_glob è costituito da tutte le pronunce della Corte costituzionale in cui compaiono la voce e i termini associati in tutto il corpo del testo;
  • df_term_silver è costituito dalle sole pronunce tributarie della Corte costituzionale (subset “silver”) in cui compaiono la voce e i termini associati in tutto il corpo del testo;
  • dftm è costituito da tutte le sentenze della Corte costituzionale in cui compaiono la voce e i termini associati nella sola parte “Considerato in diritto”;
  • dftm_silver è costituito dalle sole sentenze tributarie della Corte costituzionale (subset “silver”) in cui compaiono la voce e i termini associati nella sola parte “Considerato in diritto”.
  • Al punto “1. Concordanze” vengono mostrati i risultati dell’analisi relativa alle concordanze. L’analisi delle concordanze permette di comprendere come una parola o una frase viene generalmente utilizzata e in quale contesto di riferimento. 

Le concordanze vengono comunemente visualizzate secondo una particolare tecnica di indicizzazione e visualizzazione di testi, la Key Word In Context (KWIC), in cui viene evidenziata la parola chiave oggetto dell’analisi e accanto vengono riportate un numero predeterminato di parole che precedono e seguono tale parola.

  • Al sottopunto 1.1. viene riportata la tabella relativa alle concordanze estratte dalle sentenze presenti nel subset dftm_silver. Nello specifico, nella tabella in esame:
    • la colonna “FileName” indica la sentenza di riferimento;
    • la colonna “From” indica la riga del testo della sentenza da cui parte la concordanza riportata;
    • la colonna “To” indica la riga del testo della sentenza in cui termina la concordanza riportata;
    • la colonna “Pre” indica le 20 parole che precedono la parola chiave oggetto dell’analisi (voce o dai termini associati);
    • la colonna “Keyword” indica la parola chiave oggetto dell’analisi (voce e termini associati);
    • la colonna “Post” indica le 20 parole che seguono la parola chiave oggetto dell’analisi (voce o dai termini associati).
  • Al sottopunto 1.2. vengono mostrati i dispersion plots delle prime 10 sentenze per numero di occorrenze della voce e dei termini associati in dftm_silver. Un grafico a dispersione dei termini nei documenti permette di visualizzare le occorrenze di particolari termini e la loro posizione in un testo a partire dal KWIC.
  • Al punto “2. N-grams” sono indicati gli n-grams, frasi semanticamente non componibili e strutturalmente non modificabili e non sostituibili. In altre parole, frasi ripetute o sequenze continue di parole presenti all’interno di un corpus. Gli n-grams sono definiti anche “lexical phrases”, “formulas”, “fixed expressions” o “lexical bundles” e permettono di identificare le espressioni regolari maggiormente frequenti e significative in cui voce e termini associati sono presenti.
    • Al sottopunto 2.1. viene riportata la tabella relativa ai trigrams estratti dalle sentenze presenti nel subset dftm_silver in cui compaiono la voce e i termini associati.  Nello specifico, nella tabella in esame:
      • la colonna “trigrams_trovate” indica il trigram di riferimento;
      • la colonna “frequency” indica la frequenza con cui il trigram compare nel subset.
    • Al sottopunto 2.2. viene riportata la tabella relativa ai fivegrams estratti dalle sentenze presenti nel subset dftm_silver in cui compaiono la voce e i termini associati. Nello specifico, nella tabella in esame:
      • la colonna “five_grams_trovate” indica il fivegram di riferimento;
      • la colonna “frequency” indica la frequenza con cui il fivegram compare nel subset.
  • Al punto “3. Word embedding” ​​sono presentati i termini semanticamente più simili alla voce. I termini simili riportati sono il risultato di uno specifico algoritmo basato su una rete neurale a due strati (l’input e l’output), progettato per trasformare le parole in vettori numerici, il Word2Vec. L’input è costituito dalle parole del testo, mentre l’output è rappresentato dai vettori numerici associati alle caratteristiche di ciascuna parola. L’insieme di tali vettori, detti anche “embeddings”, rappresentano la distribuzione semantica tra le parole contenute nel testo di riferimento. In questo modo, è possibile raggruppare i vettori di parole simili nello spazio vettoriale e calcolarne il valore di similarità rispetto ad una parola specifica.
    • Al sottopunto 3.1. viene riportato il grafico a barre dei 20 termini semanticamente più simili alla voce presenti all’interno del dftm_silver, ordinati per valore di similarità in ordine decrescente:
      • sull’asse delle ascisse sono indicate le parole;
      • sull’asse delle ordinate è indicato il punteggio di similarità.
  • Al punto “4. Statistiche descrittive dei subsets” sono indicati alcuni risultati statistici svolti sui quattro subset di lavorazione.
    • Al sottopunto 4.1. viene riportata la tabella relativa ai primi 5 anni, in ordine decrescente, per numero di pronunce in cui compaiono la voce e i termini associati in relazione al df_term_glob. Nello specifico, nella tabella in esame:
      • la colonna “anno” indica l’anno di riferimento;
      • la colonna “numero_pronunce” indica il numero di pronunce dell’anno di riferimento in cui compaiono la voce e i termini associati in relazione al df_term_glob.
    • Al sottopunto 4.2. viene riportata la tabella relativa ai primi 5 anni, in ordine decrescente, per numero di pronunce in cui compaiono la voce e i termini associati in relazione al dftm. Nello specifico, nella tabella in esame:
      • la colonna “anno” indica l’anno di riferimento;
      • la colonna “numero_pronunce” indica il numero di pronunce dell’anno di riferimento in cui compaiono la voce e i termini associati in relazione al dftm.
    • Al sottopunto 4.3. viene riportata la tabella relativa ai primi 5 giudici della Corte costituzionale, in ordine decrescente, per numero di pronunce in cui compaiono la voce e i termini associati e di cui risultano relatori in relazione al df_term_glob. Nello specifico, nella tabella in esame:
      • la colonna “relatore” indica il giudice relatore;
      • la colonna “numero_pronunce” indica il numero di pronunce di cui è autore il giudice relatore in cui compaiono la voce e i termini associati in relazione al df_term_glob;
      • la colonna “percentuale” indica la percentuale del valore “numero_pronunce” in relazione al numero totale di pronunce che compongono il df_term_glob.
    • Al sottopunto 4.4. viene riportata la tabella relativa ai primi 5 giudici della Corte costituzionale per numero di pronunce in cui compaiono la voce e i termini associati e di cui risultano relatori in relazione al dftm. Nello specifico, nella tabella in esame:
      • la colonna “relatore” indica il giudice relatore;
      • la colonna “numero_pronunce” indica il numero di pronunce di cui è autore il giudice relatore in cui compaiono la voce e i termini associati in relazione al dftm.
      • la colonna “percentuale” indica la percentuale del valore “numero_pronunce” in relazione al numero totale di pronunce che compongono il dftm.

N.B. Essendo stato considerato l’arco temporale 1956-2022, sono inclusi anche i giudici che, ad oggi, sono in corso di mandato. Per l’effetto, i dati presenti nelle tabelle al sottopunto 4.3 e al sottopunto 4.4. devono essere valutati tenendo in debita considerazione che i valori nella colonna “numero_pronunce” sono stati calcolati in termini assoluti, senza normalizzare il dato alla luce della possibile diversa durata di attività dei giudici. 

  • Al sottopunto 4.5. viene riportato il grafico a linee interattivo dell’andamento temporale (1956-2022) del numero di pronunce presenti in df_term_glob. Nello specifico, nel grafico in esame:
    • sull’asse delle ascisse sono indicati gli anni (1956-2022);
    • sull’asse delle ordinate è indicato il numero di pronunce per anno.
  • Al sottopunto 4.6. viene riportato il grafico a linee interattivo dell’andamento temporale (1956-2022) sia del numero di sentenze sia del numero di ordinanze presenti in df_term_glob. A differenza del grafico al sottopunto 4.5., in questo grafico sono presenti due linee distinte in quanto viene mostrato l’andamento temporale disaggregato in relazione al numero di sentenze (linea continua) e al numero di ordinanze (linea tratteggiata). Nello specifico, nel grafico in esame:
    • sull’asse delle ascisse sono indicati gli anni (1956-2022);
    • sull’asse delle ordinate è indicato il numero di pronunce per anno.
  • Al sottopunto 4.7. viene riportato il grafico a linee interattivo dell’andamento temporale (1956-2022) del numero di pronunce presenti in dftm. Nello specifico, nel grafico in esame:
    • sull’asse delle ascisse sono indicati gli anni (1956-2022);
    • sull’asse delle ordinate è indicato il numero di pronunce per anno.

N.B. Il subset è composto solo da sentenze, quindi non è necessaria una rappresentazione grafica ulteriore dell’andamento temporale, come per df_term_glob.

  • Al sottopunto 4.8. viene riportato il grafico a barre interattivo del numero di pronunce che contengono una data tipologia di decisione in dispositivo per giudice relatore della Corte costituzionale in relazione al df_term_silver. Nello specifico, nel grafico in esame:
    • sull’asse delle ascisse sono indicati i giudici relatori della Corte costituzionale, autori di pronunce presenti in df_term_silver;
    • sull’asse delle ordinate è indicato il numero di pronunce che contengono una data tipologia di decisione in dispositivo;
    • ogni barra è divisa per colori in base al numero di pronunce che contengono una data tipologia di decisione in dispositivo.
  • Al sottopunto 4.9. viene riportato il grafico a barre interattivo del numero di pronunce che contengono una data tipologia di decisione in dispositivo per giudice relatore della Corte costituzionale in relazione al df_term_silver. Nello specifico, nel grafico in esame:
    • sull’asse delle ascisse sono indicati i giudici relatori della Corte costituzionale, autori di pronunce presenti in df_term_silver;
    • sull’asse delle ordinate è indicato il numero di pronunce che contengono una data tipologia di decisione in dispositivo;
    • ogni barra è divisa per colori in base al numero di pronunce che contengono una data tipologia di decisione in dispositivo.

N.B. nel dispositivo di una pronuncia della Corte costituzionale è possibile che ci sia più di una tipologia di decisione (p.e. illegittimità costituzionale e inammissibilità). Pertanto, il valore totale di ciascuna barra nei grafici al sottopunto 4.8. e al sottopunto 4.9. non sarà pari al numero totale di pronunce di cui un giudice della Corte costituzionale risulta relatore, ma sarà pari al numero – inevitabilmente maggiore – di pronunce che contengono una data tipologia di decisione in dispositivo di cui un giudice risulta relatore.

  • Al punto “5. Lessicometria” sono indicati alcuni risultati in ordine alla misurazione e all’analisi quantitativa delle caratteristiche lessicali delle pronunce contenute nei quattro subset di lavorazione.
    • Al sottopunto 5.1. viene riportato il grafico a barre interattivo delle 10 parole più frequenti in df_term_silver. Nello specifico, nel grafico in esame:
      • sull’asse delle ascisse sono indicati i 10 termini più frequenti in ordine decrescente;
      • sull’asse delle ordinate è indicata la frequenza per ogni termine.
    • Al sottopunto 5.2. viene riportato il grafico a barre interattivo delle 10 parole più frequenti in dftm_silver. Nello specifico, nel grafico in esame:
      • sull’asse delle ascisse sono indicati i 10 termini più frequenti in ordine decrescente;
      • sull’asse delle ordinate è indicata la frequenza per ogni termine.
    • Al sottopunto 5.3. viene riportata la tabella relativa alla frequenza della voce e dei termini associati in relazione al df_term_silver. Voce e termini associati sono indicati in ordine decrescente in relazione alla loro frequenza. Nello specifico, nella tabella in esame:
      • la colonna “parole_trovate” indica la voce e i termini associati;
      • la colonna “frequenza” indica il numero di volte in cui il termine compare in df_term_silver;
      • la colonna “rank” indica la posizione che il termine assume in relazione alla lista di tutte le parole presenti in df_term_silver in ordine decrescente.
    • Al sottopunto 5.4. viene riportata la tabella relativa alla frequenza della voce e dei termini associati in relazione al dftm_silver. Voce e termini associati sono indicati in ordine decrescente in relazione alla loro frequenza. Nello specifico, nella tabella in esame:
      • la colonna “parole_trovate” indica la voce e i termini associati;
      • la colonna “frequenza” indica il numero di volte in cui il termine compare in dftm_silver;
      • la colonna “rank” indica la posizione che il termine assume in relazione alla lista di tutte le parole presenti in dftm_silver in ordine decrescente.
    • Al sottopunto 5.5. viene riportato il grafico a barre interattivo delle 50 pronunce con il maggior numero di parole uniche (o types) in df_term_silver in ordine decrescente. Nello specifico, nel grafico in esame:
      • sull’asse delle ascisse sono indicate le 50 pronunce in ordine decrescente;
      • sull’asse delle ordinate è indicato il numero di parole (o tokens) o di parole uniche (o types);
      • ogni barra è divisa in rosso e in blu:
        • la porzione in rosso indica il numero di parole uniche (o types) per ogni pronuncia;
        • la porzione in blu indica il numero di parole (o tokens) per ogni pronuncia.
    • Al sottopunto 5.6. viene riportato il grafico a barre interattivo delle 50 pronunce con il maggior numero di parole uniche (o types) in dftm_silver in ordine decrescente. Nello specifico, nel grafico in esame:
      • sull’asse delle ascisse sono indicate le 50 pronunce in ordine decrescente;
      • sull’asse delle ordinate è indicato il numero di parole (o tokens) o di parole uniche (o types);
      • ogni barra è divisa in rosso e in blu:
        • la porzione in rosso indica il numero di parole uniche (o types) per ogni pronuncia;
        • la porzione in blu indica il numero di parole (o tokens) per ogni pronuncia.

N.B. Il numero di tokens permette di misurare la lunghezza di un testo.

Il numero di types, invece, permette di misurare l’ampiezza del vocabolario di un testo, in quanto – nella sua interpretazione più elementare – tokens di un testo graficamente uguali corrispondono ad un singolo type

Le pronunce sono ordinate in base al numero di types e, pertanto, è possibile individuare le pronunce con il numero maggiore di vocaboli presenti nel testo in termini assoluti e comparare il dato con la lunghezza totale del testo della pronuncia.

N.B. è possibile che per alcune voci il numero di pronunce sia inferiore a 50 in quanto il subset di riferimento può essere composto da meno di 50 pronunce. Tale eventualità trova la sua giustificazione nel fatto che la voce e i termini associati compaiono in meno di 50 pronunce della Corte costituzionale.