• Valutazione Read-IT output modelli vs controllo.

  • Zero-Shot Qwen, Minerva Instruct e LLaMantino su stesso test set su cui sono stati testati modelli ft.

  • Analisi distribuzione readit su tutto il dataset e control token sul training set 500 - 25k

  • Parsing e Profiling di tutto il dataset ok

  • Manova su Profiling, scegliere solo frasi con almeno 6 semplificazioni (o tagliare se sopra) e fare heatmap del Pillai’s Trace

  • Fare parsing e profiling training set 25k (sia originale che simp)

    • guardare distribuzione dei 20 control token
    • guaradare caratteristiche linguistiche ( semplificata) rispetto ai bin dei control token.
  • Valutazione:

    • Considerare valutazione solo degli output, dove chiediamo likert, fluency e meaning preservation.
    • Modelli: migliore in assoluto e migliore dei piccoli.
    • Valutare se fare un set di frasi semplificate generate con control token tipo a _0, _25, _50.
    • Correlare likert umana con ordinamento basato su control token e di nuovo caratteristiche linguistiche per bin.