-
Valutazione Read-IT output modelli vs controllo. -
Zero-Shot Qwen, Minerva Instruct e LLaMantino su stesso test set su cui sono stati testati modelli ft. -
Analisi distribuzione readit su tutto il dataset e control token sul training set 500 - 25k -
Parsinge Profiling di tutto il dataset ok -
Manova su Profiling, scegliere solo frasi con almeno 6 semplificazioni (o tagliare se sopra) e fare heatmap del Pillai’s Trace -
Fare parsing e profiling training set 25k (sia originale che simp)guardare distribuzione dei 20 control token- guaradare caratteristiche linguistiche ( semplificata) rispetto ai bin dei control token.
-
Valutazione:
- Considerare valutazione solo degli output, dove chiediamo likert, fluency e meaning preservation.
- Modelli: migliore in assoluto e migliore dei piccoli.
- Valutare se fare un set di frasi semplificate generate con control token tipo a _0, _25, _50.
- Correlare likert umana con ordinamento basato su control token e di nuovo caratteristiche linguistiche per bin.