chen459664 commited on
Commit
2656435
·
verified ·
1 Parent(s): 0b92299

Add files using upload-large-folder tool

Browse files
This view is limited to 50 files because it contains too many changes.   See raw diff
Files changed (50) hide show
  1. lm-evaluation-harness/lm_eval/tasks/eus_exams/eus_exams_eu_opeosakiceladoreu.yaml +4 -0
  2. lm-evaluation-harness/lm_eval/tasks/eus_exams/eus_exams_eu_opeosakioperarioeu.yaml +4 -0
  3. lm-evaluation-harness/lm_eval/tasks/eus_exams/eus_exams_eu_osakidetza1e.yaml +4 -0
  4. lm-evaluation-harness/lm_eval/tasks/eus_exams/eus_exams_eu_osakidetza2e.yaml +4 -0
  5. lm-evaluation-harness/lm_eval/tasks/eus_exams/eus_exams_eu_osakidetza3e.yaml +4 -0
  6. lm-evaluation-harness/lm_eval/tasks/eus_exams/eus_exams_eu_osakidetza7e.yaml +4 -0
  7. lm-evaluation-harness/lm_eval/tasks/eus_exams/utils.py +15 -0
  8. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner-fic_group.yaml +9 -0
  9. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner-fic_group_p1.yaml +17 -0
  10. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner-wn_group.yaml +9 -0
  11. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner-wn_group_p2.yaml +13 -0
  12. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_adg.yaml +7 -0
  13. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_adg_p1.yaml +14 -0
  14. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_adg_p2.yaml +14 -0
  15. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_fic.yaml +5 -0
  16. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_fic_p1.yaml +15 -0
  17. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_fic_p2.yaml +13 -0
  18. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_group.yaml +11 -0
  19. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_wn.yaml +7 -0
  20. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_wn_p1.yaml +13 -0
  21. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_wn_p2.yaml +13 -0
  22. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_re_p1.yaml +10 -0
  23. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_re_p2.yaml +10 -0
  24. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_re_task.yaml +10 -0
  25. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_p1.yaml +10 -0
  26. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_p2.yaml +10 -0
  27. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_p3.yaml +11 -0
  28. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_p4.yaml +11 -0
  29. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_p5.yaml +11 -0
  30. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_p6.yaml +11 -0
  31. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_tasks.yaml +9 -0
  32. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sum_fp-small_p1.yaml +12 -0
  33. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sum_fp-small_p2.yaml +12 -0
  34. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sum_fp-small_task.yaml +9 -0
  35. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sum_fp_p1.yaml +10 -0
  36. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sum_fp_p2.yaml +10 -0
  37. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sum_fp_task.yaml +9 -0
  38. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_p1.yaml +9 -0
  39. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_p2.yaml +5 -0
  40. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_p3.yaml +6 -0
  41. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_p4.yaml +6 -0
  42. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_p5.yaml +6 -0
  43. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_p6.yaml +6 -0
  44. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_tasks.yaml +9 -0
  45. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_wic_p1.yaml +5 -0
  46. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_wic_p2.yaml +5 -0
  47. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_wic_p3.yaml +6 -0
  48. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_wic_p4.yaml +6 -0
  49. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_wic_p5.yaml +6 -0
  50. lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_wic_p6.yaml +6 -0
lm-evaluation-harness/lm_eval/tasks/eus_exams/eus_exams_eu_opeosakiceladoreu.yaml ADDED
@@ -0,0 +1,4 @@
 
 
 
 
 
1
+ # Generated by utils.py
2
+ dataset_name: eu_opeosakiceladoreu
3
+ include: eus_exams_eu
4
+ task: eus_exams_eu_opeosakiceladoreu
lm-evaluation-harness/lm_eval/tasks/eus_exams/eus_exams_eu_opeosakioperarioeu.yaml ADDED
@@ -0,0 +1,4 @@
 
 
 
 
 
1
+ # Generated by utils.py
2
+ dataset_name: eu_opeosakioperarioeu
3
+ include: eus_exams_eu
4
+ task: eus_exams_eu_opeosakioperarioeu
lm-evaluation-harness/lm_eval/tasks/eus_exams/eus_exams_eu_osakidetza1e.yaml ADDED
@@ -0,0 +1,4 @@
 
 
 
 
 
1
+ # Generated by utils.py
2
+ dataset_name: eu_osakidetza1e
3
+ include: eus_exams_eu
4
+ task: eus_exams_eu_osakidetza1e
lm-evaluation-harness/lm_eval/tasks/eus_exams/eus_exams_eu_osakidetza2e.yaml ADDED
@@ -0,0 +1,4 @@
 
 
 
 
 
1
+ # Generated by utils.py
2
+ dataset_name: eu_osakidetza2e
3
+ include: eus_exams_eu
4
+ task: eus_exams_eu_osakidetza2e
lm-evaluation-harness/lm_eval/tasks/eus_exams/eus_exams_eu_osakidetza3e.yaml ADDED
@@ -0,0 +1,4 @@
 
 
 
 
 
1
+ # Generated by utils.py
2
+ dataset_name: eu_osakidetza3e
3
+ include: eus_exams_eu
4
+ task: eus_exams_eu_osakidetza3e
lm-evaluation-harness/lm_eval/tasks/eus_exams/eus_exams_eu_osakidetza7e.yaml ADDED
@@ -0,0 +1,4 @@
 
 
 
 
 
1
+ # Generated by utils.py
2
+ dataset_name: eu_osakidetza7e
3
+ include: eus_exams_eu
4
+ task: eus_exams_eu_osakidetza7e
lm-evaluation-harness/lm_eval/tasks/eus_exams/utils.py ADDED
@@ -0,0 +1,15 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ import datasets
2
+
3
+
4
+ def process_docs(dataset: datasets.Dataset):
5
+ """Filter out examples with no answer."""
6
+
7
+ def valid_example(example: dict) -> bool:
8
+ """Check if an example is valid."""
9
+ if example["answer"] not in [0, 1, 2, 3]:
10
+ return False
11
+ if example["candidates"] == ["", "", "", ""]:
12
+ return False
13
+ return True
14
+
15
+ return dataset.filter(valid_example)
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner-fic_group.yaml ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ group: evalita-mp_ner_fic_group
2
+ group_alias: 'evalita NER: FIC'
3
+ task:
4
+ - evalita-mp_ner-v2_tasks_fic
5
+ aggregate_metric_list:
6
+ - metric: f1
7
+ weight_by_size: True
8
+ metadata:
9
+ version: 1
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner-fic_group_p1.yaml ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ include: _ner_template_yaml
2
+ dataset_name: fic
3
+ test_split: reduced_test
4
+ test_split: dev
5
+ fewshot_split: dev
6
+ task_alias: prompt-1
7
+ tag: evalita-mp_ner-v2_tasks_fic
8
+ task: evalita-mp_ner-v2_fic_p1
9
+
10
+ #
11
+ doc_to_target: !function utils.filter_per_entities_from_lines
12
+ doc_to_target: entities
13
+
14
+ # English
15
+ #doc_to_text: "Given the following text, write the entity mentions in the text, indicating their type: [PER] (person), [LOC] (location), [ORG] (organization). Respond with the following format: Entity$Type. Separate each entity-type pair with the '%' character. Text: {{text}}"
16
+ # Italian
17
+ doc_to_text: "Dato il seguente testo, scrivi le menzioni di entità nel testo, indicandone il tipo: PER (persona), LOC (luogo), ORG (organizzazione). Rispondi con il seguente formato: Entità$Tipo%Entità$Tipo. Separa ogni coppia entità-tipo con il carattere '%' ad esempio: Entità_2$Tipo%Entità_2$Tipo. In caso non ci siano entita' rispondi '&&NOENT&&'. Testo: {{text}}"
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner-wn_group.yaml ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ group: evalita-mp_ner_wn_group
2
+ group_alias: 'evalita NER: WN'
3
+ task:
4
+ - evalita-mp_ner-v2_tasks_wn
5
+ aggregate_metric_list:
6
+ - metric: f1
7
+ weight_by_size: True
8
+ metadata:
9
+ version: 1
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner-wn_group_p2.yaml ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ include: _ner_template_yaml
2
+ dataset_name: wn
3
+ test_split: reduced_test
4
+ fewshot_split: dev
5
+ task_alias: prompt-2
6
+ tag: evalita-mp_ner-v2_tasks_wn
7
+ task: evalita-mp_ner-v2_wn_p2
8
+
9
+ # English
10
+ #doc_to_text: "Given the following text, write the entity mentions in the text, indicating their type: [PER] (person), [LOC] (location), [ORG] (organization). Respond with the following format: Entity$Type. Separate each entity-type pair with the '%' character. Text: {{text}}"
11
+ # Italian
12
+ doc_to_text: "Dato il seguente testo, scrivi le menzioni di entità nel testo, indicandone il tipo: PER (persona), LOC (luogo), ORG (organizzazione). Rispondi con il seguente formato: Entità$Tipo%Entità$Tipo. Separa ogni coppia entità-tipo con il carattere '%' ad esempio: Entità_2$Tipo%Entità_2$Tipo. In caso non ci siano entita' rispondi '&&NOENT&&'.
13
+ Testo: {{text}}"
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_adg.yaml ADDED
@@ -0,0 +1,7 @@
 
 
 
 
 
 
 
 
1
+ group: evalita-mp_ner_tasks_adg
2
+ group_alias: evalita NER adg
3
+ aggregate_metric_list:
4
+ - metric: f1
5
+ weight_by_size: True
6
+ metadata:
7
+ version: 1
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_adg_p1.yaml ADDED
@@ -0,0 +1,14 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ include: _ner_template_yaml
2
+ dataset_name: adg
3
+ test_split: reduced_test
4
+ fewshot_split: trial
5
+
6
+ task_alias: ADG prompt-1
7
+ tag: evalita-mp_ner_tasks_adg
8
+ task: evalita-mp_ner_adg_p1
9
+
10
+
11
+ #p1
12
+ doc_to_text: "Estrai tutte le entità di tipo PER (persona), LOC (luogo) e ORG (organizzazione) dal testo seguente. Riporta ogni entità con il formato: Entità$Tipo, separando ciascuna coppia con ','. Se non ci sono entità da estrarre, rispondi con '&&NOENT&&'.
13
+ Testo: '{{text}}'
14
+ Entità:"
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_adg_p2.yaml ADDED
@@ -0,0 +1,14 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ include: _ner_template_yaml
2
+ dataset_name: adg
3
+ test_split: reduced_test
4
+ fewshot_split: trial
5
+
6
+ task_alias: ADG prompt-2
7
+ tag: evalita-mp_ner_tasks_adg
8
+ task: evalita-mp_ner_adg_p2
9
+
10
+
11
+ #p8
12
+ doc_to_text: "Devi svolgere un compito di riconoscimento delle entità nei testi. Estrai tutte le entità di tipo PER (persona), LOC (luogo) e ORG (organizzazione) dal testo seguente. Riporta ogni entità con il formato: Entità$Tipo, separando ciascuna coppia con ','. Se non ci sono entità da estrarre, rispondi con '&&NOENT&&'.
13
+ Testo: '{{text}}'
14
+ Entità:"
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_fic.yaml ADDED
@@ -0,0 +1,5 @@
 
 
 
 
 
 
1
+
2
+ group: evalita-mp_ner_tasks_fic
3
+ group_alias: evalita NER fic
4
+
5
+ task_alias: NER fic
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_fic_p1.yaml ADDED
@@ -0,0 +1,15 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ include: _ner_template_yaml
2
+ dataset_name: fic
3
+ test_split: reduced_test
4
+ fewshot_split: trial
5
+
6
+ task_alias: FIC prompt-1
7
+ tag: evalita-mp_ner_tasks_fic
8
+ task: evalita-mp_ner_fic_p1
9
+
10
+
11
+
12
+ #p1
13
+ doc_to_text: "Estrai tutte le entità di tipo PER (persona), LOC (luogo) e ORG (organizzazione) dal testo seguente. Riporta ogni entità con il formato: Entità$Tipo, separando ciascuna coppia con ','. Se non ci sono entità da estrarre, rispondi con '&&NOENT&&'.
14
+ Testo: '{{text}}'
15
+ Entità:"
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_fic_p2.yaml ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ include: _ner_template_yaml
2
+ dataset_name: fic
3
+ test_split: reduced_test
4
+ fewshot_split: trial
5
+
6
+ task_alias: FIC prompt-2
7
+ tag: evalita-mp_ner_tasks_fic
8
+ task: evalita-mp_ner_fic_p2
9
+
10
+ #p8
11
+ doc_to_text: "Devi svolgere un compito di riconoscimento delle entità nei testi. Estrai tutte le entità di tipo PER (persona), LOC (luogo) e ORG (organizzazione) dal testo seguente. Riporta ogni entità con il formato: Entità$Tipo, separando ciascuna coppia con ','. Se non ci sono entità da estrarre, rispondi con '&&NOENT&&'.
12
+ Testo: '{{text}}'
13
+ Entità:"
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_group.yaml ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ group: evalita-mp_ner_group
2
+ group_alias: evalita NER
3
+ task:
4
+ - evalita-mp_ner_tasks_fic
5
+ - evalita-mp_ner_tasks_adg
6
+ - evalita-mp_ner_tasks_wn
7
+ aggregate_metric_list:
8
+ - metric: f1
9
+ weight_by_size: True
10
+ metadata:
11
+ version: 1
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_wn.yaml ADDED
@@ -0,0 +1,7 @@
 
 
 
 
 
 
 
 
1
+ group: evalita-mp_ner_tasks_wn
2
+ group_alias: evalita NER wn
3
+ aggregate_metric_list:
4
+ - metric: f1
5
+ weight_by_size: True
6
+ metadata:
7
+ version: 1
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_wn_p1.yaml ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ include: _ner_template_yaml
2
+ dataset_name: wn
3
+ test_split: reduced_test
4
+ fewshot_split: trial
5
+
6
+ task_alias: WN prompt-1
7
+ tag: evalita-mp_ner_tasks_wn
8
+ task: evalita-mp_ner_wn_p1
9
+
10
+
11
+ doc_to_text: "Estrai tutte le entità di tipo PER (persona), LOC (luogo) e ORG (organizzazione) dal testo seguente. Riporta ogni entità con il formato: Entità$Tipo, separando ciascuna coppia con ','. Se non ci sono entità da estrarre, rispondi con '&&NOENT&&'.
12
+ Testo: '{{text}}'
13
+ Entità:"
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_wn_p2.yaml ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ include: _ner_template_yaml
2
+ dataset_name: wn
3
+ test_split: reduced_test
4
+ fewshot_split: trial
5
+
6
+ task_alias: WN prompt-2
7
+ tag: evalita-mp_ner_tasks_wn
8
+ task: evalita-mp_ner_wn_p2
9
+
10
+
11
+ doc_to_text: "Devi svolgere un compito di riconoscimento delle entità nei testi. Estrai tutte le entità di tipo PER (persona), LOC (luogo) e ORG (organizzazione) dal testo seguente. Riporta ogni entità con il formato: Entità$Tipo, separando ciascuna coppia con ','. Se non ci sono entità da estrarre, rispondi con '&&NOENT&&'.
12
+ Testo: '{{text}}'
13
+ Entità:"
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_re_p1.yaml ADDED
@@ -0,0 +1,10 @@
 
 
 
 
 
 
 
 
 
 
 
1
+ tag: evalita-mp_re_tasks
2
+ include: _re_template_yaml
3
+ task: evalita-mp_re_prompt-1
4
+ fewshot_split: dev
5
+ task_alias: prompt-1
6
+
7
+ #p4
8
+ doc_to_text: "Dato un documento medico devi estrarre tutte le misurazioni degli esami medici presenti. Riporta ogni relazione nel formato: misurazione$esame, separando ciascuna coppia con '%'. Se non ci sono relazioni da estrarre, rispondi con '&&NOREL&&'.
9
+ Testo: '{{text}}'
10
+ Relazioni:"
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_re_p2.yaml ADDED
@@ -0,0 +1,10 @@
 
 
 
 
 
 
 
 
 
 
 
1
+ tag: evalita-mp_re_tasks
2
+ include: _re_template_yaml
3
+ fewshot_split: dev
4
+ task: evalita-mp_re_prompt-2
5
+ task_alias: prompt-2
6
+
7
+ #p5
8
+ doc_to_text: "Devi svolgere un compito di estrazione di relazioni da documenti medici. Dato un documento medico devi estrarre tutte le misurazioni degli esami medici presenti. Riporta ogni relazione nel formato: misurazione$esame, separando ciascuna coppia con '%'. Se non ci sono relazioni da estrarre, rispondi con '&&NOREL&&'.
9
+ Testo: '{{text}}'
10
+ Relazioni:"
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_re_task.yaml ADDED
@@ -0,0 +1,10 @@
 
 
 
 
 
 
 
 
 
 
 
1
+ group: evalita-mp_re
2
+ group_alias: relation-extraction
3
+ task:
4
+ - evalita-mp_re_tasks
5
+ aggregate_metric_list:
6
+ - metric: f1
7
+ weight_by_size: True
8
+
9
+ metadata:
10
+ version: 1
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_p1.yaml ADDED
@@ -0,0 +1,10 @@
 
 
 
 
 
 
 
 
 
 
 
1
+ tag: evalita-mp_sa_tasks
2
+ include: _sa_template_yaml
3
+ task: evalita-mp_sa_prompt-1
4
+ task_alias: prompt-1
5
+ #doc_to_text: "Opinione: '{{text}}' Determinare la sentiment dell'opinione data. Possibili risposte: A – neutrale B – negativo C – positivo D - misto Risposta:"
6
+ doc_to_text: "Qual è il sentiment espresso nel seguente tweet: '{{text}}'?"
7
+ metric_list:
8
+ - metric: f1
9
+ higher_is_better: True
10
+ aggregation: !function metrics._aggreg_sa
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_p2.yaml ADDED
@@ -0,0 +1,10 @@
 
 
 
 
 
 
 
 
 
 
 
1
+ tag: evalita-mp_sa_tasks
2
+ include: _sa_template_yaml
3
+ task: evalita-mp_sa_prompt-2
4
+ task_alias: prompt-2
5
+ #doc_to_text: "Opinione: '{{text}}' Determinare la sentiment dell'opinione data. Possibili risposte: A – neutrale B – negativo C – positivo D - misto Risposta:"
6
+ doc_to_text: "Devi svolgere un compito di analisi del sentiment. Qual è il sentiment espresso nel seguente tweet: '{{text}}'?"
7
+ metric_list:
8
+ - metric: f1
9
+ higher_is_better: True
10
+ aggregation: !function metrics._aggreg_sa
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_p3.yaml ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ tag: evalita-mp_sa_tasks
2
+ include: _sa_template_yaml
3
+ task: evalita-mp_sa_prompt-3
4
+ task_alias: prompt-3
5
+ #doc_to_text: "Opinione: '{{text}}' Determinare la sentiment dell'opinione data. Possibili risposte: A – neutrale B – negativo C – positivo D - misto Risposta:"
6
+ doc_to_choice: ["A", "B", "C", "D"]
7
+ doc_to_text: "Qual è il sentiment espresso nel seguente tweet: '{{text}}'?\nA: Positivo\nB: Negativo\nC: Neutro\nD: Misto\nRisposta:"
8
+ metric_list:
9
+ - metric: f1
10
+ higher_is_better: True
11
+ aggregation: !function metrics._aggreg_sa
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_p4.yaml ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ tag: evalita-mp_sa_tasks
2
+ include: _sa_template_yaml
3
+ task: evalita-mp_sa_prompt-4
4
+ task_alias: prompt-4
5
+ #doc_to_text: "Opinione: '{{text}}' Determinare la sentiment dell'opinione data. Possibili risposte: A – neutrale B – negativo C – positivo D - misto Risposta:"
6
+ doc_to_choice: ["A", "B", "C", "D"]
7
+ doc_to_text: "Devi svolgere un compito di analisi del sentiment. Qual è il sentiment espresso nel seguente tweet: '{{text}}'?\nA: Positivo\nB: Negativo\nC: Neutro\nD: Misto\nRisposta:"
8
+ metric_list:
9
+ - metric: f1
10
+ higher_is_better: True
11
+ aggregation: !function metrics._aggreg_sa
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_p5.yaml ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ tag: evalita-mp_sa_tasks
2
+ include: _sa_template_yaml
3
+ task: evalita-mp_sa_prompt-5
4
+ task_alias: prompt-5
5
+ #doc_to_text: "Opinione: '{{text}}' Determinare la sentiment dell'opinione data. Possibili risposte: A – neutrale B – negativo C – positivo D - misto Risposta:"
6
+ #doc_to_choice: ["A", "B", "C", "D"]
7
+ doc_to_text: "Il seguente tweet: '{{text}}' esprime un sentiment"
8
+ metric_list:
9
+ - metric: f1
10
+ higher_is_better: True
11
+ aggregation: !function metrics._aggreg_sa
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_p6.yaml ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ tag: evalita-mp_sa_tasks
2
+ include: _sa_template_yaml
3
+ task: evalita-mp_sa_prompt-6
4
+ task_alias: prompt-6
5
+ #doc_to_text: "Opinione: '{{text}}' Determinare la sentiment dell'opinione data. Possibili risposte: A – neutrale B – negativo C – positivo D - misto Risposta:"
6
+ #doc_to_choice: ["A", "B", "C", "D"]
7
+ doc_to_text: "Devi svolgere un compito di analisi del sentiment. Il seguente tweet: '{{text}}' esprime un sentiment"
8
+ metric_list:
9
+ - metric: f1
10
+ higher_is_better: True
11
+ aggregation: !function metrics._aggreg_sa
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_tasks.yaml ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ group: evalita-mp_sa
2
+ group_alias: sentiment-analysis
3
+ task:
4
+ - evalita-mp_sa_tasks # Each of the tasks has to have a matching tag in its own yaml file
5
+ aggregate_metric_list:
6
+ - metric: f1
7
+ weight_by_size: True
8
+ metadata:
9
+ version: 1
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sum_fp-small_p1.yaml ADDED
@@ -0,0 +1,12 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ tag: evalita-mp_sum_fp-small_tasks
2
+ include: _sum_template_fp-small_yaml
3
+ task: evalita-sp_sum_task_fp-small_p1
4
+ task_alias: prompt-1
5
+ #doc_to_text: >
6
+ # "Crea un sommario del seguente testo. Testo: {{source}}\nSommario: "
7
+ doc_to_text: "Riassumi il seguente articolo di giornale: '{{source}}'\nRiassunto:"
8
+ process_results: !function sum_utils.process_results_sum
9
+ metric_list:
10
+ - metric: rouge1
11
+ higher_is_better: true
12
+ aggregation: mean
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sum_fp-small_p2.yaml ADDED
@@ -0,0 +1,12 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ tag: evalita-mp_sum_fp-small_tasks
2
+ include: _sum_template_fp-small_yaml
3
+ task: evalita-sp_sum_task_fp-small_p2
4
+ task_alias: prompt-2
5
+ #doc_to_text: >
6
+ # "Crea un sommario del seguente testo. Testo: {{source}}\nSommario: "
7
+ doc_to_text: "Devi risolvere un compito di sintesi automatica del testo. Riassumi il seguente articolo di giornale: '{{source}}'\nRiassunto:"
8
+ process_results: !function sum_utils.process_results_sum
9
+ metric_list:
10
+ - metric: rouge1
11
+ higher_is_better: true
12
+ aggregation: mean
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sum_fp-small_task.yaml ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ group: evalita-mp_sum_fp
2
+ group_alias: summarization-fanpage
3
+ task:
4
+ - evalita-mp_sum_fp-small_tasks
5
+ aggregate_metric_list:
6
+ - metric: rouge1
7
+ weight_by_size: True
8
+ metadata:
9
+ version: 0.0
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sum_fp_p1.yaml ADDED
@@ -0,0 +1,10 @@
 
 
 
 
 
 
 
 
 
 
 
1
+ tag: evalita-mp_sum_fp_tasks
2
+ include: _sum_template_fp_yaml
3
+ task: evalita-sp_sum_task_fp_p1
4
+ task_alias: prompt-1
5
+ doc_to_text: "Riassumi il seguente articolo di giornale: '{{source}}'\nRiassunto:"
6
+ process_results: !function sum_utils.process_results_sum
7
+ metric_list:
8
+ - metric: rouge1
9
+ higher_is_better: true
10
+ aggregation: mean
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sum_fp_p2.yaml ADDED
@@ -0,0 +1,10 @@
 
 
 
 
 
 
 
 
 
 
 
1
+ tag: evalita-mp_sum_fp_tasks
2
+ include: _sum_template_fp_yaml
3
+ task: evalita-sp_sum_task_fp_p2
4
+ task_alias: prompt-2
5
+ doc_to_text: "Devi risolvere un compito di sintesi automatica del testo. Riassumi il seguente articolo di giornale: '{{source}}'\nRiassunto:"
6
+ process_results: !function sum_utils.process_results_sum
7
+ metric_list:
8
+ - metric: rouge1
9
+ higher_is_better: true
10
+ aggregation: mean
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sum_fp_task.yaml ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ group: evalita-mp_sum_fp
2
+ group_alias: summarization-fanpage
3
+ task:
4
+ - evalita-mp_sum_fp_tasks
5
+ aggregate_metric_list:
6
+ - metric: rouge1
7
+ weight_by_size: True
8
+ metadata:
9
+ version: 1
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_p1.yaml ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ tag: evalita-mp_te_tasks
2
+ include: _te_template_yaml
3
+ task: evalita-mp_te_prompt-1
4
+ task_alias: prompt-1
5
+ #doc_to_text: "Task di Text Entailment. Rispondi Vero o Falso in base alla correttezza dell'ipotesi rispetto al testo.\nTesto:{{text1}}\nIpotesi: {{text2}}\nRisposta:"
6
+ doc_to_text: "La frase: '{{text1}}' implica logicamente che la frase: '{{text2}}' sia vera?"
7
+ #metric_list:
8
+ # - metric: acc
9
+ # higher_is_better: true
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_p2.yaml ADDED
@@ -0,0 +1,5 @@
 
 
 
 
 
 
1
+ tag: evalita-mp_te_tasks
2
+ include: _te_template_yaml
3
+ task: evalita-mp_te_prompt-2
4
+ task_alias: prompt-2
5
+ doc_to_text: "Devi risolvere un compito di inferenza semantica. La frase: '{{text1}}' implica logicamente che la frase: '{{text2}}' sia vera?"
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_p3.yaml ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ tag: evalita-mp_te_tasks
2
+ include: _te_template_yaml
3
+ task: evalita-mp_te_prompt-3
4
+ task_alias: prompt-3
5
+ doc_to_choice: ["A", "B"]
6
+ doc_to_text: "La frase: '{{text1}}' implica logicamente che la frase: '{{text2}}' sia vera?\nA: Sì\nB: No\nRisposta:"
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_p4.yaml ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ tag: evalita-mp_te_tasks
2
+ include: _te_template_yaml
3
+ task: evalita-mp_te_prompt-4
4
+ task_alias: prompt-4
5
+ doc_to_choice: ["A", "B"]
6
+ doc_to_text: "Devi risolvere un compito di inferenza semantica. La frase: '{{text1}}' implica logicamente che la frase: '{{text2}}' sia vera?\nA: Sì\nB: No\nRisposta:"
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_p5.yaml ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ tag: evalita-mp_te_tasks
2
+ include: _te_template_yaml
3
+ task: evalita-mp_te_prompt-5
4
+ task_alias: prompt-5
5
+ doc_to_choice: ["La frase 1 implica logicamente che la frase 2 sia vera", "La frase 1 non implica logicamente che la frase 2 sia vera"]
6
+ doc_to_text: "Frase 1: '{{text1}}' Frase 2: '{{text2}}'"
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_p6.yaml ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ tag: evalita-mp_te_tasks
2
+ include: _te_template_yaml
3
+ task: evalita-mp_te_prompt-6
4
+ task_alias: prompt-6
5
+ doc_to_choice: ["La frase 1 implica logicamente che la frase 2 sia vera", "La frase 1 non implica logicamente che la frase 2 sia vera"]
6
+ doc_to_text: "Devi risolvere un compito di inferenza semantica. Frase 1: '{{text1}}' Frase 2: '{{text2}}'"
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_tasks.yaml ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ group: evalita-mp_te
2
+ group_alias: text-entailment
3
+ task:
4
+ - evalita-mp_te_tasks # this has to match the tag in the task yaml file
5
+ aggregate_metric_list:
6
+ - metric: acc
7
+ weight_by_size: True
8
+ metadata:
9
+ version: 1
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_wic_p1.yaml ADDED
@@ -0,0 +1,5 @@
 
 
 
 
 
 
1
+ tag: evalita-mp_wic_tasks
2
+ task: evalita-mp_wic_prompt-1
3
+ task_alias: prompt-1
4
+ include: _wic_template_yaml
5
+ doc_to_text: "La parola: '{{sentence1[start1:end1]}}' nella frase: '{{sentence1}}' ha lo stesso significato della parola: '{{sentence2[start2:end2]}}' nella frase: '{{sentence2}}'?"
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_wic_p2.yaml ADDED
@@ -0,0 +1,5 @@
 
 
 
 
 
 
1
+ tag: evalita-mp_wic_tasks
2
+ task: evalita-mp_wic_prompt-2
3
+ task_alias: prompt-2
4
+ include: _wic_template_yaml
5
+ doc_to_text: "Devi determinare se una stessa parola usata in due frasi differenti ha lo stesso significato in entrambi i contesti. La parola: '{{sentence1[start1:end1]}}' nella frase: '{{sentence1}}' ha lo stesso significato della parola: '{{sentence2[start2:end2]}}' nella frase: '{{sentence2}}'?"
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_wic_p3.yaml ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ tag: evalita-mp_wic_tasks
2
+ task: evalita-mp_wic_prompt-3
3
+ task_alias: prompt-3
4
+ include: _wic_template_yaml
5
+ doc_to_text: "La parola '{{sentence1[start1:end1]}}' nella frase '{{sentence1}}' ha lo stesso significato della parola '{{sentence2[start2:end2]}}' nella frase '{{sentence2}}'?\nA: Sì\nB: No\nRisposta:"
6
+ doc_to_choice: ["B", "A"]
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_wic_p4.yaml ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ tag: evalita-mp_wic_tasks
2
+ task: evalita-mp_wic_prompt-4
3
+ task_alias: prompt-4
4
+ include: _wic_template_yaml
5
+ doc_to_text: "Devi determinare se una stessa parola usata in due frasi differenti ha lo stesso significato in entrambi i contesti. La parola '{{sentence1[start1:end1]}}' nella frase '{{sentence1}}' ha lo stesso significato della parola '{{sentence2[start2:end2]}}' nella frase '{{sentence2}}'?\nA: Sì\nB: No\nRisposta:"
6
+ doc_to_choice: ["B", "A"]
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_wic_p5.yaml ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ tag: evalita-mp_wic_tasks
2
+ task: evalita-mp_wic_prompt-5
3
+ task_alias: prompt-5
4
+ include: _wic_template_yaml
5
+ doc_to_text: "La parola: '{{sentence1[start1:end1]}}' nella frase: '{{sentence1}}' e la parola: '{{sentence2[start2:end2]}}' nella frase: '{{sentence2}}'"
6
+ doc_to_choice: ["non hanno lo stesso significato", "hanno lo stesso significato"]
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_wic_p6.yaml ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ tag: evalita-mp_wic_tasks
2
+ task: evalita-mp_wic_prompt-6
3
+ task_alias: prompt-6
4
+ include: _wic_template_yaml
5
+ doc_to_text: "Devi determinare se una stessa parola usata in due frasi differenti ha lo stesso significato in entrambi i contesti. La parola: '{{sentence1[start1:end1]}}' nella frase: '{{sentence1}}' e la parola: '{{sentence2[start2:end2]}}' nella frase: '{{sentence2}}'"
6
+ doc_to_choice: ["non hanno lo stesso significato", "hanno lo stesso significato"]