Add files using upload-large-folder tool
Browse filesThis view is limited to 50 files because it contains too many changes. See raw diff
- lm-evaluation-harness/lm_eval/tasks/eus_exams/eus_exams_eu_opeosakiceladoreu.yaml +4 -0
- lm-evaluation-harness/lm_eval/tasks/eus_exams/eus_exams_eu_opeosakioperarioeu.yaml +4 -0
- lm-evaluation-harness/lm_eval/tasks/eus_exams/eus_exams_eu_osakidetza1e.yaml +4 -0
- lm-evaluation-harness/lm_eval/tasks/eus_exams/eus_exams_eu_osakidetza2e.yaml +4 -0
- lm-evaluation-harness/lm_eval/tasks/eus_exams/eus_exams_eu_osakidetza3e.yaml +4 -0
- lm-evaluation-harness/lm_eval/tasks/eus_exams/eus_exams_eu_osakidetza7e.yaml +4 -0
- lm-evaluation-harness/lm_eval/tasks/eus_exams/utils.py +15 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner-fic_group.yaml +9 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner-fic_group_p1.yaml +17 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner-wn_group.yaml +9 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner-wn_group_p2.yaml +13 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_adg.yaml +7 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_adg_p1.yaml +14 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_adg_p2.yaml +14 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_fic.yaml +5 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_fic_p1.yaml +15 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_fic_p2.yaml +13 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_group.yaml +11 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_wn.yaml +7 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_wn_p1.yaml +13 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_wn_p2.yaml +13 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_re_p1.yaml +10 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_re_p2.yaml +10 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_re_task.yaml +10 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_p1.yaml +10 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_p2.yaml +10 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_p3.yaml +11 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_p4.yaml +11 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_p5.yaml +11 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_p6.yaml +11 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_tasks.yaml +9 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sum_fp-small_p1.yaml +12 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sum_fp-small_p2.yaml +12 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sum_fp-small_task.yaml +9 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sum_fp_p1.yaml +10 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sum_fp_p2.yaml +10 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sum_fp_task.yaml +9 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_p1.yaml +9 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_p2.yaml +5 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_p3.yaml +6 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_p4.yaml +6 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_p5.yaml +6 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_p6.yaml +6 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_tasks.yaml +9 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_wic_p1.yaml +5 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_wic_p2.yaml +5 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_wic_p3.yaml +6 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_wic_p4.yaml +6 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_wic_p5.yaml +6 -0
- lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_wic_p6.yaml +6 -0
lm-evaluation-harness/lm_eval/tasks/eus_exams/eus_exams_eu_opeosakiceladoreu.yaml
ADDED
|
@@ -0,0 +1,4 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
# Generated by utils.py
|
| 2 |
+
dataset_name: eu_opeosakiceladoreu
|
| 3 |
+
include: eus_exams_eu
|
| 4 |
+
task: eus_exams_eu_opeosakiceladoreu
|
lm-evaluation-harness/lm_eval/tasks/eus_exams/eus_exams_eu_opeosakioperarioeu.yaml
ADDED
|
@@ -0,0 +1,4 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
# Generated by utils.py
|
| 2 |
+
dataset_name: eu_opeosakioperarioeu
|
| 3 |
+
include: eus_exams_eu
|
| 4 |
+
task: eus_exams_eu_opeosakioperarioeu
|
lm-evaluation-harness/lm_eval/tasks/eus_exams/eus_exams_eu_osakidetza1e.yaml
ADDED
|
@@ -0,0 +1,4 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
# Generated by utils.py
|
| 2 |
+
dataset_name: eu_osakidetza1e
|
| 3 |
+
include: eus_exams_eu
|
| 4 |
+
task: eus_exams_eu_osakidetza1e
|
lm-evaluation-harness/lm_eval/tasks/eus_exams/eus_exams_eu_osakidetza2e.yaml
ADDED
|
@@ -0,0 +1,4 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
# Generated by utils.py
|
| 2 |
+
dataset_name: eu_osakidetza2e
|
| 3 |
+
include: eus_exams_eu
|
| 4 |
+
task: eus_exams_eu_osakidetza2e
|
lm-evaluation-harness/lm_eval/tasks/eus_exams/eus_exams_eu_osakidetza3e.yaml
ADDED
|
@@ -0,0 +1,4 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
# Generated by utils.py
|
| 2 |
+
dataset_name: eu_osakidetza3e
|
| 3 |
+
include: eus_exams_eu
|
| 4 |
+
task: eus_exams_eu_osakidetza3e
|
lm-evaluation-harness/lm_eval/tasks/eus_exams/eus_exams_eu_osakidetza7e.yaml
ADDED
|
@@ -0,0 +1,4 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
# Generated by utils.py
|
| 2 |
+
dataset_name: eu_osakidetza7e
|
| 3 |
+
include: eus_exams_eu
|
| 4 |
+
task: eus_exams_eu_osakidetza7e
|
lm-evaluation-harness/lm_eval/tasks/eus_exams/utils.py
ADDED
|
@@ -0,0 +1,15 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
import datasets
|
| 2 |
+
|
| 3 |
+
|
| 4 |
+
def process_docs(dataset: datasets.Dataset):
|
| 5 |
+
"""Filter out examples with no answer."""
|
| 6 |
+
|
| 7 |
+
def valid_example(example: dict) -> bool:
|
| 8 |
+
"""Check if an example is valid."""
|
| 9 |
+
if example["answer"] not in [0, 1, 2, 3]:
|
| 10 |
+
return False
|
| 11 |
+
if example["candidates"] == ["", "", "", ""]:
|
| 12 |
+
return False
|
| 13 |
+
return True
|
| 14 |
+
|
| 15 |
+
return dataset.filter(valid_example)
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner-fic_group.yaml
ADDED
|
@@ -0,0 +1,9 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
group: evalita-mp_ner_fic_group
|
| 2 |
+
group_alias: 'evalita NER: FIC'
|
| 3 |
+
task:
|
| 4 |
+
- evalita-mp_ner-v2_tasks_fic
|
| 5 |
+
aggregate_metric_list:
|
| 6 |
+
- metric: f1
|
| 7 |
+
weight_by_size: True
|
| 8 |
+
metadata:
|
| 9 |
+
version: 1
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner-fic_group_p1.yaml
ADDED
|
@@ -0,0 +1,17 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
include: _ner_template_yaml
|
| 2 |
+
dataset_name: fic
|
| 3 |
+
test_split: reduced_test
|
| 4 |
+
test_split: dev
|
| 5 |
+
fewshot_split: dev
|
| 6 |
+
task_alias: prompt-1
|
| 7 |
+
tag: evalita-mp_ner-v2_tasks_fic
|
| 8 |
+
task: evalita-mp_ner-v2_fic_p1
|
| 9 |
+
|
| 10 |
+
#
|
| 11 |
+
doc_to_target: !function utils.filter_per_entities_from_lines
|
| 12 |
+
doc_to_target: entities
|
| 13 |
+
|
| 14 |
+
# English
|
| 15 |
+
#doc_to_text: "Given the following text, write the entity mentions in the text, indicating their type: [PER] (person), [LOC] (location), [ORG] (organization). Respond with the following format: Entity$Type. Separate each entity-type pair with the '%' character. Text: {{text}}"
|
| 16 |
+
# Italian
|
| 17 |
+
doc_to_text: "Dato il seguente testo, scrivi le menzioni di entità nel testo, indicandone il tipo: PER (persona), LOC (luogo), ORG (organizzazione). Rispondi con il seguente formato: Entità$Tipo%Entità$Tipo. Separa ogni coppia entità-tipo con il carattere '%' ad esempio: Entità_2$Tipo%Entità_2$Tipo. In caso non ci siano entita' rispondi '&&NOENT&&'. Testo: {{text}}"
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner-wn_group.yaml
ADDED
|
@@ -0,0 +1,9 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
group: evalita-mp_ner_wn_group
|
| 2 |
+
group_alias: 'evalita NER: WN'
|
| 3 |
+
task:
|
| 4 |
+
- evalita-mp_ner-v2_tasks_wn
|
| 5 |
+
aggregate_metric_list:
|
| 6 |
+
- metric: f1
|
| 7 |
+
weight_by_size: True
|
| 8 |
+
metadata:
|
| 9 |
+
version: 1
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner-wn_group_p2.yaml
ADDED
|
@@ -0,0 +1,13 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
include: _ner_template_yaml
|
| 2 |
+
dataset_name: wn
|
| 3 |
+
test_split: reduced_test
|
| 4 |
+
fewshot_split: dev
|
| 5 |
+
task_alias: prompt-2
|
| 6 |
+
tag: evalita-mp_ner-v2_tasks_wn
|
| 7 |
+
task: evalita-mp_ner-v2_wn_p2
|
| 8 |
+
|
| 9 |
+
# English
|
| 10 |
+
#doc_to_text: "Given the following text, write the entity mentions in the text, indicating their type: [PER] (person), [LOC] (location), [ORG] (organization). Respond with the following format: Entity$Type. Separate each entity-type pair with the '%' character. Text: {{text}}"
|
| 11 |
+
# Italian
|
| 12 |
+
doc_to_text: "Dato il seguente testo, scrivi le menzioni di entità nel testo, indicandone il tipo: PER (persona), LOC (luogo), ORG (organizzazione). Rispondi con il seguente formato: Entità$Tipo%Entità$Tipo. Separa ogni coppia entità-tipo con il carattere '%' ad esempio: Entità_2$Tipo%Entità_2$Tipo. In caso non ci siano entita' rispondi '&&NOENT&&'.
|
| 13 |
+
Testo: {{text}}"
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_adg.yaml
ADDED
|
@@ -0,0 +1,7 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
group: evalita-mp_ner_tasks_adg
|
| 2 |
+
group_alias: evalita NER adg
|
| 3 |
+
aggregate_metric_list:
|
| 4 |
+
- metric: f1
|
| 5 |
+
weight_by_size: True
|
| 6 |
+
metadata:
|
| 7 |
+
version: 1
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_adg_p1.yaml
ADDED
|
@@ -0,0 +1,14 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
include: _ner_template_yaml
|
| 2 |
+
dataset_name: adg
|
| 3 |
+
test_split: reduced_test
|
| 4 |
+
fewshot_split: trial
|
| 5 |
+
|
| 6 |
+
task_alias: ADG prompt-1
|
| 7 |
+
tag: evalita-mp_ner_tasks_adg
|
| 8 |
+
task: evalita-mp_ner_adg_p1
|
| 9 |
+
|
| 10 |
+
|
| 11 |
+
#p1
|
| 12 |
+
doc_to_text: "Estrai tutte le entità di tipo PER (persona), LOC (luogo) e ORG (organizzazione) dal testo seguente. Riporta ogni entità con il formato: Entità$Tipo, separando ciascuna coppia con ','. Se non ci sono entità da estrarre, rispondi con '&&NOENT&&'.
|
| 13 |
+
Testo: '{{text}}'
|
| 14 |
+
Entità:"
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_adg_p2.yaml
ADDED
|
@@ -0,0 +1,14 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
include: _ner_template_yaml
|
| 2 |
+
dataset_name: adg
|
| 3 |
+
test_split: reduced_test
|
| 4 |
+
fewshot_split: trial
|
| 5 |
+
|
| 6 |
+
task_alias: ADG prompt-2
|
| 7 |
+
tag: evalita-mp_ner_tasks_adg
|
| 8 |
+
task: evalita-mp_ner_adg_p2
|
| 9 |
+
|
| 10 |
+
|
| 11 |
+
#p8
|
| 12 |
+
doc_to_text: "Devi svolgere un compito di riconoscimento delle entità nei testi. Estrai tutte le entità di tipo PER (persona), LOC (luogo) e ORG (organizzazione) dal testo seguente. Riporta ogni entità con il formato: Entità$Tipo, separando ciascuna coppia con ','. Se non ci sono entità da estrarre, rispondi con '&&NOENT&&'.
|
| 13 |
+
Testo: '{{text}}'
|
| 14 |
+
Entità:"
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_fic.yaml
ADDED
|
@@ -0,0 +1,5 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
|
| 2 |
+
group: evalita-mp_ner_tasks_fic
|
| 3 |
+
group_alias: evalita NER fic
|
| 4 |
+
|
| 5 |
+
task_alias: NER fic
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_fic_p1.yaml
ADDED
|
@@ -0,0 +1,15 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
include: _ner_template_yaml
|
| 2 |
+
dataset_name: fic
|
| 3 |
+
test_split: reduced_test
|
| 4 |
+
fewshot_split: trial
|
| 5 |
+
|
| 6 |
+
task_alias: FIC prompt-1
|
| 7 |
+
tag: evalita-mp_ner_tasks_fic
|
| 8 |
+
task: evalita-mp_ner_fic_p1
|
| 9 |
+
|
| 10 |
+
|
| 11 |
+
|
| 12 |
+
#p1
|
| 13 |
+
doc_to_text: "Estrai tutte le entità di tipo PER (persona), LOC (luogo) e ORG (organizzazione) dal testo seguente. Riporta ogni entità con il formato: Entità$Tipo, separando ciascuna coppia con ','. Se non ci sono entità da estrarre, rispondi con '&&NOENT&&'.
|
| 14 |
+
Testo: '{{text}}'
|
| 15 |
+
Entità:"
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_fic_p2.yaml
ADDED
|
@@ -0,0 +1,13 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
include: _ner_template_yaml
|
| 2 |
+
dataset_name: fic
|
| 3 |
+
test_split: reduced_test
|
| 4 |
+
fewshot_split: trial
|
| 5 |
+
|
| 6 |
+
task_alias: FIC prompt-2
|
| 7 |
+
tag: evalita-mp_ner_tasks_fic
|
| 8 |
+
task: evalita-mp_ner_fic_p2
|
| 9 |
+
|
| 10 |
+
#p8
|
| 11 |
+
doc_to_text: "Devi svolgere un compito di riconoscimento delle entità nei testi. Estrai tutte le entità di tipo PER (persona), LOC (luogo) e ORG (organizzazione) dal testo seguente. Riporta ogni entità con il formato: Entità$Tipo, separando ciascuna coppia con ','. Se non ci sono entità da estrarre, rispondi con '&&NOENT&&'.
|
| 12 |
+
Testo: '{{text}}'
|
| 13 |
+
Entità:"
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_group.yaml
ADDED
|
@@ -0,0 +1,11 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
group: evalita-mp_ner_group
|
| 2 |
+
group_alias: evalita NER
|
| 3 |
+
task:
|
| 4 |
+
- evalita-mp_ner_tasks_fic
|
| 5 |
+
- evalita-mp_ner_tasks_adg
|
| 6 |
+
- evalita-mp_ner_tasks_wn
|
| 7 |
+
aggregate_metric_list:
|
| 8 |
+
- metric: f1
|
| 9 |
+
weight_by_size: True
|
| 10 |
+
metadata:
|
| 11 |
+
version: 1
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_wn.yaml
ADDED
|
@@ -0,0 +1,7 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
group: evalita-mp_ner_tasks_wn
|
| 2 |
+
group_alias: evalita NER wn
|
| 3 |
+
aggregate_metric_list:
|
| 4 |
+
- metric: f1
|
| 5 |
+
weight_by_size: True
|
| 6 |
+
metadata:
|
| 7 |
+
version: 1
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_wn_p1.yaml
ADDED
|
@@ -0,0 +1,13 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
include: _ner_template_yaml
|
| 2 |
+
dataset_name: wn
|
| 3 |
+
test_split: reduced_test
|
| 4 |
+
fewshot_split: trial
|
| 5 |
+
|
| 6 |
+
task_alias: WN prompt-1
|
| 7 |
+
tag: evalita-mp_ner_tasks_wn
|
| 8 |
+
task: evalita-mp_ner_wn_p1
|
| 9 |
+
|
| 10 |
+
|
| 11 |
+
doc_to_text: "Estrai tutte le entità di tipo PER (persona), LOC (luogo) e ORG (organizzazione) dal testo seguente. Riporta ogni entità con il formato: Entità$Tipo, separando ciascuna coppia con ','. Se non ci sono entità da estrarre, rispondi con '&&NOENT&&'.
|
| 12 |
+
Testo: '{{text}}'
|
| 13 |
+
Entità:"
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_ner_wn_p2.yaml
ADDED
|
@@ -0,0 +1,13 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
include: _ner_template_yaml
|
| 2 |
+
dataset_name: wn
|
| 3 |
+
test_split: reduced_test
|
| 4 |
+
fewshot_split: trial
|
| 5 |
+
|
| 6 |
+
task_alias: WN prompt-2
|
| 7 |
+
tag: evalita-mp_ner_tasks_wn
|
| 8 |
+
task: evalita-mp_ner_wn_p2
|
| 9 |
+
|
| 10 |
+
|
| 11 |
+
doc_to_text: "Devi svolgere un compito di riconoscimento delle entità nei testi. Estrai tutte le entità di tipo PER (persona), LOC (luogo) e ORG (organizzazione) dal testo seguente. Riporta ogni entità con il formato: Entità$Tipo, separando ciascuna coppia con ','. Se non ci sono entità da estrarre, rispondi con '&&NOENT&&'.
|
| 12 |
+
Testo: '{{text}}'
|
| 13 |
+
Entità:"
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_re_p1.yaml
ADDED
|
@@ -0,0 +1,10 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
tag: evalita-mp_re_tasks
|
| 2 |
+
include: _re_template_yaml
|
| 3 |
+
task: evalita-mp_re_prompt-1
|
| 4 |
+
fewshot_split: dev
|
| 5 |
+
task_alias: prompt-1
|
| 6 |
+
|
| 7 |
+
#p4
|
| 8 |
+
doc_to_text: "Dato un documento medico devi estrarre tutte le misurazioni degli esami medici presenti. Riporta ogni relazione nel formato: misurazione$esame, separando ciascuna coppia con '%'. Se non ci sono relazioni da estrarre, rispondi con '&&NOREL&&'.
|
| 9 |
+
Testo: '{{text}}'
|
| 10 |
+
Relazioni:"
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_re_p2.yaml
ADDED
|
@@ -0,0 +1,10 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
tag: evalita-mp_re_tasks
|
| 2 |
+
include: _re_template_yaml
|
| 3 |
+
fewshot_split: dev
|
| 4 |
+
task: evalita-mp_re_prompt-2
|
| 5 |
+
task_alias: prompt-2
|
| 6 |
+
|
| 7 |
+
#p5
|
| 8 |
+
doc_to_text: "Devi svolgere un compito di estrazione di relazioni da documenti medici. Dato un documento medico devi estrarre tutte le misurazioni degli esami medici presenti. Riporta ogni relazione nel formato: misurazione$esame, separando ciascuna coppia con '%'. Se non ci sono relazioni da estrarre, rispondi con '&&NOREL&&'.
|
| 9 |
+
Testo: '{{text}}'
|
| 10 |
+
Relazioni:"
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_re_task.yaml
ADDED
|
@@ -0,0 +1,10 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
group: evalita-mp_re
|
| 2 |
+
group_alias: relation-extraction
|
| 3 |
+
task:
|
| 4 |
+
- evalita-mp_re_tasks
|
| 5 |
+
aggregate_metric_list:
|
| 6 |
+
- metric: f1
|
| 7 |
+
weight_by_size: True
|
| 8 |
+
|
| 9 |
+
metadata:
|
| 10 |
+
version: 1
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_p1.yaml
ADDED
|
@@ -0,0 +1,10 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
tag: evalita-mp_sa_tasks
|
| 2 |
+
include: _sa_template_yaml
|
| 3 |
+
task: evalita-mp_sa_prompt-1
|
| 4 |
+
task_alias: prompt-1
|
| 5 |
+
#doc_to_text: "Opinione: '{{text}}' Determinare la sentiment dell'opinione data. Possibili risposte: A – neutrale B – negativo C – positivo D - misto Risposta:"
|
| 6 |
+
doc_to_text: "Qual è il sentiment espresso nel seguente tweet: '{{text}}'?"
|
| 7 |
+
metric_list:
|
| 8 |
+
- metric: f1
|
| 9 |
+
higher_is_better: True
|
| 10 |
+
aggregation: !function metrics._aggreg_sa
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_p2.yaml
ADDED
|
@@ -0,0 +1,10 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
tag: evalita-mp_sa_tasks
|
| 2 |
+
include: _sa_template_yaml
|
| 3 |
+
task: evalita-mp_sa_prompt-2
|
| 4 |
+
task_alias: prompt-2
|
| 5 |
+
#doc_to_text: "Opinione: '{{text}}' Determinare la sentiment dell'opinione data. Possibili risposte: A – neutrale B – negativo C – positivo D - misto Risposta:"
|
| 6 |
+
doc_to_text: "Devi svolgere un compito di analisi del sentiment. Qual è il sentiment espresso nel seguente tweet: '{{text}}'?"
|
| 7 |
+
metric_list:
|
| 8 |
+
- metric: f1
|
| 9 |
+
higher_is_better: True
|
| 10 |
+
aggregation: !function metrics._aggreg_sa
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_p3.yaml
ADDED
|
@@ -0,0 +1,11 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
tag: evalita-mp_sa_tasks
|
| 2 |
+
include: _sa_template_yaml
|
| 3 |
+
task: evalita-mp_sa_prompt-3
|
| 4 |
+
task_alias: prompt-3
|
| 5 |
+
#doc_to_text: "Opinione: '{{text}}' Determinare la sentiment dell'opinione data. Possibili risposte: A – neutrale B – negativo C – positivo D - misto Risposta:"
|
| 6 |
+
doc_to_choice: ["A", "B", "C", "D"]
|
| 7 |
+
doc_to_text: "Qual è il sentiment espresso nel seguente tweet: '{{text}}'?\nA: Positivo\nB: Negativo\nC: Neutro\nD: Misto\nRisposta:"
|
| 8 |
+
metric_list:
|
| 9 |
+
- metric: f1
|
| 10 |
+
higher_is_better: True
|
| 11 |
+
aggregation: !function metrics._aggreg_sa
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_p4.yaml
ADDED
|
@@ -0,0 +1,11 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
tag: evalita-mp_sa_tasks
|
| 2 |
+
include: _sa_template_yaml
|
| 3 |
+
task: evalita-mp_sa_prompt-4
|
| 4 |
+
task_alias: prompt-4
|
| 5 |
+
#doc_to_text: "Opinione: '{{text}}' Determinare la sentiment dell'opinione data. Possibili risposte: A – neutrale B – negativo C – positivo D - misto Risposta:"
|
| 6 |
+
doc_to_choice: ["A", "B", "C", "D"]
|
| 7 |
+
doc_to_text: "Devi svolgere un compito di analisi del sentiment. Qual è il sentiment espresso nel seguente tweet: '{{text}}'?\nA: Positivo\nB: Negativo\nC: Neutro\nD: Misto\nRisposta:"
|
| 8 |
+
metric_list:
|
| 9 |
+
- metric: f1
|
| 10 |
+
higher_is_better: True
|
| 11 |
+
aggregation: !function metrics._aggreg_sa
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_p5.yaml
ADDED
|
@@ -0,0 +1,11 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
tag: evalita-mp_sa_tasks
|
| 2 |
+
include: _sa_template_yaml
|
| 3 |
+
task: evalita-mp_sa_prompt-5
|
| 4 |
+
task_alias: prompt-5
|
| 5 |
+
#doc_to_text: "Opinione: '{{text}}' Determinare la sentiment dell'opinione data. Possibili risposte: A – neutrale B – negativo C – positivo D - misto Risposta:"
|
| 6 |
+
#doc_to_choice: ["A", "B", "C", "D"]
|
| 7 |
+
doc_to_text: "Il seguente tweet: '{{text}}' esprime un sentiment"
|
| 8 |
+
metric_list:
|
| 9 |
+
- metric: f1
|
| 10 |
+
higher_is_better: True
|
| 11 |
+
aggregation: !function metrics._aggreg_sa
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_p6.yaml
ADDED
|
@@ -0,0 +1,11 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
tag: evalita-mp_sa_tasks
|
| 2 |
+
include: _sa_template_yaml
|
| 3 |
+
task: evalita-mp_sa_prompt-6
|
| 4 |
+
task_alias: prompt-6
|
| 5 |
+
#doc_to_text: "Opinione: '{{text}}' Determinare la sentiment dell'opinione data. Possibili risposte: A – neutrale B – negativo C – positivo D - misto Risposta:"
|
| 6 |
+
#doc_to_choice: ["A", "B", "C", "D"]
|
| 7 |
+
doc_to_text: "Devi svolgere un compito di analisi del sentiment. Il seguente tweet: '{{text}}' esprime un sentiment"
|
| 8 |
+
metric_list:
|
| 9 |
+
- metric: f1
|
| 10 |
+
higher_is_better: True
|
| 11 |
+
aggregation: !function metrics._aggreg_sa
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sa_tasks.yaml
ADDED
|
@@ -0,0 +1,9 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
group: evalita-mp_sa
|
| 2 |
+
group_alias: sentiment-analysis
|
| 3 |
+
task:
|
| 4 |
+
- evalita-mp_sa_tasks # Each of the tasks has to have a matching tag in its own yaml file
|
| 5 |
+
aggregate_metric_list:
|
| 6 |
+
- metric: f1
|
| 7 |
+
weight_by_size: True
|
| 8 |
+
metadata:
|
| 9 |
+
version: 1
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sum_fp-small_p1.yaml
ADDED
|
@@ -0,0 +1,12 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
tag: evalita-mp_sum_fp-small_tasks
|
| 2 |
+
include: _sum_template_fp-small_yaml
|
| 3 |
+
task: evalita-sp_sum_task_fp-small_p1
|
| 4 |
+
task_alias: prompt-1
|
| 5 |
+
#doc_to_text: >
|
| 6 |
+
# "Crea un sommario del seguente testo. Testo: {{source}}\nSommario: "
|
| 7 |
+
doc_to_text: "Riassumi il seguente articolo di giornale: '{{source}}'\nRiassunto:"
|
| 8 |
+
process_results: !function sum_utils.process_results_sum
|
| 9 |
+
metric_list:
|
| 10 |
+
- metric: rouge1
|
| 11 |
+
higher_is_better: true
|
| 12 |
+
aggregation: mean
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sum_fp-small_p2.yaml
ADDED
|
@@ -0,0 +1,12 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
tag: evalita-mp_sum_fp-small_tasks
|
| 2 |
+
include: _sum_template_fp-small_yaml
|
| 3 |
+
task: evalita-sp_sum_task_fp-small_p2
|
| 4 |
+
task_alias: prompt-2
|
| 5 |
+
#doc_to_text: >
|
| 6 |
+
# "Crea un sommario del seguente testo. Testo: {{source}}\nSommario: "
|
| 7 |
+
doc_to_text: "Devi risolvere un compito di sintesi automatica del testo. Riassumi il seguente articolo di giornale: '{{source}}'\nRiassunto:"
|
| 8 |
+
process_results: !function sum_utils.process_results_sum
|
| 9 |
+
metric_list:
|
| 10 |
+
- metric: rouge1
|
| 11 |
+
higher_is_better: true
|
| 12 |
+
aggregation: mean
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sum_fp-small_task.yaml
ADDED
|
@@ -0,0 +1,9 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
group: evalita-mp_sum_fp
|
| 2 |
+
group_alias: summarization-fanpage
|
| 3 |
+
task:
|
| 4 |
+
- evalita-mp_sum_fp-small_tasks
|
| 5 |
+
aggregate_metric_list:
|
| 6 |
+
- metric: rouge1
|
| 7 |
+
weight_by_size: True
|
| 8 |
+
metadata:
|
| 9 |
+
version: 0.0
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sum_fp_p1.yaml
ADDED
|
@@ -0,0 +1,10 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
tag: evalita-mp_sum_fp_tasks
|
| 2 |
+
include: _sum_template_fp_yaml
|
| 3 |
+
task: evalita-sp_sum_task_fp_p1
|
| 4 |
+
task_alias: prompt-1
|
| 5 |
+
doc_to_text: "Riassumi il seguente articolo di giornale: '{{source}}'\nRiassunto:"
|
| 6 |
+
process_results: !function sum_utils.process_results_sum
|
| 7 |
+
metric_list:
|
| 8 |
+
- metric: rouge1
|
| 9 |
+
higher_is_better: true
|
| 10 |
+
aggregation: mean
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sum_fp_p2.yaml
ADDED
|
@@ -0,0 +1,10 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
tag: evalita-mp_sum_fp_tasks
|
| 2 |
+
include: _sum_template_fp_yaml
|
| 3 |
+
task: evalita-sp_sum_task_fp_p2
|
| 4 |
+
task_alias: prompt-2
|
| 5 |
+
doc_to_text: "Devi risolvere un compito di sintesi automatica del testo. Riassumi il seguente articolo di giornale: '{{source}}'\nRiassunto:"
|
| 6 |
+
process_results: !function sum_utils.process_results_sum
|
| 7 |
+
metric_list:
|
| 8 |
+
- metric: rouge1
|
| 9 |
+
higher_is_better: true
|
| 10 |
+
aggregation: mean
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_sum_fp_task.yaml
ADDED
|
@@ -0,0 +1,9 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
group: evalita-mp_sum_fp
|
| 2 |
+
group_alias: summarization-fanpage
|
| 3 |
+
task:
|
| 4 |
+
- evalita-mp_sum_fp_tasks
|
| 5 |
+
aggregate_metric_list:
|
| 6 |
+
- metric: rouge1
|
| 7 |
+
weight_by_size: True
|
| 8 |
+
metadata:
|
| 9 |
+
version: 1
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_p1.yaml
ADDED
|
@@ -0,0 +1,9 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
tag: evalita-mp_te_tasks
|
| 2 |
+
include: _te_template_yaml
|
| 3 |
+
task: evalita-mp_te_prompt-1
|
| 4 |
+
task_alias: prompt-1
|
| 5 |
+
#doc_to_text: "Task di Text Entailment. Rispondi Vero o Falso in base alla correttezza dell'ipotesi rispetto al testo.\nTesto:{{text1}}\nIpotesi: {{text2}}\nRisposta:"
|
| 6 |
+
doc_to_text: "La frase: '{{text1}}' implica logicamente che la frase: '{{text2}}' sia vera?"
|
| 7 |
+
#metric_list:
|
| 8 |
+
# - metric: acc
|
| 9 |
+
# higher_is_better: true
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_p2.yaml
ADDED
|
@@ -0,0 +1,5 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
tag: evalita-mp_te_tasks
|
| 2 |
+
include: _te_template_yaml
|
| 3 |
+
task: evalita-mp_te_prompt-2
|
| 4 |
+
task_alias: prompt-2
|
| 5 |
+
doc_to_text: "Devi risolvere un compito di inferenza semantica. La frase: '{{text1}}' implica logicamente che la frase: '{{text2}}' sia vera?"
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_p3.yaml
ADDED
|
@@ -0,0 +1,6 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
tag: evalita-mp_te_tasks
|
| 2 |
+
include: _te_template_yaml
|
| 3 |
+
task: evalita-mp_te_prompt-3
|
| 4 |
+
task_alias: prompt-3
|
| 5 |
+
doc_to_choice: ["A", "B"]
|
| 6 |
+
doc_to_text: "La frase: '{{text1}}' implica logicamente che la frase: '{{text2}}' sia vera?\nA: Sì\nB: No\nRisposta:"
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_p4.yaml
ADDED
|
@@ -0,0 +1,6 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
tag: evalita-mp_te_tasks
|
| 2 |
+
include: _te_template_yaml
|
| 3 |
+
task: evalita-mp_te_prompt-4
|
| 4 |
+
task_alias: prompt-4
|
| 5 |
+
doc_to_choice: ["A", "B"]
|
| 6 |
+
doc_to_text: "Devi risolvere un compito di inferenza semantica. La frase: '{{text1}}' implica logicamente che la frase: '{{text2}}' sia vera?\nA: Sì\nB: No\nRisposta:"
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_p5.yaml
ADDED
|
@@ -0,0 +1,6 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
tag: evalita-mp_te_tasks
|
| 2 |
+
include: _te_template_yaml
|
| 3 |
+
task: evalita-mp_te_prompt-5
|
| 4 |
+
task_alias: prompt-5
|
| 5 |
+
doc_to_choice: ["La frase 1 implica logicamente che la frase 2 sia vera", "La frase 1 non implica logicamente che la frase 2 sia vera"]
|
| 6 |
+
doc_to_text: "Frase 1: '{{text1}}' Frase 2: '{{text2}}'"
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_p6.yaml
ADDED
|
@@ -0,0 +1,6 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
tag: evalita-mp_te_tasks
|
| 2 |
+
include: _te_template_yaml
|
| 3 |
+
task: evalita-mp_te_prompt-6
|
| 4 |
+
task_alias: prompt-6
|
| 5 |
+
doc_to_choice: ["La frase 1 implica logicamente che la frase 2 sia vera", "La frase 1 non implica logicamente che la frase 2 sia vera"]
|
| 6 |
+
doc_to_text: "Devi risolvere un compito di inferenza semantica. Frase 1: '{{text1}}' Frase 2: '{{text2}}'"
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_te_tasks.yaml
ADDED
|
@@ -0,0 +1,9 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
group: evalita-mp_te
|
| 2 |
+
group_alias: text-entailment
|
| 3 |
+
task:
|
| 4 |
+
- evalita-mp_te_tasks # this has to match the tag in the task yaml file
|
| 5 |
+
aggregate_metric_list:
|
| 6 |
+
- metric: acc
|
| 7 |
+
weight_by_size: True
|
| 8 |
+
metadata:
|
| 9 |
+
version: 1
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_wic_p1.yaml
ADDED
|
@@ -0,0 +1,5 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
tag: evalita-mp_wic_tasks
|
| 2 |
+
task: evalita-mp_wic_prompt-1
|
| 3 |
+
task_alias: prompt-1
|
| 4 |
+
include: _wic_template_yaml
|
| 5 |
+
doc_to_text: "La parola: '{{sentence1[start1:end1]}}' nella frase: '{{sentence1}}' ha lo stesso significato della parola: '{{sentence2[start2:end2]}}' nella frase: '{{sentence2}}'?"
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_wic_p2.yaml
ADDED
|
@@ -0,0 +1,5 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
tag: evalita-mp_wic_tasks
|
| 2 |
+
task: evalita-mp_wic_prompt-2
|
| 3 |
+
task_alias: prompt-2
|
| 4 |
+
include: _wic_template_yaml
|
| 5 |
+
doc_to_text: "Devi determinare se una stessa parola usata in due frasi differenti ha lo stesso significato in entrambi i contesti. La parola: '{{sentence1[start1:end1]}}' nella frase: '{{sentence1}}' ha lo stesso significato della parola: '{{sentence2[start2:end2]}}' nella frase: '{{sentence2}}'?"
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_wic_p3.yaml
ADDED
|
@@ -0,0 +1,6 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
tag: evalita-mp_wic_tasks
|
| 2 |
+
task: evalita-mp_wic_prompt-3
|
| 3 |
+
task_alias: prompt-3
|
| 4 |
+
include: _wic_template_yaml
|
| 5 |
+
doc_to_text: "La parola '{{sentence1[start1:end1]}}' nella frase '{{sentence1}}' ha lo stesso significato della parola '{{sentence2[start2:end2]}}' nella frase '{{sentence2}}'?\nA: Sì\nB: No\nRisposta:"
|
| 6 |
+
doc_to_choice: ["B", "A"]
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_wic_p4.yaml
ADDED
|
@@ -0,0 +1,6 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
tag: evalita-mp_wic_tasks
|
| 2 |
+
task: evalita-mp_wic_prompt-4
|
| 3 |
+
task_alias: prompt-4
|
| 4 |
+
include: _wic_template_yaml
|
| 5 |
+
doc_to_text: "Devi determinare se una stessa parola usata in due frasi differenti ha lo stesso significato in entrambi i contesti. La parola '{{sentence1[start1:end1]}}' nella frase '{{sentence1}}' ha lo stesso significato della parola '{{sentence2[start2:end2]}}' nella frase '{{sentence2}}'?\nA: Sì\nB: No\nRisposta:"
|
| 6 |
+
doc_to_choice: ["B", "A"]
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_wic_p5.yaml
ADDED
|
@@ -0,0 +1,6 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
tag: evalita-mp_wic_tasks
|
| 2 |
+
task: evalita-mp_wic_prompt-5
|
| 3 |
+
task_alias: prompt-5
|
| 4 |
+
include: _wic_template_yaml
|
| 5 |
+
doc_to_text: "La parola: '{{sentence1[start1:end1]}}' nella frase: '{{sentence1}}' e la parola: '{{sentence2[start2:end2]}}' nella frase: '{{sentence2}}'"
|
| 6 |
+
doc_to_choice: ["non hanno lo stesso significato", "hanno lo stesso significato"]
|
lm-evaluation-harness/lm_eval/tasks/evalita_llm/_evalita-mp_wic_p6.yaml
ADDED
|
@@ -0,0 +1,6 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
tag: evalita-mp_wic_tasks
|
| 2 |
+
task: evalita-mp_wic_prompt-6
|
| 3 |
+
task_alias: prompt-6
|
| 4 |
+
include: _wic_template_yaml
|
| 5 |
+
doc_to_text: "Devi determinare se una stessa parola usata in due frasi differenti ha lo stesso significato in entrambi i contesti. La parola: '{{sentence1[start1:end1]}}' nella frase: '{{sentence1}}' e la parola: '{{sentence2[start2:end2]}}' nella frase: '{{sentence2}}'"
|
| 6 |
+
doc_to_choice: ["non hanno lo stesso significato", "hanno lo stesso significato"]
|