Arabic-LLM-Broad-Leaderboard

Running

karimouda commited on Apr 21

Commit

00e1096

1 Parent(s): eec2226

rename to benchmark score

Files changed (3) hide show

src/display/utils.py CHANGED Viewed

@@ -32,7 +32,7 @@ auto_eval_column_dict.append(["model_category", ColumnContent, ColumnContent("Ca
 #auto_eval_column_dict.append(["model_type_symbol", ColumnContent, ColumnContent("T", "str", True, never_hidden=True)])
 auto_eval_column_dict.append(["model", ColumnContent, ColumnContent("Model", "markdown", True, never_hidden=True)])
 #Scores
-auto_eval_column_dict.append(["average", ColumnContent, ColumnContent("Average", "number", True)])
 for eval_dim in EvalDimensions:
     auto_eval_column_dict.append([eval_dim.name, ColumnContent, ColumnContent(eval_dim.value.col_name, "number", True)])
 # Model information

 #auto_eval_column_dict.append(["model_type_symbol", ColumnContent, ColumnContent("T", "str", True, never_hidden=True)])
 auto_eval_column_dict.append(["model", ColumnContent, ColumnContent("Model", "markdown", True, never_hidden=True)])
 #Scores
+auto_eval_column_dict.append(["average_score", ColumnContent, ColumnContent("Benchmark Score", "number", True)])
 for eval_dim in EvalDimensions:
     auto_eval_column_dict.append([eval_dim.name, ColumnContent, ColumnContent(eval_dim.value.col_name, "number", True)])
 # Model information

src/leaderboard/read_evals.py CHANGED Viewed

@@ -127,7 +127,7 @@ class EvalResult:
             #AutoEvalColumn.architecture.name: self.architecture,
             AutoEvalColumn.model.name: make_clickable_model(self.full_model),
             #AutoEvalColumn.revision.name: self.revision,
-            AutoEvalColumn.average.name: average_score,
             AutoEvalColumn.license.name: self.license,
             AutoEvalColumn.likes.name: self.likes,
             AutoEvalColumn.params.name: self.num_params,

             #AutoEvalColumn.architecture.name: self.architecture,
             AutoEvalColumn.model.name: make_clickable_model(self.full_model),
             #AutoEvalColumn.revision.name: self.revision,
+            AutoEvalColumn.average_score.name: average_score,
             AutoEvalColumn.license.name: self.license,
             AutoEvalColumn.likes.name: self.likes,
             AutoEvalColumn.params.name: self.num_params,

src/populate.py CHANGED Viewed

@@ -16,7 +16,7 @@ def get_leaderboard_df(results_path: str, requests_path: str, cols: list, benchm
     df = pd.DataFrame.from_records(all_data_json)
     if not df.empty:
-        df = df.sort_values(by=[AutoEvalColumn.average.name], ascending=False)
         # filter out if any of the benchmarks have not been produced

     df = pd.DataFrame.from_records(all_data_json)
     if not df.empty:
+        df = df.sort_values(by=[AutoEvalColumn.average_score.name], ascending=False)
         # filter out if any of the benchmarks have not been produced