INNER CODE UNIT · Python
grade_answers
Future-House/BixBench · grade_outputs.py:49
async def grade_answers(
input_file: str | Path,
answer_mode: AnswerMode,
model_name: str = "gpt-4o",
temperature: float = 1.0,
**kwargs: dict[str, Any],
):
"""Grade answers based on evaluation mode."""
query_df = pd.read_csv(input_file)
if answer_mode == AnswerMode.openanswer:
llm_client = LiteLLMModel(
name=f"{model_name}",
config={"name": model_name, "temperature": temperature, **kwargs},
)
grader = GradeAnswer(
answer_mode=answer_mode,
llm_client=llm_client,