Published August 13, 2025 | Version v2

GPT-4 Shows Comparable Performance to Human Examiners in Ranking Open-Text Answers

Description

This repository contains all datasets used in the research paper:
"GPT-4 Shows Comparable Performance to Human Examiners in Ranking Open-Text Answers"

Files and Descriptions

  1. Data_complete_Can_GPT_Replace_Human_Examiners.xlsx
    Contains two sheets:

  • Data – Main analysis dataset for Ranking and Point Assessment of Five Answers.

  • Robustness & Extensions – Data for Robustness & Extensions, covering Ranking and Point Assessment of Five Answers.

  1. point_assessment_single_answer_all_robustness_score.xlsx
    Contains all data related to robustness checks for Point Assessment of Single Answers.

  2. point_assessment_single_answer.xlsx
    Contains the main dataset for Point Assessment of Single Answers (excluding robustness checks).

 

Note: Any variable termed GPT is output of the model as under OpenAI Terms & policies.

 

Files

Files (1.0 MB)

Name Size Download all
md5:29d332551634cae739e3b9e5eaa52274
497.7 kB Download
md5:e02fb20aa32430f1dd5952ba0dd4194c
74.2 kB Download
md5:f3f9042f17f070ffd8415c71a700c31d
474.8 kB Download

Additional details

Related works

Is supplemented by
Journal article: 10.1038/s41598-025-21572-8 (DOI)