123
Published: 3 June 2025| Version 1 | DOI: 10.17632/5vj35nwc3n.1
Contributor:
zhangtong songDescription
This study employs a two-group controlled experiment to systematically assess GPT-4o's evaluation reliability and validity under different prompting strategies.
Files
Categories
Design Evaluation, Large Language Model