HumanEval
HumanEval
معيار يقيس قدرة النموذج على تخليق دوال Python بدرجات تعقيد متفاوتة، وهو من أبرز مقاييس القدرة البرمجية للنماذج اللغوية.
A benchmark measuring the ability to synthesize Python functions of varying complexity, one of the key measures of language model coding capability.
تُرجم أيضاًمعيار التقييم البشري للبرمجة
أول ظهور في هذه المجموعة: الكتب المدرسية هي كل ما تحتاجه (2023)
يظهر في هذه الأوراق