Argumentative essay 평가를 위해 설계된 WrAFT는 점수 산정과 피드백 생성을 한 덩어리로 다루지 않고, scoring·surface-level feedback·deep-level feedback의 세 모듈로 나눈 자동 글쓰기 평가 시스템이다. 이 연구는 동료검토 전 arXiv 프리프린트 상태로 공개됐으며, 시스템이 정확한 점수와 포괄적 피드백을 함께 내는지를 내부 검증으로 확인했다.
검증 범위는 ETS의 공식 benchmark score가 붙은 TOEFL Independent Writing 에세이 480편이다. 이 가운데 점수 모듈은 120편을 사용했고, 표면·심층 피드백 시험에는 인간 평가 비용을 고려해 40편만 따로 뽑았다. 점수는 0~5 원점수 체계를 바탕으로 하되, 데이터셋에서는 0점이 제외돼 1~5점 사이를 0.5 단위로 다뤘다.

점수 성능은 benchmark-based evaluation으로 확인됐다. fine-tuned GPT-4o 모델은 QWK 0.84, RMSE 0.44를 기록했고, 비교 기준인 Wang and Gayed (2024)의 baseline은 RMSE 0.57, QWK 0.78이었다. 같은 표에서 LLaMA 기반 fine-tuned 모델은 RMSE 0.53, QWK 0.81로 나타나 두 모델 모두 baseline보다 높은 일치도를 보였다.
피드백은 사람 평가로 검증했다. 표면 수준 수정안은 ERRANT v3.0.0과 두 명의 전문가 판정을 거쳤고, 1,985개 수정안이 필요하다고 판단된 가운데 1,970개가 필요성과 효과성을 함께 충족해 96.14%를 기록했다. 심층 피드백은 macro와 micro로 나눠 각각 93.03%, 94.69%의 승인률을 얻었다. 공개 UI도 함께 만들어져 무료로 사용할 수 있다고 밝혔다.
| 구성/비교 | 수치 | 근거 위치 |
|---|---|---|
| 점수 평가 데이터 | TOEFL Independent Writing 480편, 공식 benchmark scores, 1~5점(0.5 간격) | p.1 abstract; p.8 source_excerpt |
| 점수 모듈 성능: GPT-4o fine-tuned | QWK 0.84, RMSE 0.44, 비교 기준 baseline RMSE 0.57/QWK 0.78 | p.14 Table 5 |
| 피드백 사람 평가 | surface-level 96.14%, deep-level macro 93.03%, deep-level micro 94.69% | p.1 abstract; p.14 source_excerpt |
| 모듈별 선택 모델 | 점수 GPT-4o fine-tuned, 표면 GPT-4o direct prompting, 심층 Claude 3.7 | p.17 source_excerpt |
자료: STORIUM 정리
시스템 구축 과정에서는 여러 LLM을 직접 프롬프트와 supervised fine-tuning 방식으로 비교했다. 평가 대상에는 LLaMA-3.3-70B-Instruct, GPT-4o, Claude 3.7이 포함됐고, 점수 모듈에는 fine-tuned GPT-4o, 표면 피드백에는 GPT-4o direct prompting, 심층 피드백에는 Claude 3.7이 채택됐다. 연구진은 제한점으로 표본이 ETS의 proprietary dataset에 묶여 있고, 인간 평가는 precision 중심이라 recall을 보지 못했다고 적었다.
저작권자 © STORIUM 무단전재 및 재배포 금지














