과달라하라대 연구자는 교수 평가의 자유서술 댓글을 주제와 감성으로 분류하는 기존 절차가 최신 표현 모델과 다른 언어에서도 유지되는지 재검증했다. 비교 대상은 TF-IDF 같은 희소 특징, 2019년 BETO 고정 임베딩, 현대 다국어 임베딩, 소형·최전선 거대언어모델이다. 핵심은 최고 모델을 고르는 것이 아니라 주석 지침과 검증 구조가 모델 교체에도 견디는지다.
스페인어 자료는 한 명의 주석자가 댓글 1165개에 주제 4종과 감성 3종을 붙였고 233개를 최종 보류 세트로 남겼다. 100개를 일주일 간격으로 다시 표시한 주석자 내 Cohen κ는 주제 0.82, 감성 0.88이었다. 모델 선택은 층화 5겹 교차검증을 거쳤지만, 이는 주석자 간 합의가 아니라 한 사람의 시간적 일관성이다. 자료와 평가는 arXiv:2607.11873에 보고됐으며 아직 동료검토 전이다.
영어 감성 전이는 RateMyProfessor 954만 리뷰에서 별점으로 긍정·중립·부정을 만들고 각 1만5000개씩 균형 표집했다. 학습·개발·시험은 3만1500·6750·6750개다. 별점 라벨을 사람 주석 EduRABSA 3000개와 대조했을 때 κ 0.66, 정확도 82%였으며 특히 중립이 약했다.
스페인어 어려운 주제 분류에서는 2026 최전선 모델이 가장 높은 F1을 냈지만 감성은 저비용 모델과 이점이 없었다. 영어에서도 모델 간 기술적 구분이 뚜렷하지 않았고, 고정 임베딩이 비용-정확도 전선에 남았다. 공개된 수치 가운데 소형 Qwen2.5-1.5B의 주제 가중 F1은 제로샷 0.31에서 퓨샷 0.63으로 올랐다.

| 검증 항목 | 표본 | 결과 |
|---|---|---|
| 스페인어 주제 재주석 | 100개·1주 간격 | Cohen κ 0.82 |
| 스페인어 감성 재주석 | 100개·1주 간격 | Cohen κ 0.88 |
| 영어 별점 라벨 대 EduRABSA | 3000개 | κ 0.66·정확도 82% |
분할 한 번의 기술 비교여서 통계적 우월성을 주장하지 않으며, 스페인어 금표준은 단일 주석자와 1165개에 불과하다. 영어 라벨은 기관 설문이 아닌 공개 플랫폼 별점에서 파생돼 배치 환경이 다르다.
저작권자 © STORIUM 무단전재 및 재배포 금지










