결측값은 과학, 사회과학, 공중보건 연구에서 분석을 왜곡할 수 있는 지속적 장애물로 제시된다. arXiv에 올라온 이 논문은 이런 문제를 다루기 위해 ImputeViz라는 시각분석 대시보드를 제안한다. 핵심은 결측 상태를 먼저 진단하고, 대입 모델을 구성한 뒤, 결과를 비교·평가하는 흐름을 하나의 인터페이스에 묶는 데 있다.
시스템에는 MICE, Random Forest, XGBoost, kNN 같은 널리 쓰이는 방법이 들어가며, 결측 패턴을 더 선명하게 보이게 하는 상호작용 환경을 지향한다. 여기에 지리 정보를 반영한 gKNN을 추가해 사회경제적 거리와 공간적 거리를 함께 쓰고, 어떤 지역이 추정값에 기여했는지도 드러낸다. 논문의 설명에 따르면 이는 출처 기반의 시각적 책임성을 높이기 위한 장치다.

연구진은 비교를 부차적 기능이 아니라 중심 작업으로 둔다고 밝힌다. 이를 위해 heatmap, co-missingness 요약, 분포 진단, 분포 중첩, 변수별 차이 뷰를 연결했고, Method Comparison Summary에서는 MAE, RMSE, Delta RMSE, runtime을 같은 masking 조건에서 함께 보여준다. 또한 방법별 결과를 캐시하고 축 범위를 고정해 방법을 바꿀 때 생기는 인지 부담을 줄였다고 적었다.
데이터는 두 갈래다. 하나는 CDC WONDER와 ACS, 카운티 지오메트리를 결합한 2000–2022년 미국 카운티 단위 처방 오피오이드 사망 데이터이고, 다른 하나는 212행으로 필터링된 비지리적 telecom churn 데이터다. 평가 방식은 선택된 타깃마다 관측값의 20%를 무작위 holdout 마스킹하고 동일 조건에서 알고리즘을 실행하는 구조이며, 추가로 suppression-like masking(target < τ, τ=13)과 intermediate masking도 시험한다.
결과 표에서는 23개 연도별 오피오이드 패널 전체에서 gKNN이 세 가지 마스킹 조건(Supp., Interm., Random)과 pooled Overall에서 평균 MAE가 가장 낮다고 보고한다. 표 1의 수치는 gKNN이 3.47, 2.76, 2.66, 2.96이고, 비교 대상은 Linear Regression 4.07/2.91/2.88/3.28, kNN 3.86/3.18/2.81/3.28, Random Forest 4.18/2.92/2.79/3.30, MICE 4.05/3.06/2.88/3.33, XGBoost 4.21/3.19/3.00/3.46이다. 2010년 사례에서는 per-county absolute errors에 대한 paired Wilcoxon 검정이 n=167, mean difference −0.34, p≈0.0396로 제시됐고, telecom churn의 continuous Offer 타깃에서는 Random Forest가 MICE보다 우수하며 n=43, mean difference 21.9, p≈2.0×10−9가 보고된다.
| 항목 | 원문 수치/내용 | source_locator |
|---|---|---|
| 오피오이드 데이터 범위 | county-level U.S. prescription-opioid mortality (2000–2022), CDC WONDER+ACS socioeconomic covariates+county geometries | p.1 | source_excerpt; p.2 | source_excerpt |
| telecom churn 표본 | 212 rows after filtering; continuous Offer target | p.1 | source_excerpt |
| gKNN 평가(오피오이드, Table 1) | 평균 MAE: Supp. 3.47, Interm. 2.76, Random 2.66, Overall 2.96; 비교군 Linear Regression 4.07/2.91/2.88/3.28, kNN 3.86/3.18/2.81/3.28, Random Forest 4.18/2.92/2.79/3.30, MICE 4.05/3.06/2.88/3.33, XGBoost 4.21/3.19/3.00/3.46 | p.3 | Table: 1 |
| 형성적 사용성 평가 | N=7, mean SUS 75.4, SD 15.8 | p.4 | source_excerpt |
자료: STORIUM 정리
사용성 평가는 형성적(formative) 연구로 N=7, 평균 SUS 75.4(SD 15.8)였다. 참가자들은 방법 구성과 연결된 비교를 긍정적으로 평가했고, 연구진은 불확실성 추정은 비용 문제로 오프라인에서 계산했다고 덧붙인다. 이 논문은 동료검토 전 arXiv v1 프리프린트다.
저작권자 © STORIUM 무단전재 및 재배포 금지














