피부과 진료에서는 병변의 크기, 형태, 질감을 반복해 살피는 일이 중요하다. 이 연구는 그런 측정이 여전히 2D 영상에 치우쳐 있다는 점에서 출발한다. 연구팀은 단일 카메라로 얻은 피부 사진만으로도 metric scale 3D 재구성과 surface normal 추정이 가능한지 검증했고, 대상은 dermoscopic 영상과 일반 임상 촬영 모두였다. 논문은 추가 하드웨어나 다중 촬영 없이도 이런 추정이 가능하다고 본다.
핵심 제안은 두 가지다. 하나는 피부과 도메인 최초의 단일시점 metric scale 3D model인 DermDepth, 다른 하나는 pixel-perfect 3D 정보를 갖춘 합성 dermoscopy 데이터셋 D-Synth다. D-Synth는 4,000개 샘플로 구성됐고, 131개 melanin level과 240개 lesion morphology를 12–20 mm 거리, 75° field of view 조건에서 렌더링했다. 비교를 위한 실제 데이터는 SKINL2 375개, WoundsDB 77개, DDI 47개였고, DDI는 fully visible medical ruler가 있는 47개 샘플을 이용해 스케일을 추정했다.

실험에서는 네 개의 최근 foundation model을 비교했다. Depth Anything 3, MapAnything, Pixel-Perfect Depth, MoGe-2가 대상이었고, 평가 지표는 scale ratio r, SI-δ1, DDI에서는 known ruler area에 대한 ratio ρ였다. 기준 모델들은 SKINL2에서 4.16배, 10.88배, 16.21배, 16.10배로 과대 추정했고, WoundsDB에서는 0.67배, 0.75배, 0.66배, 0.62배로 과소 추정했다. DDI의 ruler-area ratio는 53.6배, 156.1배, 90.4배, 81.0배였다. 반면 DermDepth는 D-Synth만으로 SKINL2의 스케일을 1.11배로 낮췄고, 이후 실제 데이터까지 더한 최종 모델은 SKINL2 0.87배, WoundsDB 0.91배, DDI 1.95배를 보였다.
기하 품질은 유지됐다. 기준 모델들의 SI-δ1은 모두 92.0% 이상이었고, DermDepth는 synthetic-only 학습에서 100.0%를 보였다. 연구팀은 이를 바탕으로 backbone encoder는 고정하고 scale head와 normal head만 미세조정했다. DermDepth가 fine-tuning한 파라미터는 2.1M개로 전체의 0.6% 수준이며, 실험은 D-Synth에서의 학습이 16배를 넘던 metric scale error를 1.1배 미만으로 줄일 수 있음을 보였다. 이어 소량의 실제 임상 샘플 346개를 더해, 몇 mm에서 hundred cm 범위에 이르는 세 개의 실제 벤치마크로 일반화했다.
공정성 분석도 포함됐다. DDI를 Fitzpatrick 피부톤별로 나누면 MapAnything의 ruler-area ratio는 FP I–II 156.11배, FP III–IV 88.53배, FP V–VI 211.88배로 편차가 컸다. MoGe-2는 10.90, DermDepthS는 1.70, 최종 DermDepth는 1.02로 줄었고, 그룹별 비율은 1.39배에서 2.41배 사이였다. 연구팀은 또 DDI의 14개 병변에 대해 문헌상 통상적인 크기 범위와의 일치 여부를 확인했는데, 10개는 범위 안에 있었고 나머지 4개는 경계 사례로 해석했다.
| 구분 | 표본/설정 | 핵심 수치 | 원문 위치 |
|---|---|---|---|
| D-Synth | 4,000개, 131 melanin levels, 240 lesion morphologies, 12–20 mm, 75° FOV | Rendered depth·camera intrinsics·normal maps 포함 | Method 2.1 |
| 주요 벤치마크 | SKINL2 375, WoundsDB 77, DDI 47 | train/test = 70/30, DDI는 47개 중 14개 test | Table 1, Method 2.1 |
| 스케일 성능 | SKINL2 / WoundsDB / DDI held-out test | DermDepth: 0.87× / 0.91× / 1.95×; DermDepthS: 1.11× / 0.28× / 9.2× | Table 2, Figure 2(left) |
| 피부톤 공정성 | DDI Fitzpatrick I–II / III–IV / V–VI | DermDepth: 1.92× / 2.41× / 1.39×, disparity 1.02 | Table 3 |
| 문헌 검증 | 8 diagnostic categories, 14 lesions | 10/14가 published typical range 안에 위치 | Table 4, Section 3.5 |
자료: STORIUM 정리
한계도 분명하다. D-Synth는 dermoscopic-distance scenes, 즉 12–20 mm 범위만 렌더링하므로 더 먼 임상 거리는 실제 데이터로 보완해야 한다. 실제 데이터의 depth와 normal도 잡음이 섞여 있고, DDI의 pseudo-GT는 ruler segmentation과 알려진 ruler dimensions에 의존한다. 또 DDI test set은 14개로 작아 통계적 유의성은 제한적이다. 그럼에도 이 연구는 피부과 사진 한 장에서도 metric scale 3D 계측을 가능하게 할 조건과 한계를 함께 제시했다.
저작권자 © STORIUM 무단전재 및 재배포 금지














