MIT와 아동 안전 비영리단체 손(Thorn) 연구진이 불법 아동 성착취물(CSAM)을 실제로 생성하지 않고도 이미지 생성 모델의 위험한 개조 여부를 판별하는 감사 기법을 공개했다. 미국에서는 평가 목적이라도 CSAM 생성이 불법이어서, 유해 프롬프트를 넣고 결과물을 사람이 확인하는 기존 점검법을 적용할 수 없다는 문제에서 출발했다.
연구진은 모델 전체가 아니라 저비용 미세조정에 쓰이는 LoRA 어댑터의 내부 변화를 조사했다. 무작위 데이터 점을 입력하는 ‘가우시안 프로빙’으로 여러 내부 층의 반응을 수집하고 평균화해, 어댑터가 기본 모델의 계산을 어떤 방향으로 바꿨는지 요약했다. 이 과정에서는 모델을 끝까지 실행하거나 이미지를 출력하지 않는다.

평가는 세 종류의 모델 변형을 대상으로, CSAM 생성용으로 알려진 LoRA 어댑터와 다른 유해 이미지용·안전한 콘텐츠용 어댑터를 비교했다. MIT는 해당 시험에서 CSAM 생성에 맞춰진 변형을 100% 정확도로 식별했다고 밝혔다. 다만 이 수치는 연구진이 구성한 알려진 변형 집합에서 나온 결과로, 공개 플랫폼 전체의 다양한 우회 개조를 포괄한 현장 성능을 뜻하지 않는다.
연구진은 생성 결과를 저장·검토하지 않아 법적·심리적 부담을 줄이고, 매달 수천 개씩 공개되는 모델 변형을 비교적 낮은 비용으로 선별할 수 있다고 설명했다. 모델 호스팅 플랫폼이 업로드 단계에서 위험한 어댑터를 표시하거나 차단하는 용도가 제시됐다. 내부 계산 자체를 바꿔 탐지를 피하려면 공격자에게 더 큰 기술적 비용이 든다는 점도 장점으로 꼽았다.
| 검증 항목 | 논문 보고값 | 적용 범위 |
|---|---|---|
| CSAM 재현율 | 100% | SD 1.5·SDXL·FLUX.1-dev, 5-fold 평균 |
| SFW→CSAM 오분류 | 1% 미만 | SD 1.5·SDXL |
| SFW→CSAM 오분류 | 4.21% | FLUX.1-dev |
| NSFW→CSAM 오분류 | 1.90% | FLUX.1-dev |
이번 연구는 ICML의 ‘Trustworthy AI for Good’ 워크숍에서 스포트라이트로 발표됐으며, 일반 학술대회의 본 논문 동료검토와는 구분된다. 연구진도 더 많은 모델 변형과 기본 모델 자체의 유해 능력으로 평가 범위를 넓혀야 한다고 밝혔다. 따라서 100%라는 시험 결과보다, 불법 결과물을 만들지 않는 감사 경로를 제시했다는 점이 현재 확인된 성과다.
저작권자 © STORIUM 무단전재 및 재배포 금지














