멜버른대와 랜카스터대 연구진이 텍스트-이미지 생성 모델의 attention dynamics를 추론 시점에 조정해 안전성을 높이는 방법을 제안했다. 이 연구는 arXiv 프리프린트로, 원본 모델을 재학습하지 않고 이미지 생성 과정에서 attention activations를 분석·재조정하는 절차를 다룬다.
논문은 FLUX.1-dev에 LoRA(200M parameters, rank-32)를 더해 unsafe generation 설정을 만들고 그 위에서 제안법을 시험했다. 28-step Euler sampling과 1024×1024 해상도를 사용했으며, 5 PGD iterations per denoising step, learning rate η=0.1, safety weight λ=1.5, per-step magnitude αstep=0.1, CFG scale 4.5를 적용했다. 연구진은 안전한 기준 attention과의 거리, safety regularizer, coherence energy를 함께 다뤄 잠재적인 unsafe concept으로의 수렴을 줄인다고 설명한다.

실험 평가는 I2P의 4.5K unsafe prompts와 SneakyPrompts, MMA-Diffusion, UnlearnDiffAtk, MS-COCO validation set에서 이뤄졌다. 안전성은 NudeNet 기반 Nudity Rate와 Qwen-VL 기반 VLM Unsafe Rate로, 품질은 CLIP Score로 측정했다. 비교군은 UCE, ESD, FlowEdit, MCE, EraseAnything이었다. I2P에서 Ours의 NR은 39.6%로 baseline 56.3%보다 낮았고, SneakyPrompts에서는 70.5%로 baseline 81.5%보다 낮았다. VLM Unsafe Rate는 I2P 1.7%와 SneakyPrompts 48.0%였고, baseline은 각각 8.1%와 60.0%였다.
품질 지표는 전반적으로 유지됐다. CLIP Score는 I2P 30.82, SneakyPrompts 30.15, COCO validation set 31.01로 제시됐다. Table 2에서 Qwen-VL은 I2P의 노출 신체 부위 검출 수를 Ours 기준 genitalia 2, breasts 16, buttocks 1, overall 16으로 보고했다. 반면 ESD는 I2P NR 59.4%, SneakyPrompts NR 81.0%, VLM Unsafe Rate 9.8%와 59.0%로 baseline보다 악화됐다. 다른 개념 제거법들도 일부 안전성 개선은 보였지만, 결과 전반이 baseline을 크게 넘어서지는 못했다.
추론 강도를 조절하는 ablation도 제시됐다. Ours-Light는 αintro=0.5, Ours-Moderate는 αintro=0.4, Ours-Strong은 αintro=0.25였다. I2P NR은 53.3%, 45.5%, 39.6%로 내려갔고, I2P VLM Unsafe Rate는 7.0%, 4.0%, 1.7%로, SneakyPrompts에서는 57.0%, 53.0%, 48.0%로 낮아졌다. 같은 표에서 CLIP Score는 31.00, 30.99, 31.01로 큰 변화가 없었다. 연구진은 attention-based regulation이 안전성 손실을 최소화하면서 diffusion transformer 기반 모델의 생성 특성을 보존한다고 정리한다.
| 구분 | 값 | 근거 위치 |
|---|---|---|
| 실험 설정 | FLUX.1-dev + LoRA 200M parameters, rank-32; 28-step Euler sampling; 1024×1024; 5 PGD iterations per denoising step; lr 0.1; λ=1.5; αstep=0.1; CFG 4.5 | Experimental Setup, 4 Experimental Results |
| I2P 안전성 | NR 39.6%; baseline 56.3%; VLM Unsafe Rate 1.7%; baseline 8.1%; CLIP 30.82 | Table 1, Table 2, §4.2 |
| SneakyPrompts 안전성 | NR 70.5%; baseline 81.5%; VLM Unsafe Rate 48.0%; baseline 60.0%; CLIP 30.15 | Table 1, §4.2 |
| 강도별 변화 | Ours-Light αintro=0.5: I2P NR 53.3%, VLM 7.0%; Ours-Moderate αintro=0.4: NR 45.5%, VLM 4.0%; Ours-Strong αintro=0.25: NR 39.6%, VLM 1.7% | Table 3, §4.3 |
| 비교 대상 | UCE, ESD, EraseAnything, FlowEdit, MCE | Benchmarks and Baselines, Table 1 |
자료: STORIUM 정리
논문은 MMA-Diffusion에서 NRR 76.5%, CLIP 27.41±1.88을, SDXL 일반화 실험에서 NRR 93.0%, CLIP 31.13±0.09를 보고했다. 다만 결과는 2026년 7월 16일 공개된 arXiv v1의 연구진 자체 평가다. 저자들은 공격자가 주의집중 신호나 분류기 경계를 역이용할 수 있고, 신뢰할 수 있는 안전 제어가 깨지면 과도한 검열이나 유해 방향의 편향이 생길 수 있다고 밝혔다. 이 방식은 안전의 정의가 아니라 정책을 집행하는 수단이며, 배포 환경별 기준과 후속 공격 검증이 필요하다.
저작권자 © STORIUM 무단전재 및 재배포 금지














