
AI 안전 담론은 대체로 눈에 띄는 실패에 집중해 왔다. 노골적 피해, 악용, 대형 재난 시나리오가 논의의 중심에 놓이지만, 이 논문은 실제 배치 환경에서 더 큰 문제는 조용한 실패라고 본다. 하나의 출력에서 드러나지 않고 여러 구성요소에 분산되며, 워크플로에 흡수된 뒤에야 위험으로 인식되는 경우가 많다는 것이다. 이 글은 arXiv 프리프린트로, 모델이 해로운 응답을 내놓는지뿐 아니라 더 넓은 사회기술 시스템이 오류를 보이게 하고, 이의제기 가능하게 하고, 통제 가능하게 하고, 복구 가능하게 만드는지에 초점을 옮긴다.
핵심 제안은 다섯 층 프레임워크다. 인식 무결성은 증거와 불확실성이 신뢰 가능한 의존을 뒷받침할 만큼 정직하게 표현되는지 묻는다. 통제 무결성은 권한, 허가, 행동 경계가 공격과 최적화 압력 아래에서도 유지되는지 살핀다. 시간 무결성은 세션, 기억 업데이트, 배치 드리프트 전반에서 안전이 유지되는지를 다룬다. 조직 무결성은 기관이 감사하고 책임을 배정하며 개입할 역량을 유지하는지, 생태계 무결성은 미래의 감시를 떠받치는 정보 환경이 보존되는지를 본다.
이 틀 아래에서 논문은 여러 위험 패턴을 묶어 제시한다. 과도한 신뢰, 검색 기반 생성에서의 불확실성·정당성 세탁, 프롬프트 인젝션, 보상 해킹, 메모리 오염, 평가 기만, 가짜 인간 감독, 합성 증거 오염, 모델 붕괴가 그 예다. p.5에서는 RAG가 환각을 줄이면서도 잘못된 확신을 키울 수 있다고 적고, p.6에서는 간접 프롬프트 인젝션이 실제 LLM 통합 응용을 훼손할 수 있다고 설명한다. p.9~10은 벤치마크 점수만으로는 분포 이동, 다중 턴 상호작용, 도구 사용, 적대적 적응, 조직적 오남용을 충분히 드러내지 못한다고 지적한다.
관점의 무게중심은 출력 그 자체보다 오류를 잡아내고 다투고 고치는 능력에 있다. p.12는 가장 중대한 실패가 단일 재난 출력이 아니라 사회와 기관의 오류 수정 역량이 약화되는 것일 수 있다고 말한다. AI 생성물이 핵심 업무 흐름을 채우면 추적성, contestability, 전문성, 책임성이 배포 경로 전반에서 약해질 수 있고, 그 결과 모델 수준의 작은 오류율도 제도적 취약성으로 확대될 수 있다는 주장이다. p.11은 신뢰할 수 있는 검색이 답변 정확도만이 아니라 출처 추적, 투명성, 설명가능성, 책임성, 프라이버시까지 포함해 평가돼야 한다고 제안한다.
논문의 후반부는 설계와 거버넌스 권고로 이어진다. 벤치마크 중심 평가를 구조화된 safety case와 명시적 보증 논증으로 보완하고, 적대적·궤적 수준 시험, 인간요인 증거, 사건 이력, 잔여 위험 진술, 감사 접근을 함께 보라는 제안이다. p.15~16은 다중 턴·도구 매개·시간 확장 시나리오, 지속 모니터링, 사건 훈련, 배포 후 회귀시험, 그리고 충분한 시간·증거·권한·조직 지원이 있는 독립적 검토가 필요하다고 적는다. p.19는 제안한 층과 지표가 실제 환경에서 탐지성·이의제기 가능성·복구 가능성을 높이는지 후속 검증이 필요하다고 밝힌다.
| Layer | 핵심 질문 | 본문의 위험 예시 | source_locator |
|---|---|---|---|
| Epistemic integrity | 증거와 불확실성이 칼리브레이션된 의존을 뒷받침하도록 정직하게 표현되는가 | overreliance, uncertainty and legitimacy laundering in retrieval | p.1 abstract; p.5 source_excerpt |
| Control integrity | 권한·허가·행동 경계가 공격과 최적화 압력 아래서 유지되는가 | prompt injection, reward hacking | p.1 abstract; p.6 source_excerpt; p.15 source_excerpt |
| Organizational integrity | 기관이 감사·책임 배정·개입 능력을 유지하는가 | evaluation deception, fictional oversight, diffused accountability | p.1 abstract; p.9 source_excerpt; p.10 source_excerpt |
| Ecosystem integrity | AI가 미래의 감시를 떠받치는 정보 환경을 보존하는가 | synthetic evidence pollution, model collapse | p.1 abstract; p.11 source_excerpt; p.12 source_excerpt |
자료: STORIUM 정리
요약하면, 이 프리프린트는 AI 안전을 모델 중심 성능평가에서 사회기술적 신뢰성으로 옮기자는 문제제기다. 눈에 띄는 실패를 잡는 데서 멈추지 말고, 실패가 보이고 다뤄지고 회복될 조건 자체를 지키는 것이 핵심이라는 주장이다. 기술적 결함만이 아니라 제도와 정보 생태계의 손상까지 안전의 범주에 넣어야 한다는 점에서, 현대 AI 시스템의 위험 지도는 더 넓게 다시 그려져야 한다고 이 글은 말한다.
저작권자 © STORIUM 무단전재 및 재배포 금지










