• AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
STORIUM
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의
No Result
View All Result
STORIUM
No Result
View All Result

홍콩시티대, 프로덕션 AI 에이전트 취약점을 지식 그래프로 축적하는 AHA 제안

유지율 리포터 작성: 유지율 리포터
2026년 07월 15일 11시 17분
Reading Time: 2 mins read
A A
Home AI 모델·연구
Share on FacebookShare on Twitter

코드 작성과 도구 실행 권한을 가진 AI 에이전트는 유해한 문장을 내놓는 데서 그치지 않고 파일 변경이나 데이터 유출 같은 실제 행동으로 이어질 수 있다. 홍콩시티대 연구진은 프로덕션 에이전트 레드팀을 반복 가능한 연구 과정으로 바꾸는 AHA를 제안했다. 개별 공격 문자열을 보관하는 대신, 어떤 조건에서 안전장치가 무너졌는지를 감사 가능한 취약점 개념으로 축적하는 접근이다.

AHA는 취약점 가설을 먼저 세우고 이를 깨뜨릴 반증 조건을 정의한 뒤, 시나리오에 맞는 공격을 샌드박스에서 실행하고 궤적을 되짚는다. 확인된 결과만 취약점 개념 그래프(VCG)에 올린다. 각 노드는 주장, 성립 조건, 반증자, 다른 환경으로의 전이 예측, 증거를 함께 담는다. 평가 때는 그래프를 고정하고 인스턴스마다 공격을 한 번만 생성해 재검색이나 재시도를 허용하지 않았다.

AHA 논문의 시나리오 및 피해 모델 간 취약점 개념 그래프 전이 성능 막대그래프
Figure 4: 고정 VCG의 시나리오 간·피해 모델 간 전이 공격 성공률. 출처: 원문

실험은 Claude Code와 Codex 에이전트, MiniMax-M2.7·Kimi-K2.6·DeepSeek-V4-Pro 피해 모델, AgentHazard·AgentDyn·DTap 세 시나리오를 조합했다. 직접 공격과 간접 프롬프트 주입을 함께 다뤘으며, T-MAP·IterInject·AutoRISE가 남긴 고정 산출물과 같은 단일 시도 조건에서 비교했다. AHA의 전체 평균 공격 성공률은 47.0%로 가장 강한 고정 탐색 기준의 32.8%보다 14.2%포인트 높았다. Claude Code만 보면 50.0% 대 36.5%였다.

그래프에는 모델과 에이전트를 넘어 반복되는 공통 구조도 나타났다. ‘주장된 권한’ 계열은 18개 설정 중 16개에서 발견됐고, 간접 공격 설정 12개 중 9개에서는 작업 목표 가로채기가 공통 핵심으로 관찰됐다. 다른 시나리오로 옮긴 고정 VCG는 방향에 따라 평균 7.7~53.7% 성공률을 보였고, 다른 피해 모델로 전이한 여섯 조합은 대상 모델 자체 VCG 성공률의 평균 88%에 도달했다.

반증자·에피소드 간 메모리·주기적 비평을 하나씩 제거한 실험은 탐색 당시 성공률보다 고정 후 재현성이 더 민감하게 떨어짐을 보였다. 비평을 제거하면 AgentHazard의 유효 개념 수가 10개에서 7개로, 고정 평가 성공률이 75.56%에서 57.78%로 낮아졌다. 이는 많이 뚫는 것과 다시 검증되는 취약점 지식을 남기는 일이 다르다는 연구진의 해석을 뒷받침한다.

항목 논문 결과 원문 근거
평가 조합 피해 에이전트 2종·피해 모델 3종·시나리오 3종 Sec. 4.4, PDF pp.8–9
고정 단일 시도 전체 평균 ASR AHA 47.0%, 최강 고정 탐색 기준 32.8% Sec. 5.2, Table 2, PDF p.11
Claude Code 평균 비교 AHA 50.0%, 최강 기준 36.5% Sec. 5.2, PDF p.11
공통 취약점 계열 주장된 권한: 18개 설정 중 16개 Sec. 5.1, Figure 3, PDF p.10
모델 간 전이 외부 VCG가 대상 자체 ASR의 평균 88% 도달 Sec. 5.4, Figure 4, PDF p.13

자료: STORIUM 정리

다만 결과는 세 벤치마크와 세 피해 모델, 두 코딩 에이전트에 한정된 동료검토 전 arXiv v1이다. Codex의 DTap 평가에서는 일부 비 OpenAI 백엔드 도구 호출이 라우팅 문제로 불안정했고, 공격 성공 판정 역시 자동 심판과 연구진이 설계한 샌드박스에 의존한다. 실제 제품 패치 뒤의 장기 재현성, 더 다양한 권한 체계와 사용자 환경에서의 방어 효과는 별도 검증이 필요하다.

1차 출처: https://arxiv.org/abs/2607.11698

저작권자 © STORIUM 무단전재 및 재배포 금지

유지율 리포터

유지율 리포터

안녕하세요, 유지율 리포터입니다. arXiv와 학회에서 쏟아지는 AI 연구를 살펴, 논문 속 성과를 과장 없이 우리말로 풀어 드립니다. 사실관계는 발행 전 편집인이 함께 확인합니다.

관련 기사

엔비디아 미국 본사 건물
정책·윤리

엔비디아·37개 창립 파트너, Open Secure AI Alliance 출범

2026년 07월 28일 19시 45분
미국 연방 로비가 이뤄지는 워싱턴 의사당 공식 사진
정책·윤리

미 주요 기술·AI 기업·단체 11곳, 상반기 로비 4,180만달러

2026년 07월 28일 18시 46분
다리오 아모데이 앤트로픽 CEO의 2023년 TechCrunch 행사 자료사진
정책·윤리

Claude 공개 공유 대화 일부 검색 노출…비공개 자동 유출과는 달라

2026년 07월 28일 17시 53분
일리야 수츠케버가 참석한 2014년 스탠퍼드 대담 자료사진
스타트업·투자

SSI, 엔비디아 Vera Rubin 도입…연산 자원 10배 확대

2026년 07월 28일 16시 20분
Next Post
MINES Paris - PSL 공식 로고

Mines Paris–PSL·CNRS, 13개 유동제어 벤치마크에서 Codex 기반 명시적 제어법 탐색

답글 남기기 응답 취소

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다

  • 인기 급상승
  • 최신
Close-up of a GeForce RTX graphics card on a desk, showcasing its design and technology.

엔비디아 RTX 스파크 가격, 최소 2000달러 전망…윈도 노트북 ‘M1 모먼트’ 걸림돌

2026년 06월 02일 11시 19분
A 3D rendering of a neural network with abstract neuron connections in soft colors.

퍼플렉시티, 로컬·클라우드 AI를 자동 판단하는 하이브리드 추론 시스템 발표

2026년 06월 04일 08시 53분
Contemporary building with a glass facade and geometric patterns, low angle view.

앤트로픽·네이버 개발자 밋업 개최…서울 오피스 개소 앞두고 본사 임원 참석

2026년 06월 06일 21시 12분
책상에서 법률 문서에 서명하는 모습

클로드 ‘드리밍’ 기능 공개…앤트로픽, 법률·의료 AI 성능 대폭 향상

2026년 05월 30일 21시 11분
Close-up of a wooden gavel on a judge's desk, symbolizing justice.

AI 생성 성인 콘텐츠 유료 판매 운영자들, 법원서 잇달아 징역형

2026년 06월 05일 22시 40분
엔비디아 미국 본사 건물

엔비디아·37개 창립 파트너, Open Secure AI Alliance 출범

2026년 07월 28일 19시 45분
미국 연방 로비가 이뤄지는 워싱턴 의사당 공식 사진

미 주요 기술·AI 기업·단체 11곳, 상반기 로비 4,180만달러

2026년 07월 28일 18시 46분
다리오 아모데이 앤트로픽 CEO의 2023년 TechCrunch 행사 자료사진

Claude 공개 공유 대화 일부 검색 노출…비공개 자동 유출과는 달라

2026년 07월 28일 17시 53분
일리야 수츠케버가 참석한 2014년 스탠퍼드 대담 자료사진

SSI, 엔비디아 Vera Rubin 도입…연산 자원 10배 확대

2026년 07월 28일 16시 20분
중국 항저우 앤트그룹 A Space 건물

앤트그룹 Ling-3.0-Flash 공개…1,240억개 중 51억개 활성

2026년 07월 28일 15시 07분

검색

No Result
View All Result

인기 태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 멀티에이전트 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI

카테고리

  • AI 모델·연구 (1,482)
  • AI 서비스·툴 (826)
  • 반도체·인프라 (537)
  • 빅테크·기업 (566)
  • 산업 적용 (415)
  • 스타트업·투자 (251)
  • 정책·윤리 (455)

STORIUM은 트렌드와 인사이트를 전하는 종합 뉴스 매체입니다. 정확성, 균형, 맥락의 편집 원칙으로 신뢰받는 뉴스를 전합니다.

카테고리

  • AI 모델·연구
  • AI 서비스·툴
  • 반도체·인프라
  • 빅테크·기업
  • 산업 적용
  • 스타트업·투자
  • 정책·윤리

태그

AI규제 AI반도체 AI보안 AI안전 AI에이전트 AI연구 AI인프라 AI정책 Anthropic arXiv AWS ChatGPT Claude Gemini HBM IPO LLM MCP NVIDIA OpenAI RAG SK하이닉스 강화학습 구글 데이터센터 마이크로소프트 멀티모달 멀티에이전트 메타 반도체 벤치마크 사이버보안 삼성전자 생성AI 생성형AI 스타트업 앤트로픽 에이전트 에이전틱AI 엔비디아 오픈AI 오픈소스 의료AI 자율주행 피지컬AI

최근 뉴스

엔비디아 미국 본사 건물

엔비디아·37개 창립 파트너, Open Secure AI Alliance 출범

2026년 07월 28일 19시 45분
미국 연방 로비가 이뤄지는 워싱턴 의사당 공식 사진

미 주요 기술·AI 기업·단체 11곳, 상반기 로비 4,180만달러

2026년 07월 28일 18시 46분
  • 소개
  • 문의
  • 광고문의
  • 개인정보처리방침
  • 이용약관
  • 청소년보호정책
  • 정정·반론 보도 안내
  • 편집·윤리강령

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.

No Result
View All Result
  • AI 모델·연구
  • 빅테크·기업
  • 반도체·인프라
  • 산업 적용
  • AI 서비스·툴
  • 정책·윤리
  • 스타트업·투자
  • 문의

주소: 경기 고양시 덕양구 꽃마을로 66, 한일미디어타워 15층
상호: 스토리움 |  사업자등록번호: 579-27-02025 |  대표자: 이국환
발행·편집인: 이국환 |  청소년보호책임자: 이국환 |  발행일자: 2025.01.01
스토리움의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재·복사·배포 등은 법적 제재를 받을 수 있습니다.
© 2026 STORIUM. All Rights Reserved.